免费注册 查看新帖 |

Chinaunix

  平台 论坛 博客 文库
12下一页
最近访问板块 发新帖
查看: 2605 | 回复: 15
打印 上一主题 下一主题

[文本处理] 求助,awk文本处理 [复制链接]

论坛徽章:
0
跳转到指定楼层
1 [收藏(0)] [报告]
发表于 2015-02-05 11:25 |只看该作者 |倒序浏览
本帖最后由 xiaoxiao_不想吃药 于 2015-02-05 11:26 编辑

一个txt中有几百行如下:
string1:abdla;string2: |09 08 06|;string3: |01|;string4: |02 ac bd 1f|;string5: |00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00|;
我想用awk处理成这样string1:abdla;string2:\x09\x08\x06;string3:\x01;string4:\x02\xac\xbd\x1f;string5:\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00;
该怎么写呢。

论坛徽章:
769
金牛座
日期:2014-02-26 17:49:58水瓶座
日期:2014-02-26 18:10:15白羊座
日期:2014-04-15 19:29:52寅虎
日期:2014-04-17 19:43:21酉鸡
日期:2014-04-19 21:24:10子鼠
日期:2014-04-22 13:55:24卯兔
日期:2014-04-22 14:20:58亥猪
日期:2014-04-22 16:13:09狮子座
日期:2014-05-05 22:31:17摩羯座
日期:2014-05-06 10:32:53处女座
日期:2014-05-12 09:23:11子鼠
日期:2014-05-21 18:21:27
2 [报告]
发表于 2015-02-05 11:37 |只看该作者
回复 1# xiaoxiao_不想吃药
  1. echo "string1:abdla;string2: |09 08 06|;string3: |01|;string4: |02 ac bd 1f|;string5: |00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00|;"|sed -r 's/\<[0-9a-f]{2}\>/\\x&/g;s/\||\s//g'
  2. string1:abdla;string2:\x09\x08\x06;string3:\x01;string4:\x02\xac\xbd\x1f;string5:\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00;
复制代码

求职 : 机器学习
论坛徽章:
79
2015年亚洲杯纪念徽章
日期:2015-05-06 19:18:572015七夕节徽章
日期:2015-08-21 11:06:172015亚冠之阿尔纳斯尔
日期:2015-09-07 09:30:232015亚冠之萨济拖拉机
日期:2015-10-21 08:26:3915-16赛季CBA联赛之浙江
日期:2015-12-30 09:59:1815-16赛季CBA联赛之浙江
日期:2016-01-10 12:35:21技术图书徽章
日期:2016-01-15 11:07:2015-16赛季CBA联赛之新疆
日期:2016-02-24 13:46:0215-16赛季CBA联赛之吉林
日期:2016-06-26 01:07:172015-2016NBA季后赛纪念章
日期:2016-06-28 17:44:45黑曼巴
日期:2016-06-28 17:44:4515-16赛季CBA联赛之浙江
日期:2017-07-18 13:41:54
3 [报告]
发表于 2015-02-05 11:42 |只看该作者
本帖最后由 zsszss0000 于 2015-02-05 11:46 编辑

awk 我不会处理这个问题,但是感觉这种字符替换的用sed挺方便的,LZ可以不?
  1. sed 's/|//g;s/\([0-9a-z][0-9a-z]\)/\\x\1/g' urfile
复制代码
测试了下 我这个错了

论坛徽章:
0
4 [报告]
发表于 2015-02-05 11:58 |只看该作者
sed 's/|//g;s/ /\\x/g' a

论坛徽章:
0
5 [报告]
发表于 2015-02-05 12:00 |只看该作者
回复 2# Herowinter
如果string: 15;string1: 78 1a 02 45;string2: |09 08 06|;string3: |01|;string4: |02 ac bd 1f|;string5: |00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00|; 只替换| 之间的内容呢?

   

论坛徽章:
0
6 [报告]
发表于 2015-02-05 12:02 |只看该作者
回复 3# zsszss0000
只替换两个 |  |之间的内容,该怎么办呢?



   

论坛徽章:
769
金牛座
日期:2014-02-26 17:49:58水瓶座
日期:2014-02-26 18:10:15白羊座
日期:2014-04-15 19:29:52寅虎
日期:2014-04-17 19:43:21酉鸡
日期:2014-04-19 21:24:10子鼠
日期:2014-04-22 13:55:24卯兔
日期:2014-04-22 14:20:58亥猪
日期:2014-04-22 16:13:09狮子座
日期:2014-05-05 22:31:17摩羯座
日期:2014-05-06 10:32:53处女座
日期:2014-05-12 09:23:11子鼠
日期:2014-05-21 18:21:27
7 [报告]
发表于 2015-02-05 12:09 |只看该作者
回复 3# zsszss0000

awk一样的,要精确指定替换2位的数字,就要加--re-interval,这种不涉及列操作的需求
用awk没优势.
  1. echo "string1:abdla;string2: |09 08 06|;string3: |01|;string4: |02 ac bd 1f|;string5: |00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00|;"|awk '{gsub(/\<[0-9a-f]+\>/,"\\x&");gsub(/\||[[:space:]]/,"")}1'
  2. string1:abdla;string2:\x09\x08\x06;string3:\x01;string4:\x02\xac\xbd\x1f;string5:\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00;
复制代码

论坛徽章:
145
技术图书徽章
日期:2013-10-01 15:32:13戌狗
日期:2013-10-25 13:31:35金牛座
日期:2013-11-04 16:22:07子鼠
日期:2013-11-18 18:48:57白羊座
日期:2013-11-29 10:09:11狮子座
日期:2013-12-12 09:57:42白羊座
日期:2013-12-24 16:24:46辰龙
日期:2014-01-08 15:26:12技术图书徽章
日期:2014-01-17 13:24:40巳蛇
日期:2014-02-18 14:32:59未羊
日期:2014-02-20 14:12:13白羊座
日期:2014-02-26 12:06:59
8 [报告]
发表于 2015-02-05 12:13 |只看该作者
本帖最后由 jason680 于 2015-02-05 12:24 编辑

回复 1# xiaoxiao_不想吃药

$ awk -F' *\\|' '{for(n=2;n<NF;n+=2){$n=" "$n;$n=gensub(" ([^ ]+)","\\\\x\\1","g",$n)}print $0}' OFS="" FILE
string1:abdla;string2:\x09\x08\x06;string3:\x01;string4:\x02\xac\xbd\x1f;string5:\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00;


$ awk -F' *\\|' '{for(n=2;n<NF;n+=2){$n=" "$n;gsub(" ","\\x")}print $0}' OFS="" FILE
string1:abdla;string2:\x09\x08\x06;string3:01;string4:02\xac\xbd\x1f;string5:00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00\x00;

   

求职 : 机器学习
论坛徽章:
79
2015年亚洲杯纪念徽章
日期:2015-05-06 19:18:572015七夕节徽章
日期:2015-08-21 11:06:172015亚冠之阿尔纳斯尔
日期:2015-09-07 09:30:232015亚冠之萨济拖拉机
日期:2015-10-21 08:26:3915-16赛季CBA联赛之浙江
日期:2015-12-30 09:59:1815-16赛季CBA联赛之浙江
日期:2016-01-10 12:35:21技术图书徽章
日期:2016-01-15 11:07:2015-16赛季CBA联赛之新疆
日期:2016-02-24 13:46:0215-16赛季CBA联赛之吉林
日期:2016-06-26 01:07:172015-2016NBA季后赛纪念章
日期:2016-06-28 17:44:45黑曼巴
日期:2016-06-28 17:44:4515-16赛季CBA联赛之浙江
日期:2017-07-18 13:41:54
9 [报告]
发表于 2015-02-05 12:58 |只看该作者
本帖最后由 zsszss0000 于 2015-02-05 13:15 编辑
sed -r 's/\<[0-9a-f]{2}\>/\\x&/g;s/\||\s//g'

我想问一下,这里的\<\>表示什么含义?
是不是可以理解为\<\>之间的内容必须是紧紧相邻的呢?
我在sed and awk 101 hacks这本书中没有见过这种用法
我的理解是和\b符号一致的,也就是是不是可以改写为
sed -r 's/\b[0-9a-f]{2}\b/\\x&/g;s/\||\s//g'
回复 2# Herowinter


   

论坛徽章:
769
金牛座
日期:2014-02-26 17:49:58水瓶座
日期:2014-02-26 18:10:15白羊座
日期:2014-04-15 19:29:52寅虎
日期:2014-04-17 19:43:21酉鸡
日期:2014-04-19 21:24:10子鼠
日期:2014-04-22 13:55:24卯兔
日期:2014-04-22 14:20:58亥猪
日期:2014-04-22 16:13:09狮子座
日期:2014-05-05 22:31:17摩羯座
日期:2014-05-06 10:32:53处女座
日期:2014-05-12 09:23:11子鼠
日期:2014-05-21 18:21:27
10 [报告]
发表于 2015-02-05 13:14 |只看该作者
回复 5# xiaoxiao_不想吃药
  1. echo "string: 15;string1: 78 1a 02 45;string2: |09 08 06|;string3: |01|;string4: |02 ac bd 1f|;string5: |00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00 00|;"|awk -F'|' --re-interval 'NF>2{for(i=2;i<NF;i++)gsub(/\<[0-9a-f]{2}\>/,"\\x&",$i);gsub(/[[:space:]]/,"")}1'
复制代码
您需要登录后才可以回帖 登录 | 注册

本版积分规则 发表回复

  

北京盛拓优讯信息技术有限公司. 版权所有 京ICP备16024965号-6 北京市公安局海淀分局网监中心备案编号:11010802020122 niuxiaotong@pcpop.com 17352615567
未成年举报专区
中国互联网协会会员  联系我们:huangweiwei@itpub.net
感谢所有关心和支持过ChinaUnix的朋友们 转载本站内容请注明原作者名及出处

清除 Cookies - ChinaUnix - Archiver - WAP - TOP