免费注册 查看新帖 |

Chinaunix

  平台 论坛 博客 文库
123
最近访问板块 发新帖
楼主: _lpq
打印 上一主题 下一主题

[文本处理] 如何提取多个字符串 [复制链接]

论坛徽章:
1
15-16赛季CBA联赛之广夏
日期:2016-04-12 15:53:16
21 [报告]
发表于 2016-03-15 09:30 |只看该作者
回复 20# moperyblue


    首先谢谢你。

你的是:
sed -r 's/^(([^,]*,){2})([^,]*),\3/\1\3,/'


然后我用我改后的
sed -r 's/^(([^,]*,){2})([^,]*),\7/\1\7,/'

我的文本是

rOedde,C6KRdfr,ZSF,grt,4243,seffvv,13:56:39,13:54:09,30,ok
fr4cd3c,C6KR3J,ZSF,grt,2344,vdfvvx,13:59:48,13:59:48,,
CQ5vgf,KGRY7D,ZSF,grt,2144,frefdf,13:57:04,13:59:48,164,ok
f3yfvde,gDDAcd,ZSF,grt,4527,ferffrf,13:57:12,13:59:54,162,ok
CSfcdc,H7GRY7,ZSF,grt,1986,dewff,13:59:45,13:59:54,9,ok
duede,MGGRY7,ZSF,grt,6547,zcxcz,13:59:57,13:59:57,,
DE4ffe,EXTGR7,ZSF,grt,5435,Psfref,13:59:27,13:59:58,31,ok
Ccfd3f,FKGRY7,ZSF,grt,8675,fefsfs,13:59:54,14:00:01,7,ok


我要变成这样:
rOedde,C6KRdfr,ZSF,grt,4243,seffvv,13:56:39,13:54:09,30,ok
fr4cd3c,C6KR3J,ZSF,grt,2344,vdfvvx,13:59:48,,,
CQ5vgf,KGRY7D,ZSF,grt,2144,frefdf,13:57:04,13:59:48,164,ok
f3yfvde,gDDAcd,ZSF,grt,4527,ferffrf,13:57:12,13:59:54,162,ok
CSfcdc,H7GRY7,ZSF,grt,1986,dewff,13:59:45,13:59:54,9,ok
duede,MGGRY7,ZSF,grt,6547,zcxcz,13:59:57,,,
DE4ffe,EXTGR7,ZSF,grt,5435,Psfref,13:59:27,13:59:58,31,ok
Ccfd3f,FKGRY7,ZSF,grt,8675,fefsfs,13:59:54,14:00:01,7,ok

在我自己的要处理的文件中使用
报错:
sed: -e expression #1, char 33:Invalid back reference

是时间为数字的原因?

论坛徽章:
28
15-16赛季CBA联赛之八一
日期:2016-02-22 19:10:4215-16赛季CBA联赛之深圳
日期:2016-12-01 10:34:0415-16赛季CBA联赛之新疆
日期:2016-12-07 10:24:2915-16赛季CBA联赛之同曦
日期:2016-12-15 12:06:43CU十四周年纪念徽章
日期:2016-12-18 13:03:4415-16赛季CBA联赛之吉林
日期:2017-01-03 15:52:2515-16赛季CBA联赛之辽宁
日期:2017-01-04 14:58:2415-16赛季CBA联赛之辽宁
日期:2017-01-15 09:42:512016科比退役纪念章
日期:2017-02-06 17:21:50黑曼巴
日期:2017-02-10 15:46:1215-16赛季CBA联赛之上海
日期:2017-03-18 10:14:5415-16赛季CBA联赛之青岛
日期:2017-03-18 22:00:44
22 [报告]
发表于 2016-03-15 09:44 |只看该作者
本帖最后由 moperyblue 于 2016-03-15 09:49 编辑
  1. sed -r 's/^(([^,]*,){6})([^,]*),\3/\1\3,/'
复制代码
请补补正则基础知识

回复 21# _lpq


   

论坛徽章:
1
15-16赛季CBA联赛之广夏
日期:2016-04-12 15:53:16
23 [报告]
发表于 2016-03-15 09:57 |只看该作者
回复 22# moperyblue

对于这句:
    sed -r 's/^(([^,]*,){2})([^,]*),\3/\1\3,/'

我的理解是:
就是{2}是表示2个,中间那一段就是除了两个相同的项,

我错了,,,,

论坛徽章:
28
15-16赛季CBA联赛之八一
日期:2016-02-22 19:10:4215-16赛季CBA联赛之深圳
日期:2016-12-01 10:34:0415-16赛季CBA联赛之新疆
日期:2016-12-07 10:24:2915-16赛季CBA联赛之同曦
日期:2016-12-15 12:06:43CU十四周年纪念徽章
日期:2016-12-18 13:03:4415-16赛季CBA联赛之吉林
日期:2017-01-03 15:52:2515-16赛季CBA联赛之辽宁
日期:2017-01-04 14:58:2415-16赛季CBA联赛之辽宁
日期:2017-01-15 09:42:512016科比退役纪念章
日期:2017-02-06 17:21:50黑曼巴
日期:2017-02-10 15:46:1215-16赛季CBA联赛之上海
日期:2017-03-18 10:14:5415-16赛季CBA联赛之青岛
日期:2017-03-18 22:00:44
24 [报告]
发表于 2016-03-15 11:20 |只看该作者
本帖最后由 moperyblue 于 2016-03-15 11:47 编辑

回复 23# _lpq

如 这行数据:s,f,o,o,l

^(([^,]*,){2})  => 前面两个"XXX," => s,f,
中间的([^,]*) => 第三个"XXX" => 第一个 o
   

论坛徽章:
1
15-16赛季CBA联赛之广夏
日期:2016-04-12 15:53:16
25 [报告]
发表于 2016-03-15 15:25 |只看该作者
回复 24# moperyblue


    学习了
您需要登录后才可以回帖 登录 | 注册

本版积分规则 发表回复

  

北京盛拓优讯信息技术有限公司. 版权所有 京ICP备16024965号-6 北京市公安局海淀分局网监中心备案编号:11010802020122 niuxiaotong@pcpop.com 17352615567
未成年举报专区
中国互联网协会会员  联系我们:huangweiwei@itpub.net
感谢所有关心和支持过ChinaUnix的朋友们 转载本站内容请注明原作者名及出处

清除 Cookies - ChinaUnix - Archiver - WAP - TOP