免费注册 查看新帖 |

Chinaunix

  平台 论坛 博客 文库
最近访问板块 发新帖
楼主: 方兆国儿
打印 上一主题 下一主题

[文本处理] 截取网址 [复制链接]

论坛徽章:
4
15-16赛季CBA联赛之北控
日期:2016-12-06 11:11:0115-16赛季CBA联赛之广夏
日期:2016-12-06 15:04:1515-16赛季CBA联赛之四川
日期:2016-12-06 15:59:51黑曼巴
日期:2016-12-09 20:24:05
71 [报告]
发表于 2016-12-09 16:41 |只看该作者
回复 55# moperyblue


Reference: http://www.gnu.org/software/gawk/manual/gawk.html#Regexp
所以,只是重复前面正则的匹配次数而已;可是,结果却是,仅仅匹配到了最后两组内容;请教,为什么不是,匹配到前两组,前两组为什么不符合该正则呢?实在没明白!

屏幕快照 2016-12-09 下午4.38.36.png (168.03 KB, 下载次数: 33)

屏幕快照 2016-12-09 下午4.38.36.png

论坛徽章:
4
15-16赛季CBA联赛之北控
日期:2016-12-06 11:11:0115-16赛季CBA联赛之广夏
日期:2016-12-06 15:04:1515-16赛季CBA联赛之四川
日期:2016-12-06 15:59:51黑曼巴
日期:2016-12-09 20:24:05
72 [报告]
发表于 2016-12-09 16:43 |只看该作者
回复 56# sditmaner

感谢解答,您能帮我解释一下吗,55

论坛徽章:
307
程序设计版块每周发帖之星
日期:2016-04-08 00:41:33操作系统版块每日发帖之星
日期:2015-09-02 06:20:00每日论坛发贴之星
日期:2015-09-02 06:20:00程序设计版块每日发帖之星
日期:2015-09-04 06:20:00每日论坛发贴之星
日期:2015-09-04 06:20:00每周论坛发贴之星
日期:2015-09-06 22:22:00程序设计版块每日发帖之星
日期:2015-09-09 06:20:00程序设计版块每日发帖之星
日期:2015-09-19 06:20:00程序设计版块每日发帖之星
日期:2015-09-20 06:20:00每日论坛发贴之星
日期:2015-09-20 06:20:00程序设计版块每日发帖之星
日期:2015-09-22 06:20:00程序设计版块每日发帖之星
日期:2015-09-24 06:20:00
73 [报告]
发表于 2016-12-09 17:00 |只看该作者
回复 59# 方兆国儿
awk '{match($0,/.*"(GET|POST|CONNECT) (https?:\/\/)?[^/]*((\.[^/:]*){2})/,a)}!b[a[3]]++{print a[3]}' cu.txt

红色部分的正则会一直取到后面HTTP("/"之前)为止,  但中间最后这组.qq.com符合条件所以会被保留下来
回溯!


评分

参与人数 1信誉积分 +10 收起 理由
方兆国儿 + 10 赞一个!

查看全部评分

论坛徽章:
28
15-16赛季CBA联赛之八一
日期:2016-02-22 19:10:4215-16赛季CBA联赛之深圳
日期:2016-12-01 10:34:0415-16赛季CBA联赛之新疆
日期:2016-12-07 10:24:2915-16赛季CBA联赛之同曦
日期:2016-12-15 12:06:43CU十四周年纪念徽章
日期:2016-12-18 13:03:4415-16赛季CBA联赛之吉林
日期:2017-01-03 15:52:2515-16赛季CBA联赛之辽宁
日期:2017-01-04 14:58:2415-16赛季CBA联赛之辽宁
日期:2017-01-15 09:42:512016科比退役纪念章
日期:2017-02-06 17:21:50黑曼巴
日期:2017-02-10 15:46:1215-16赛季CBA联赛之上海
日期:2017-03-18 10:14:5415-16赛季CBA联赛之青岛
日期:2017-03-18 22:00:44
74 [报告]
发表于 2016-12-09 17:12 |只看该作者
本帖最后由 moperyblue 于 2016-12-09 18:22 编辑

回复 59# 方兆国儿

echo ' "CONNECT js.aq.qq.com:443 HTTP/1.1                        
"CONNECT js.aq.qq.com/xxx HTTP/1.1
"CONNECT js.aq.qq.com:443 HTTP/1.1'|sed -r 's/([^/]*)/(\1)/'
( "CONNECT js.aq.qq.com:443 HTTP)/1.1
( "CONNECT js.aq.qq.com)/xxx HTTP/1.1
( "CONNECT js.aq.qq.com:443 HTTP)/1.1

echo ' "CONNECT js.aq.qq.com:443 HTTP/1.1
"CONNECT js.aq.qq.com/xxx HTTP/1.1
"CONNECT js.aq.qq.com:443 HTTP/1.1'|sed -r 's/([^/]*)((\.[^/:]*){2})/(\1)<\2>/'
( "CONNECT js.aq)<.qq.com>:443 HTTP/1.1
( "CONNECT js.aq)<.qq.com>/xxx HTTP/1.1
( "CONNECT js.aq)<.qq.com>:443 HTTP/1.1




评分

参与人数 1信誉积分 +10 收起 理由
方兆国儿 + 10 赞一个!

查看全部评分

论坛徽章:
4
15-16赛季CBA联赛之北控
日期:2016-12-06 11:11:0115-16赛季CBA联赛之广夏
日期:2016-12-06 15:04:1515-16赛季CBA联赛之四川
日期:2016-12-06 15:59:51黑曼巴
日期:2016-12-09 20:24:05
75 [报告]
发表于 2016-12-09 17:43 |只看该作者
回复 61# sunzhiguolu

大哥,用词太专业了啊,能通俗点说吗?拜托了!

论坛徽章:
307
程序设计版块每周发帖之星
日期:2016-04-08 00:41:33操作系统版块每日发帖之星
日期:2015-09-02 06:20:00每日论坛发贴之星
日期:2015-09-02 06:20:00程序设计版块每日发帖之星
日期:2015-09-04 06:20:00每日论坛发贴之星
日期:2015-09-04 06:20:00每周论坛发贴之星
日期:2015-09-06 22:22:00程序设计版块每日发帖之星
日期:2015-09-09 06:20:00程序设计版块每日发帖之星
日期:2015-09-19 06:20:00程序设计版块每日发帖之星
日期:2015-09-20 06:20:00每日论坛发贴之星
日期:2015-09-20 06:20:00程序设计版块每日发帖之星
日期:2015-09-22 06:20:00程序设计版块每日发帖之星
日期:2015-09-24 06:20:00
76 [报告]
发表于 2016-12-09 18:21 |只看该作者
回复 63# 方兆国儿
74 楼用颜色进行了标识, 胜过前言万语呀.

论坛徽章:
4
15-16赛季CBA联赛之北控
日期:2016-12-06 11:11:0115-16赛季CBA联赛之广夏
日期:2016-12-06 15:04:1515-16赛季CBA联赛之四川
日期:2016-12-06 15:59:51黑曼巴
日期:2016-12-09 20:24:05
77 [报告]
发表于 2016-12-09 20:06 |只看该作者
本帖最后由 方兆国儿 于 2016-12-09 20:08 编辑

回复 61# sunzhiguolu

for now ,i know exactly what you mean, thank you very very much and that’s very kind of you

  love u

论坛徽章:
4
15-16赛季CBA联赛之北控
日期:2016-12-06 11:11:0115-16赛季CBA联赛之广夏
日期:2016-12-06 15:04:1515-16赛季CBA联赛之四川
日期:2016-12-06 15:59:51黑曼巴
日期:2016-12-09 20:24:05
78 [报告]
发表于 2016-12-09 20:07 |只看该作者
回复 62# moperyblue

i feel grateful that you spent so much time and patience thank you so much

论坛徽章:
4
15-16赛季CBA联赛之北控
日期:2016-12-06 11:11:0115-16赛季CBA联赛之广夏
日期:2016-12-06 15:04:1515-16赛季CBA联赛之四川
日期:2016-12-06 15:59:51黑曼巴
日期:2016-12-09 20:24:05
79 [报告]
发表于 2016-12-09 20:11 |只看该作者
于是,我现在陷入艰难的抉择中,究竟选择谁为最终答案?
回复 62# moperyblue
给出了awk的解决方案,而且花费自己的时间和耐心;

回复 64# sunzhiguolu
给出了perl的解决方案,同时帮助我重新认识了regex,意义重大。

论坛徽章:
307
程序设计版块每周发帖之星
日期:2016-04-08 00:41:33操作系统版块每日发帖之星
日期:2015-09-02 06:20:00每日论坛发贴之星
日期:2015-09-02 06:20:00程序设计版块每日发帖之星
日期:2015-09-04 06:20:00每日论坛发贴之星
日期:2015-09-04 06:20:00每周论坛发贴之星
日期:2015-09-06 22:22:00程序设计版块每日发帖之星
日期:2015-09-09 06:20:00程序设计版块每日发帖之星
日期:2015-09-19 06:20:00程序设计版块每日发帖之星
日期:2015-09-20 06:20:00每日论坛发贴之星
日期:2015-09-20 06:20:00程序设计版块每日发帖之星
日期:2015-09-22 06:20:00程序设计版块每日发帖之星
日期:2015-09-24 06:20:00
80 [报告]
发表于 2016-12-09 20:30 |只看该作者
本帖最后由 sunzhiguolu 于 2016-12-09 22:21 编辑

回复 67# 方兆国儿
给出了awk的解决方案,而且花费自己的时间和耐心;

选择 awk 吧, 你都已经将 perl 看成衣服了还为 perl 纠结个什么劲儿啊!


您需要登录后才可以回帖 登录 | 注册

本版积分规则 发表回复

  

北京盛拓优讯信息技术有限公司. 版权所有 京ICP备16024965号-6 北京市公安局海淀分局网监中心备案编号:11010802020122 niuxiaotong@pcpop.com 17352615567
未成年举报专区
中国互联网协会会员  联系我们:huangweiwei@itpub.net
感谢所有关心和支持过ChinaUnix的朋友们 转载本站内容请注明原作者名及出处

清除 Cookies - ChinaUnix - Archiver - WAP - TOP