免费注册 查看新帖 |

Chinaunix

  平台 论坛 博客 文库
12
最近访问板块 发新帖
楼主: a12333a
打印 上一主题 下一主题

[文本处理] 这个需求问了2个linux高级群,至今没有一个好的算法出现 [复制链接]

论坛徽章:
7
申猴
日期:2014-12-21 13:57:24巳蛇
日期:2014-12-25 22:27:08申猴
日期:2015-01-19 08:07:36辰龙
日期:2015-02-04 11:40:06处女座
日期:2015-02-04 11:40:412015年亚洲杯之卡塔尔
日期:2015-03-06 12:01:322015年亚洲杯之乌兹别克斯坦
日期:2015-03-31 13:43:57
11 [报告]
发表于 2015-01-29 11:25 |只看该作者
回复 8# a12333a


    /a/b/e.jpg/a/b/e这个强行不算/a/b/e.jpg/xxxx吗

论坛徽章:
0
12 [报告]
发表于 2015-01-29 11:58 |只看该作者
jason680 发表于 2015-01-29 00:42
回复 1# a12333a

$ awk -F'/' 'FNR==NR{d="";for(n=2;n<NF;n++){d=d"/"$n;a[d]=1};next}!a[$0]' a.txt a.txt





好屌,可用!!

论坛徽章:
5
2015年辞旧岁徽章
日期:2015-03-03 16:54:152015年迎新春徽章
日期:2015-03-04 09:50:282015年亚洲杯之朝鲜
日期:2015-03-13 22:47:33IT运维版块每日发帖之星
日期:2016-01-09 06:20:00IT运维版块每周发帖之星
日期:2016-03-07 16:27:44
13 [报告]
发表于 2015-01-29 12:30 |只看该作者

问题没有描述清楚。

意思应该是求"最长字符串"。

sed 方法:
  1. sort urfile|sed 'N;/^\(.\+\/\)\?\n\1/!P;D'
复制代码

论坛徽章:
0
14 [报告]
发表于 2015-01-29 12:45 |只看该作者
本帖最后由 a12333a 于 2015-01-29 12:46 编辑
blackold 发表于 2015-01-29 12:30
问题没有描述清楚。

意思应该是求"最长字符串"。


描述很清楚了,你可以当成文本内容是网站的目录、文件列表,现在只要筛选出文件列表,去掉目录。但是提供的文本里面目录并没有与/结尾。

论坛徽章:
5
2015年辞旧岁徽章
日期:2015-03-03 16:54:152015年迎新春徽章
日期:2015-03-04 09:50:282015年亚洲杯之朝鲜
日期:2015-03-13 22:47:33IT运维版块每日发帖之星
日期:2016-01-09 06:20:00IT运维版块每周发帖之星
日期:2016-03-07 16:27:44
15 [报告]
发表于 2015-01-29 12:55 |只看该作者
回复 14# a12333a


    如果描述清楚了,前面就没那么多讨论了——你怎么区分“目录"和“文件"?

论坛徽章:
5
未羊
日期:2014-08-04 16:15:21天秤座
日期:2014-08-13 13:52:372015年辞旧岁徽章
日期:2015-03-03 16:54:152015年迎新春徽章
日期:2015-03-04 09:56:112015亚冠之浦和红钻
日期:2015-06-29 15:30:48
16 [报告]
发表于 2015-01-29 15:35 |只看该作者
黑哥v5
至少sed看懂了
您需要登录后才可以回帖 登录 | 注册

本版积分规则 发表回复

  

北京盛拓优讯信息技术有限公司. 版权所有 京ICP备16024965号-6 北京市公安局海淀分局网监中心备案编号:11010802020122 niuxiaotong@pcpop.com 17352615567
未成年举报专区
中国互联网协会会员  联系我们:huangweiwei@itpub.net
感谢所有关心和支持过ChinaUnix的朋友们 转载本站内容请注明原作者名及出处

清除 Cookies - ChinaUnix - Archiver - WAP - TOP