免费注册 查看新帖 |

Chinaunix

  平台 论坛 博客 文库
最近访问板块 发新帖
查看: 2210 | 回复: 7
打印 上一主题 下一主题

[算法] 算法题高性能数据查找 [复制链接]

论坛徽章:
0
跳转到指定楼层
1 [收藏(0)] [报告]
发表于 2009-07-16 10:25 |只看该作者 |倒序浏览
现在我有好几个文本文件,这些文件中一共有几百万条数据。文件中每一行为一条记录,每条记录中都有一个字段作为关键字,可以唯一的标明一条记录。这个关键字由字符('0'-'9','A'-'Z','a'-'z')组成。把这些数据都读入内存中后,要按照这个关键字才查找记录。如何建立索引才使查找在常数时间复杂度内完成。

论坛徽章:
7
酉鸡
日期:2013-10-30 17:17:51水瓶座
日期:2014-01-25 14:47:21天秤座
日期:2014-02-20 09:49:50处女座
日期:2014-11-04 17:44:082015年亚洲杯之中国
日期:2015-03-09 17:21:312015亚冠之北京国安
日期:2015-06-01 16:58:552015亚冠之山东鲁能
日期:2015-06-19 11:30:08
2 [报告]
发表于 2009-07-16 10:32 |只看该作者
常数时间只能是hash了

论坛徽章:
324
射手座
日期:2013-08-23 12:04:38射手座
日期:2013-08-23 16:18:12未羊
日期:2013-08-30 14:33:15水瓶座
日期:2013-09-02 16:44:31摩羯座
日期:2013-09-25 09:33:52双子座
日期:2013-09-26 12:21:10金牛座
日期:2013-10-14 09:08:49申猴
日期:2013-10-16 13:09:43子鼠
日期:2013-10-17 23:23:19射手座
日期:2013-10-18 13:00:27金牛座
日期:2013-10-18 15:47:57午马
日期:2013-10-18 21:43:38
3 [报告]
发表于 2009-07-16 10:45 |只看该作者
你的关键字定长还是变长,长度多少?

论坛徽章:
0
4 [报告]
发表于 2009-07-16 11:22 |只看该作者
文件一共多大?放内存应该没问题的

论坛徽章:
0
5 [报告]
发表于 2009-07-16 13:47 |只看该作者
1.都有关键字了还需要索引?索引不在关键字上?
2.考虑建树查找。
3.如果可以最好还是用数据库,通用性比较好。
4.hash其实很失败。
5.我是乱说的。

论坛徽章:
15
射手座
日期:2014-11-29 19:22:4915-16赛季CBA联赛之青岛
日期:2017-11-17 13:20:09黑曼巴
日期:2017-07-13 19:13:4715-16赛季CBA联赛之四川
日期:2017-02-07 21:08:572015年亚冠纪念徽章
日期:2015-11-06 12:31:58每日论坛发贴之星
日期:2015-08-04 06:20:00程序设计版块每日发帖之星
日期:2015-08-04 06:20:00程序设计版块每日发帖之星
日期:2015-07-12 22:20:002015亚冠之浦和红钻
日期:2015-07-08 10:10:132015亚冠之大阪钢巴
日期:2015-06-29 11:21:122015亚冠之广州恒大
日期:2015-05-22 21:55:412015年亚洲杯之伊朗
日期:2015-04-10 16:28:25
6 [报告]
发表于 2009-07-16 14:54 |只看该作者
原帖由 jiangf 于 2009-7-16 10:25 发表
现在我有好几个文本文件,这些文件中一共有几百万条数据。文件中每一行为一条记录,每条记录中都有一个字段作为关键字,可以唯一的标明一条记录。这个关键字由字符('0'-'9','A'-'Z','a'-'z')组成。把这些数据都 ...

平衡二叉树。

论坛徽章:
1
天蝎座
日期:2013-10-23 21:11:03
7 [报告]
发表于 2009-07-16 19:08 |只看该作者
若是用LS说的平衡树,时间复杂度为O(lgN),N=O(2^20)

"常数时间复杂度"看起来应该用hash,但是有不知道这些记录会不会发生变化,若是变化的话一冲突复杂度就会提升;若是记录集合不会添加或减少记录,可以用一个Perfect Hashing
没用过,只是知道:当关键字集合是静态的时,Perfect Hash的访问时间复杂度为O(1);不过看起来好像很复杂

论坛徽章:
0
8 [报告]
发表于 2009-07-20 14:12 |只看该作者
对关键字见二级或者三级索引,剩下的在索引表内用折半查找,应该效率还不错,直接hash的话冲突会不较多,恐怕不好解决,当然也可以,此外还可以看看trie树
您需要登录后才可以回帖 登录 | 注册

本版积分规则 发表回复

  

北京盛拓优讯信息技术有限公司. 版权所有 京ICP备16024965号-6 北京市公安局海淀分局网监中心备案编号:11010802020122 niuxiaotong@pcpop.com 17352615567
未成年举报专区
中国互联网协会会员  联系我们:huangweiwei@itpub.net
感谢所有关心和支持过ChinaUnix的朋友们 转载本站内容请注明原作者名及出处

清除 Cookies - ChinaUnix - Archiver - WAP - TOP