免费注册 查看新帖 |

Chinaunix

  平台 论坛 博客 文库
最近访问板块 发新帖
查看: 5159 | 回复: 3
打印 上一主题 下一主题

求助大牛,关于去除冗余数据问题(fasta格式序列) [复制链接]

论坛徽章:
1
操作系统版块每日发帖之星
日期:2015-10-08 06:20:00
跳转到指定楼层
1 [收藏(0)] [报告]
发表于 2018-01-17 20:33 |只看该作者 |倒序浏览
有一些氨基酸序列,文件名为a.fas,格式如下:>Gne|c67372_g2_i2_m.86976GIGGGLSGTVRQKGSIAPPPASGRIRSPLPPPPNDTVTIR---------STD-ARHTTDAFSDLSQLERNLPAPTASGWAAF
>Lja|Lygodium_c28780_g1_i1_m31025
SGKSSLLSTGHMAAPLAPPPGGGRLRTPLPPPPNDIKHHRVSNSTPLTRDTASGRP-GDPFADLSQLEANLPTSYHAGWAAF
>Lja|Lygodium_c30483_g1_i1_m35786
SGKSSLLSTGHMAAPLAPPPGGGRLRTPLPPPPNDIKHHRVSNSTPLTRDTASGRP-GDPFADLSQLEANLPTSYHAGWAAF
>Lja|Lygodium_c41319_g1_i1_m77659
GEQTNIASTGRMKAPLAPPPGGGRLRSPLPPPPSDNRQLR-SSSAANTYTEKTAKHASDPFADIAELETSLPSSFHGGWAAF
>Paq|Pteridium_c51474_g1_i3_m67055
SGGSTLASPGSMKAPIAPPPSGGRLCSPLPPPPNDTKYLRVTRTLPSTQ---------------------------------
>Paq|Pteridium_c62366_g1_i2_m115536
SGGSTLASPGSMKAPIAPPPSGGRLCSPLPPPPNDTKYLRVTRTLPSTQSSHSGRPTGDPFADLSQLEELLCARQHFEFASF
>Paq|Pteridium_c64930_g1_i1_m134191
GGTSTVASSGHIKAPLAPPPGGGRLRSPLPPPPNDNKHSRGTNAAAASQSRDSGRPTGDPFADLSQLEVSLPSSLHAGWAAF
>Pin|c31137_g1_i1_m49244
GLAGSVSSTGRQKASLAPPPGSGRIRSPLPPPPNDTVTAKIGSAMISSSSRDTSRHNADPLSDLSQLEMSLPSSTASGWAAF


其中|线前面的为物种名,基本都是3个字母。目的是想如果物种名相同,如果有多条序列,相差较大的话,所有序列都留下;如果排列好的序列相同或相差不多于2个氨基酸,则删除较短的一条。如上红色所示,将粉色的其中任意一条去除,红色的去除第一条较短的序列,得到如下结果(a.fas_out):

>Gne|c67372_g2_i2_m.86976GIGGGLSGTVRQKGSIAPPPASGRIRSPLPPPPNDTVTIR---------STD-ARHTTDAFSDLSQLERNLPAPTASGWAAF
>Lja|Lygodium_c28780_g1_i1_m31025
SGKSSLLSTGHMAAPLAPPPGGGRLRTPLPPPPNDIKHHRVSNSTPLTRDTASGRP-GDPFADLSQLEANLPTSYHAGWAAF
>Lja|Lygodium_c41319_g1_i1_m77659
GEQTNIASTGRMKAPLAPPPGGGRLRSPLPPPPSDNRQLR-SSSAANTYTEKTAKHASDPFADIAELETSLPSSFHGGWAAF
>Paq|Pteridium_c62366_g1_i2_m115536
SGGSTLASPGSMKAPIAPPPSGGRLCSPLPPPPNDTKYLRVTRTLPSTQSSHSGRPTGDPFADLSQLEELLCARQHFEFASF
>Paq|Pteridium_c64930_g1_i1_m134191
GGTSTVASSGHIKAPLAPPPGGGRLRSPLPPPPNDNKHSRGTNAAAASQSRDSGRPTGDPFADLSQLEVSLPSSLHAGWAAF
>Pin|c31137_g1_i1_m49244
GLAGSVSSTGRQKASLAPPPGSGRIRSPLPPPPNDTVTAKIGSAMISSSSRDTSRHNADPLSDLSQLEMSLPSSTASGWAAF


请大家帮帮忙!!!非常感谢!!!

论坛徽章:
0
2 [报告]
发表于 2018-01-18 14:57 |只看该作者
你这个同一个基因的不同转录本保留,一般不都是留最长的那条吗?
你的序列差异较大怎么判断?调blast吗?

论坛徽章:
1
操作系统版块每日发帖之星
日期:2015-10-08 06:20:00
3 [报告]
发表于 2018-01-18 16:57 |只看该作者
sunslj 发表于 2018-01-18 14:57
你这个同一个基因的不同转录本保留,一般不都是留最长的那条吗?
你的序列差异较大怎么判断?调blast吗?

序列差异较大指的是两条序列之间差异大于1个氨基酸,多于1个差异的则保留。序列是利用软件已经排列好的。

论坛徽章:
7
巳蛇
日期:2013-11-28 09:22:59天秤座
日期:2014-10-25 15:40:452015年辞旧岁徽章
日期:2015-03-03 16:54:152015年迎新春徽章
日期:2015-03-04 09:53:172015亚冠之德黑兰石油
日期:2015-07-15 08:46:452015亚冠之平阳省
日期:2015-11-08 16:27:53白银圣斗士
日期:2015-11-14 09:58:12
4 [报告]
发表于 2018-03-14 15:41 |只看该作者
读入序列,比较相似性,再输出吧
您需要登录后才可以回帖 登录 | 注册

本版积分规则 发表回复

  

北京盛拓优讯信息技术有限公司. 版权所有 京ICP备16024965号-6 北京市公安局海淀分局网监中心备案编号:11010802020122 niuxiaotong@pcpop.com 17352615567
未成年举报专区
中国互联网协会会员  联系我们:huangweiwei@itpub.net
感谢所有关心和支持过ChinaUnix的朋友们 转载本站内容请注明原作者名及出处

清除 Cookies - ChinaUnix - Archiver - WAP - TOP