栏目分类:
子分类:
返回
名师互学网用户登录
快速导航关闭
当前搜索
当前分类
子分类
实用工具
热门搜索
名师互学网 > IT > 软件开发 > 后端开发 > Python

生信编程实战第1题(python)

Python 更新时间: 发布时间: IT归档 最新发布 模块sitemap 名妆网 法律咨询 聚返吧 英语巴士网 伯小乐 网商动力

生信编程实战第1题(python)

题目来自生信技能树
统计人类外显子长度
坐标的文件可如下下载:

wget ftp://ftp.ncbi.nlm.nih.gov/pub/CCDS/current_human/CCDS.current.txt

打开文件如下


image.png


于是写了如下脚本

import sysimport re
args=sys.argv
filename=args[1]
exon_length=0aDict={}with open (filename) as fh :      for line in fh:          if line.startswith("#"):              continue
          lineL=line.strip().split("t")
          exon_position=lineL[-2] #取出倒数第二列,坐标列
          if exon_position=="-":  #有的基因没有外显子的坐标,用-代替的,所以这行就要除掉,不然会报错
              continue
          exon_position=re.sub("[|]","",exon_position) #把坐标列的[]去除,注意正则表达式的用法
          exonL=exon_position.split(",")  
          for exon in exonL:
              exonS=lineL[0]+":"+exon    #有点基因会有相同坐标的外显子,所以要去除这一部分,注意要加上染色体的编号,染色体不同而坐标一样就没事
              if exonS not in aDict:    #如果坐标没有在字典,即第一次出现,就将其放入字典,并继续操作。
                   aDict[exonS]=1
                   exon_pL=exon.split("-")
                   exon_start=int(exon_pL[0].strip())
                   exon_end=int(exon_pL[1].strip())
                   exon_length+=exon_end-exon_start
print(exon_length)

然后运行

ubuntu@VM-0-4-ubuntu:~/data/practice$ python3 exon.py CCDS.current.txt 
36443621

正则表达式再学习熟悉熟悉



作者:天秤座的机器狗
链接:https://www.jianshu.com/p/8cddd0774b08


转载请注明:文章转载自 www.mshxw.com
本文地址:https://www.mshxw.com/it/221441.html
我们一直用心在做
关于我们 文章归档 网站地图 联系我们

版权所有 (c)2021-2022 MSHXW.COM

ICP备案号:晋ICP备2021003244-6号