清晨好,您是今天最早来到科研通的研友!由于当前在线用户较少,发布求助请尽量完整地填写文献信息,科研通机器人24小时在线,伴您科研之路漫漫前行!

HyenaDNA: Long-Range Genomic Sequence Modeling at Single Nucleotide Resolution

基因组学 背景(考古学) 基因组 计算机科学 计算生物学 生物 遗传学 基因 古生物学
作者
Éric Nguyen,Michael Poli,Marjan Faizi,Armin W. Thomas,C. J. Birch-sykes,Michael Wornow,Aman Patel,Clayton M. Rabideau,Stefano Massaroli,Yoshua Bengio,Stefano Ermon,Stephen A. Baccus,Chris Ré
出处
期刊:Cornell University - arXiv [Cornell University]
被引量:151
标识
DOI:10.48550/arxiv.2306.15794
摘要

Genomic (DNA) sequences encode an enormous amount of information for gene regulation and protein synthesis. Similar to natural language models, researchers have proposed foundation models in genomics to learn generalizable features from unlabeled genome data that can then be fine-tuned for downstream tasks such as identifying regulatory elements. Due to the quadratic scaling of attention, previous Transformer-based genomic models have used 512 to 4k tokens as context (<0.001% of the human genome), significantly limiting the modeling of long-range interactions in DNA. In addition, these methods rely on tokenizers or fixed k-mers to aggregate meaningful DNA units, losing single nucleotide resolution where subtle genetic variations can completely alter protein function via single nucleotide polymorphisms (SNPs). Recently, Hyena, a large language model based on implicit convolutions was shown to match attention in quality while allowing longer context lengths and lower time complexity. Leveraging Hyena's new long-range capabilities, we present HyenaDNA, a genomic foundation model pretrained on the human reference genome with context lengths of up to 1 million tokens at the single nucleotide-level - an up to 500x increase over previous dense attention-based models. HyenaDNA scales sub-quadratically in sequence length (training up to 160x faster than Transformer), uses single nucleotide tokens, and has full global context at each layer. We explore what longer context enables - including the first use of in-context learning in genomics. On fine-tuned benchmarks from the Nucleotide Transformer, HyenaDNA reaches state-of-the-art (SotA) on 12 of 18 datasets using a model with orders of magnitude less parameters and pretraining data. On the GenomicBenchmarks, HyenaDNA surpasses SotA on 7 of 8 datasets on average by +10 accuracy points. Code at https://github.com/HazyResearch/hyena-dna.
最长约 10秒,即可获得该文献文件

科研通智能强力驱动
Strongly Powered by AbleSci AI
科研通是完全免费的文献互助平台,具备全网最快的应助速度,最高的求助完成率。 对每一个文献求助,科研通都将尽心尽力,给求助人一个满意的交代。
实时播报
直率的笑翠完成签到 ,获得积分10
11秒前
初九完成签到,获得积分10
20秒前
science完成签到 ,获得积分10
44秒前
领导范儿应助科研通管家采纳,获得10
51秒前
乒坛巨人完成签到 ,获得积分10
52秒前
Di完成签到 ,获得积分10
58秒前
Apricity完成签到,获得积分10
59秒前
Beyond095完成签到 ,获得积分10
1分钟前
Hello应助Sensen采纳,获得10
1分钟前
Benhnhk21完成签到,获得积分10
1分钟前
吴宵完成签到,获得积分0
1分钟前
激动的似狮完成签到,获得积分0
1分钟前
ding应助抗体药物偶联采纳,获得10
1分钟前
小山己几完成签到,获得积分10
1分钟前
1分钟前
Sensen发布了新的文献求助10
1分钟前
2分钟前
2分钟前
博弈完成签到 ,获得积分10
2分钟前
shining完成签到,获得积分10
2分钟前
喜悦向日葵完成签到 ,获得积分10
3分钟前
HAL完成签到 ,获得积分10
3分钟前
科研通AI6.2应助Sensen采纳,获得10
3分钟前
3分钟前
抗体药物偶联完成签到,获得积分10
3分钟前
hj完成签到 ,获得积分10
3分钟前
可爱的函函应助hh采纳,获得10
3分钟前
3分钟前
ninini完成签到 ,获得积分10
3分钟前
3分钟前
Sensen发布了新的文献求助10
4分钟前
勤qin完成签到 ,获得积分10
4分钟前
会飞的柯基完成签到 ,获得积分10
4分钟前
widesky777完成签到 ,获得积分10
4分钟前
任性孤菱完成签到 ,获得积分10
4分钟前
论文爱看完成签到,获得积分10
4分钟前
大气思柔完成签到 ,获得积分10
5分钟前
小飞完成签到 ,获得积分10
5分钟前
qvb完成签到 ,获得积分10
5分钟前
高飞完成签到 ,获得积分10
5分钟前
高分求助中
(应助此贴封号)【重要!!请各用户(尤其是新用户)详细阅读】【科研通的精品贴汇总】 10000
Effects of Two Weeks of Red Light Therapy on Choroidal Thickness and Axial Length in Young Adults 700
内視鏡的に摘除しえた十二指腸乳頭部腫瘍の2例 660
Management and the Arts 510
Matrix Methods in Data Mining and Pattern Recognition Second Edition 510
The Neuroscience of Language 400
Common Foundations of American and East Asian Modernisation: From Alexander Hamilton to Junichero Koizumi 400
热门求助领域 (近24小时)
化学 材料科学 医学 生物 纳米技术 工程类 有机化学 化学工程 生物化学 计算机科学 内科学 物理 复合材料 催化作用 细胞生物学 无机化学 光电子学 物理化学 电极 基因
热门帖子
关注 科研通微信公众号,转发送积分 7676998
求助须知:如何正确求助?哪些是违规求助? 9242914
关于积分的说明 19919354
捐赠科研通 7247518
什么是DOI,文献DOI怎么找? 3286758
关于科研通互助平台的介绍 2444730
邀请新用户注册赠送积分活动 2289802