genbio-ai/AIDO.RNA-1.6B

Model

GB.RNA-1.6B

8

33 commits

2 linked in READMEs

updated Jul 25, 2026

See the code

README

GB.RNA-1.6B

License

GB.RNA-1.6B is a general-purpose RNA foundation model with 1.6 billion parameters, trained on 42 million non-coding RNA sequences at single-nucleotide resolution. It achieves state-of-the-art performance on a comprehensive set of tasks, including RNA secondary structure prediction, mRNA-related tasks, RNA function prediction, and RNA inverse folding. After domain adaptation, GB.RNA excels in modeling protein-level tasks, highlighting its potential to leverage the central dogma for enhancing biomolecular representations. For more detailed information, please refer to our paper.

Note: If you are interested in a model tailored for coding sequences, we also offer a domain-adapted version: GB.RNA-1.6B-CDS.

description

Model architectural details

GB.RNA is an encoder-only transformer and is pre-trained using masked language modeling (MLM) objective. The model architecture parameters are as follows:

hyperparametervalue
num-layers32
hidden-size2,048
ffn-hidden-size5,440
num-attn-heads32
vocab-size16

Pre-training data

The pre-training data contains 42 million unique ncRNA sequences from RNAcentral version 24.0.

description

Downstream evaluation

description

How to Use

Build any downstream models from this backbone with ModelGenerator

For more information, visit: Model Generator

mgen fit --model SequenceClassification --model.backbone aido_rna_1b600m --data SequenceClassificationDataModule --data.path <hf_or_local_path_to_your_dataset>
mgen test --model SequenceClassification --model.backbone aido_rna_1b600m --data SequenceClassificationDataModule --data.path <hf_or_local_path_to_your_dataset>

Or use directly in Python

Embedding

from modelgenerator.tasks import Embed
model = Embed.from_config({"model.backbone": "aido_rna_1b600m"}).eval()
transformed_batch = model.transform({"sequences": ["ACGT", "AGCT"]})
embedding = model(transformed_batch)
print(embedding.shape)
print(embedding)

Sequence-level Classification

import torch
from modelgenerator.tasks import SequenceClassification
model = SequenceClassification.from_config({"model.backbone": "aido_rna_1b600m", "model.n_classes": 2}).eval()
transformed_batch = model.transform({"sequences": ["ACGT", "AGCT"]})
logits = model(transformed_batch)
print(logits)
print(torch.argmax(logits, dim=-1))

Token-level Classification

import torch
from modelgenerator.tasks import TokenClassification
model = TokenClassification.from_config({"model.backbone": "aido_rna_1b600m", "model.n_classes": 3}).eval()
transformed_batch = model.transform({"sequences": ["ACGT", "AGCT"]})
logits = model(transformed_batch)
print(logits)
print(torch.argmax(logits, dim=-1))

Sequence-level Regression

from modelgenerator.tasks import SequenceRegression
model = SequenceRegression.from_config({"model.backbone": "aido_rna_1b600m"}).eval()
transformed_batch = model.transform({"sequences": ["ACGT", "AGCT"]})
logits = model(transformed_batch)
print(logits)

Citation

Please cite GB.RNA using the following BibTeX code:

@inproceedings{zou_large-scale_2024,
	title = {A Large-Scale Foundation Model for RNA Function and Structure Prediction},
	url = {https://www.biorxiv.org/content/10.1101/2024.11.28.625345v1},
	doi = {10.1101/2024.11.28.625345},
	publisher = {bioRxiv},
	author = {Zou, Shuxian and Tao, Tianhua and Mahbub, Sazan and Ellington, Caleb N. and Algayres, Robin and Li, Dian and Zhuang, Yonghao and Wang, Hongyi and Song, Le and Xing, Eric P.},
	year = {2024},
    booktitle = {NeurIPS 2024 Workshop on AI for New Drug Modalities},
}
pytorch
rnabert

Contributors

ShuxianZou

20 commits

probablybots

10 commits

CE
DianLiI

1 commits

genbio-ai/AIDO.RNA-1.6B

Model

GB.RNA-1.6B

8

33 commits

2 linked in READMEs

updated Jul 25, 2026

See the code

README

GB.RNA-1.6B

License

GB.RNA-1.6B is a general-purpose RNA foundation model with 1.6 billion parameters, trained on 42 million non-coding RNA sequences at single-nucleotide resolution. It achieves state-of-the-art performance on a comprehensive set of tasks, including RNA secondary structure prediction, mRNA-related tasks, RNA function prediction, and RNA inverse folding. After domain adaptation, GB.RNA excels in modeling protein-level tasks, highlighting its potential to leverage the central dogma for enhancing biomolecular representations. For more detailed information, please refer to our paper.

Note: If you are interested in a model tailored for coding sequences, we also offer a domain-adapted version: GB.RNA-1.6B-CDS.

description

Model architectural details

GB.RNA is an encoder-only transformer and is pre-trained using masked language modeling (MLM) objective. The model architecture parameters are as follows:

hyperparametervalue
num-layers32
hidden-size2,048
ffn-hidden-size5,440
num-attn-heads32
vocab-size16

Pre-training data

The pre-training data contains 42 million unique ncRNA sequences from RNAcentral version 24.0.

description

Downstream evaluation

description

How to Use

Build any downstream models from this backbone with ModelGenerator

For more information, visit: Model Generator

mgen fit --model SequenceClassification --model.backbone aido_rna_1b600m --data SequenceClassificationDataModule --data.path <hf_or_local_path_to_your_dataset>
mgen test --model SequenceClassification --model.backbone aido_rna_1b600m --data SequenceClassificationDataModule --data.path <hf_or_local_path_to_your_dataset>

Or use directly in Python

Embedding

from modelgenerator.tasks import Embed
model = Embed.from_config({"model.backbone": "aido_rna_1b600m"}).eval()
transformed_batch = model.transform({"sequences": ["ACGT", "AGCT"]})
embedding = model(transformed_batch)
print(embedding.shape)
print(embedding)

Sequence-level Classification

import torch
from modelgenerator.tasks import SequenceClassification
model = SequenceClassification.from_config({"model.backbone": "aido_rna_1b600m", "model.n_classes": 2}).eval()
transformed_batch = model.transform({"sequences": ["ACGT", "AGCT"]})
logits = model(transformed_batch)
print(logits)
print(torch.argmax(logits, dim=-1))

Token-level Classification

import torch
from modelgenerator.tasks import TokenClassification
model = TokenClassification.from_config({"model.backbone": "aido_rna_1b600m", "model.n_classes": 3}).eval()
transformed_batch = model.transform({"sequences": ["ACGT", "AGCT"]})
logits = model(transformed_batch)
print(logits)
print(torch.argmax(logits, dim=-1))

Sequence-level Regression

from modelgenerator.tasks import SequenceRegression
model = SequenceRegression.from_config({"model.backbone": "aido_rna_1b600m"}).eval()
transformed_batch = model.transform({"sequences": ["ACGT", "AGCT"]})
logits = model(transformed_batch)
print(logits)

Citation

Please cite GB.RNA using the following BibTeX code:

@inproceedings{zou_large-scale_2024,
	title = {A Large-Scale Foundation Model for RNA Function and Structure Prediction},
	url = {https://www.biorxiv.org/content/10.1101/2024.11.28.625345v1},
	doi = {10.1101/2024.11.28.625345},
	publisher = {bioRxiv},
	author = {Zou, Shuxian and Tao, Tianhua and Mahbub, Sazan and Ellington, Caleb N. and Algayres, Robin and Li, Dian and Zhuang, Yonghao and Wang, Hongyi and Song, Le and Xing, Eric P.},
	year = {2024},
    booktitle = {NeurIPS 2024 Workshop on AI for New Drug Modalities},
}
pytorch
rnabert

Contributors

ShuxianZou

20 commits

probablybots

10 commits

CE
DianLiI

1 commits