Pesquisa · Mapa mental

Arquivo Europeu de Nucleotídeos

O Arquivo Europeu de Nucleotídeos (ENA) é um repositório que fornece acesso gratuito e irrestrito a sequências de DNA e RNA anotadas. Ele também armazena informações complementares, como procedimentos experimentais, detalhes da montagem de sequências [en] e outros metadados relacionados a projetos de sequenciamento. O arquivo é composto por três bancos de dados principais: o Arquivo de Leitura de Sequências [en], o Arquivo de Traços e o Banco de Dados de Sequências de Nucleotídeos do EMBL. O ENA é produzido e mantido pelo Instituto Europeu de Bioinformática e é membro da Colaboração Internacional de Bancos de Dados de Sequências de Nucleotídeos [en] (INSDC), juntamente com o Banco de Dados de DNA do Japão [en] e o GenBank.

Fonte: Wikipédia (pt)Atualizado em 20/07/2026
01

História

O Arquivo Europeu de Nucleotídeos originou-se de bancos de dados separados, o mais antigo dos quais foi a Biblioteca de Dados EMBL, criada em outubro de 1980 no Laboratório Europeu de Biologia Molecular (EMBL), em Heidelberg. A primeira versão desse banco de dados foi lançada em abril de 1982 e continha um total de 568 entradas separadas que consistiam em cerca de 500 000 pares de bases. Em 1984, referindo-se à Biblioteca de Dados do EMBL, Kneale e Kennard observaram que “ficou claro há alguns anos que um grande banco de dados computadorizado de sequências seria essencial para a pesquisa em Biologia Molecular”. Apesar de o principal método de distribuição na época ser via fita magnética, em 1987, a Biblioteca de Dados EMBL estava sendo usada por cerca de 10 000 cientistas em todo o mundo. No mesmo ano, o Servidor de Arquivos EMBL foi introduzido para disponibilizar os registros do banco de dados na BITNET, EARN [en] e no início da internet. Em maio de 1988, a revista Nucleic Acids Research [en] introduziu uma política declarando que “os manuscritos enviados à Nucleic Acids Research e que contenham ou discutam dados de sequência devem ser acompanhados de evidências de que os dados foram depositados na Biblioteca de Dados EMBL”.

02

Banco de dados de sequências de nucleotídeos EMBL

O Banco de Dados de Sequências de Nucleotídeos EMBL (também conhecido como EMBL-Bank) é a seção do ENA que contém detalhes de alto nível da montagem do genoma [en], bem como sequências montadas e sua anotação funcional. A contribuição para o EMBL-Bank é feita por envio direto de consórcios de genoma e grupos de pesquisa menores, bem como pela recuperação de dados de sequência associados a pedidos de patente. A partir da versão 114 (dezembro de 2012), o banco de dados de sequências de nucleotídeos do EMBL contém aproximadamente 5×1011 nucleotídeos com um tamanho de arquivo não compactado de 1,6 terabytes.

Classes de dados

O banco de dados de sequências de nucleotídeos do EMBL suporta uma variedade de dados derivados de diferentes fontes, incluindo, entre outros:

Formato EMBL-Bank

O banco de dados de sequências de nucleotídeos do EMBL usa um formato de arquivo plano [en] de texto simples para representar e armazenar dados, normalmente chamado de formato EMBL-Bank. O formato EMBL-Bank usa uma sintaxe [en] diferente dos registros no DDBJ e no GenBank, embora cada formato use determinada nomenclatura padronizada, como taxonomias definidas pelo banco de dados taxonômicos do NCBI. Cada linha de um arquivo no formato EMBL começa com um código de duas letras, como AC para rotular o número de acesso [en] e KW para uma lista de palavras-chave relevantes para o registro; cada registro termina com //.

03

Arquivo de Leituras de Sequências (SRA)

O ENA opera uma instância do Arquivo de Leituras de Sequências (SRA), um repositório de arquivo de leituras de sequências e análises que se destinam à divulgação pública. Originalmente chamado de Short Read Archive (arquivo de leituras curtas), o nome foi alterado em antecipação às futuras tecnologias de sequenciamento que poderiam produzir leituras de sequências mais longas. Atualmente, o arquivo aceita leituras de sequências geradas por plataformas de sequenciamento [en] de próxima geração, como o Analisador de Genoma Illumina e o ABI SOLiD [en], bem como algumas análises e alinhamentos correspondentes. O SRA opera sob a orientação da Colaboração Internacional de Bancos de Dados de Sequências de Nucleotídeos [en] (INSDC) e é o repositório de crescimento mais rápido no ENA. Em 2010, o Arquivo de Leituras de Sequências constituía aproximadamente 95% dos dados de pares de bases disponíveis por meio da ENA, abrangendo mais de 500 000 000 000 de leituras de sequências compostas por mais de 60 trilhões (6×1013) de pares de bases. Quase metade desses dados foi depositada em relação ao Projeto 1000 Genomas, no qual os pesquisadores publicaram seus dados de sequência na SRA em tempo real. No total, em setembro de 2010, 65% do Arquivo de Leituras de Sequências eram sequências genômicas humanas, com outros 16% relacionados a leituras de sequências de metagenomas humanos.

04

Acesso aos dados

Os dados contidos no ENA podem ser acessados manual ou programaticamente via URL REST por meio do navegador ENA. Inicialmente limitado ao Sequence Read Archive, o navegador ENA agora também oferece acesso ao Trace Archive e ao EMBL-Bank, permitindo a recuperação de arquivos em diversos formatos, incluindo XML, HTML, FASTA e FASTQ. Registros individuais podem ser acessados usando seus números de acesso e outras consultas de texto são permitidas por meio do mecanismo de busca EB-eye [en]. Além disso, as pesquisas baseadas em similaridade de sequência implementadas usando gráficos De Bruijn [en] oferecem outro método de recuperação de registros do ENA. O ENA pode ser acessado por meio das APIs SOAP e REST do EBI, que também oferecem acesso a outros bancos de dados hospedados no EBI, como o Ensembl e o InterPro.

05

Armazenamento

O Arquivo Europeu de Nucleotídeos lida com grandes volumes de dados que representam um desafio significativo de armazenamento. Desde 2012, os requisitos de armazenamento do ENA continuam a crescer exponencialmente, com um tempo de duplicação de aproximadamente 10 meses. Para gerenciar esse aumento, o ENA descarta seletivamente os dados menos valiosos da plataforma de sequenciamento e implementa estratégias avançadas de compressão. O kit de ferramentas de compactação baseado em referência CRAM foi desenvolvido para reduzir os requisitos de armazenamento da ENA.

06

Financiamento

Atualmente, o ENA é financiado conjuntamente pelo Laboratório Europeu de Biologia Molecular, pela Comissão Europeia e pelo Wellcome Trust. A estrutura emergente ELIXIR, coordenada pela diretora do EBI, Janet Thornton, pretende garantir uma infraestrutura de financiamento europeia sustentável para apoiar a disponibilidade contínua de bancos de dados de ciências da vida, como o ENA.

Vídeos recomendados

Fontes consultadas

Continue pesquisando