Pesquisa · Mapa mental

Attention Is All You Need

"Attention Is All You Need" é um artigo científico de 2017 sobre aprendizado de máquina de autoria de oito cientistas e engenheiros que trabalhavam no Google. O artigo introduziu uma nova arquitetura de aprendizado profundo conhecida como Transformer, baseada no mecanismo de atenção proposto em 2014 por Bahdanau et al. A abordagem do Transformer descrita no documento tornou-se a arquitetura principal de uma ampla variedade de sistemas de inteligência artificial, incluindo modelos de linguagem grandes (LLMs).

Fonte: Wikipédia (pt)Atualizado em 21/07/2026
01

Contexto

Imagem: Syced · CC0 · Openverse

Os autores do artigo são Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan Gomez, Łukasz Kaiser e Illia Polosukhin. Todos os oito autores constam como "colaboradores de igual valor" para o artigo; a ordem de listagem foi sorteada de maneira aleatória (conforme indicado no próprio texto do artigo). Após a publicação, cada um dos autores desligou-se do Google para se integrar a outras empresas ou estabelecer startups no ecossistema de deeptech. O título do artigo é uma referência direta à canção "All You Need Is Love" da banda The Beatles. O nome "Transformer" foi escolhido porque Jakob Uszkoreit, um dos autores do artigo, gostava da sonoridade da palavra. Um dos rascunhos de design iniciais foi intitulado "Transformers: Iterative Self-Attention and Processing for Various Tasks", e continha uma ilustração com seis personagens da franquia Transformers. Por conta disso, o grupo ficou conhecido internamente como "Team Transformer".

02

Métodos discutidos e introduzidos

Imagem: Google · BY-SA · Openverse

O artigo é amplamente célebre por introduzir a arquitetura Transformer, que serve de fundação para a maior parte dos modelos de linguagem grandes (LLMs) modernos. Uma razão crucial pela qual essa arquitetura é preferida pela maioria dos LLMs atuais é a sua capacidade de paralelização em comparação com os modelos predecessores. Isso garante que as operações necessárias para o treinamento possam ser aceleradas em unidades de processamento gráfico (GPUs), permitindo tempos de treinamento muito mais rápidos e a viabilização de modelos com volumes massivos de parâmetros. O artigo introduziu os seguintes mecanismos estruturais como parte do desenvolvimento da arquitetura Transformer:

Atenção de produto escalar escalonado e autoatenção

O uso do mecanismo de atenção de produto escalar escalonado (scaled dot-product attention) e de autoatenção (self-attention) em substituição às redes neurais recorrentes (RNNs) ou redes LSTM (que dependem de recorrência sequencial) permitiu um ganho expressivo de desempenho. O artigo descreve a atenção de produto escalar escalonado da seguinte forma: onde Q {\displaystyle Q} , K {\displaystyle K} e V {\displaystyle V} são, respectivamente, as matrizes de consulta (query), chave (key) e valor (value), e d k {\displaystyle d_{k}} representa a dimensão dos vetores de chave. Como o modelo depende das matrizes de Consulta ( Q {\displaystyle Q} ), Chave ( K {\displaystyle K} ) e Valor ( V {\displaystyle V} ) geradas a partir da mesma fonte (ou seja, a sequência de entrada ou a janela de contexto), elimina-se a necessidade de processamento recorrente por RNNs, assegurando a paralelização completa da arquitetura. Isso difere da forma original do mecanismo de atenção introduzido em 2014. Adicionalmente, o artigo discute a introdução de um fator de escalonamento associado à raiz quadrada da dimensão dos vetores de chave (representado por d k {\displaystyle d_{k}} e configurado inicialmente como 64 no artigo), que se mostrou altamente eficaz para evitar que o produto escalar crescesse excessivamente em dimensões altas.

Atenção de múltiplas cabeças

No mecanismo de autoatenção, consultas ( Q {\displaystyle Q} ), chaves ( K {\displaystyle K} ) e valores ( V {\displaystyle V} ) são gerados dinamicamente para cada sequência de entrada (tipicamente limitada pelo tamanho da janela de contexto), permitindo que o modelo foque em diferentes partes da sequência a cada etapa. O mecanismo de atenção de múltiplas cabeças (multi-head attention) aprimora esse processo ao introduzir várias cabeças de atenção operando em paralelo. Cada cabeça de atenção aprende projeções lineares distintas das matrizes Q {\displaystyle Q} , K {\displaystyle K} e V {\displaystyle V} . Isso permite que o modelo capture diferentes aspects e nuances das relações entre as palavras na sequência simultaneamente, em vez de se limitar a uma única perspectiva de associação.

Codificação posicional

Como o Transformer não depende de recorrência ou de operações de convolução no texto para realizar a codificação e a decodificação, o artigo introduziu o uso de funções de ondas senoidais e cossenooidais para codificar a posição geométrica do token dentro da incorporação vetorial. Os métodos matemáticos introduzidos no artigo são detalhados abaixo: onde p o s {\displaystyle {\rm {pos}}} é a posição da palavra, i {\displaystyle i} é o índice da dimensão atual e d m o d e l {\displaystyle {d_{\rm {model}}}} corresponde à dimensão do modelo. A função seno é aplicada para os índices pares da incorporação, enquanto a função cosseno é aplicada para os índices ímpares. A incorporação posicional resultante ( P E {\displaystyle PE} ) é então somada diretamente à incorporação da palavra na posição correspondente dentro da janela de contexto. O artigo comenta a escolha dessa metodologia geométrica afirmando:

03

Contexto histórico

Imagem: Google · BY-SA · Openverse

Predecessores

Por muitos anos, a modelagem e a geração de sequências eram realizadas por meio do uso de redes neurais recorrentes (RNNs) convencionais. Um exemplo pioneiro e amplamente citado foi a Rede de Elman (1990). Em teoria, a informação de um token pode se propagar arbitrariamente ao longo de toda a sequência, mas, na prática, o problema do gradiente evanescente faz com que o estado do modelo ao final de uma frase longa perca informações precisas e extraíveis sobre os tokens precedentes. Um avanço fundamental foi a arquitetura LSTM (originalmente descrita em um relatório técnico de 1995 e publicada formalmente em 1997), uma RNN que introduziu mecanismos de portas (gating) para mitigar o problema do gradiente evanescente, permitindo o aprendizado eficiente na modelagem de sequências longas. Um elemento estrutural essencial foi o uso de unidades de controle multiplicativas, nas quais as saídas de alguns neurônios modulam as saídas de outros. Essas unidades multiplicativas são conceitualmente distintas do mecanismo de atenção aditivo introduzido posteriormente para os modelos de sequência para sequência (seq2seq). As redes neurais que utilizavam unidades multiplicativas foram mais tarde denominadas redes sigma-pi ou redes de ordem superior. A LSTM tornou-se a arquitetura padrão para modelagem de sequências longas até a publicação dos Transformers em 2017. No entanto, a LSTM ainda operava por meio de processamento sequencial, assim como a maioria das outras RNNs. Especificamente, as RNNs processam um token por vez, do primeiro ao último, o que impossibilita a execução de operações em paralelo sobre todos os tokens de uma sequência.

Atenção com seq2seq

A ideia de transdução de sequências por meio de codificador-decodificador (encoder-decoder) foi desenvolvida no início da década de 2010. A origem do conceito seq2seq é comumente atribuída a dois artigos publicados simultaneamente em 2014. Um modelo de 380 milhões de parâmetros voltado para tradução automática utilizava duas redes LSTM. Sua arquitetura consistia em duas partes: o codificador (encoder), uma LSTM que recebia uma sequência de tokens e a transformava em um vetor; e o decodificador (decoder), outra LSTM que convertia esse vetor de volta em uma sequência de tokens. De forma semelhante, outro modelo de 130 milhões de parâmetros empregava unidades recorrentes estruturadas (GRUs) em vez de LSTMs. Pesquisas subsequentes demonstraram que as GRUs não apresentam desempenho superior ou inferior às LSTMs em tarefas de seq2seq.

Paralelização da atenção

Os modelos seq2seq com atenção (incluindo a autoatenção) ainda sofriam com o mesmo problema crônico das redes recorrentes: a dificuldade de paralelização, o que impedia sua aceleração em GPUs. Em 2016, o modelo de atenção decomponível aplicou um mecanismo de autoatenção a redes do tipo alimentadas adiante (feedforward), que são fáceis de paralelizar, alcançando o estado da arte em implicação textual com uma ordem de magnitude a menos de parâmetros do que as LSTMs. Um de seus autores, Jakob Uszkoreit, suspeitou que a atenção sem a presença de recorrência seria suficiente para a tradução de linguagem, o que inspirou o título "Attention is all you need" (A atenção é tudo o que você precisa). Essa hipótese contrariava o consenso científico da época, e até mesmo seu pai, Hans Uszkoreit, um linguista computacional de renome, demonstrou ceticismo. No mesmo ano, a autoatenção (então denominada atenção intra-fração ou atenção intra-frasal) foi proposta para aplicação em LSTMs.

A era do boom da inteligência artificial

Ainda no primeiro semestre de 2017, mesmo antes da publicação do rascunho de "Attention is all you need", um dos coautores aplicou a variação do modelo baseada exclusivamente no decodificador (decoder-only) para gerar artigos fictícios da Wikipédia. A arquitetura Transformer passou a ser utilizada em conjunto com diversos modelos generativos que sustentam o atual boom da inteligência artificial. A implementação de referência do Transformer original foi escrita sob a biblioteca TensorFlow. No campo da modelagem de linguagem, o ELMo (2018) destacou-se como uma LSTM bidirecional capaz de produzir incorporações contextuais de palavras, superando a linha de pesquisa baseada em saco de palavras e no word2vec. Ele foi seguido pelo BERT (2018), um modelo Transformer composto apenas pelo codificador (encoder-only). Em outubro de 2019, o Google passou a utilizar o BERT para processar consultas de pesquisa de usuários. Em 2020, o Google Tradutor substituiu o modelo anterior de codificador-RNN e decodificador-RNN por um modelo de codificador-Transformer e decodificador-RNN.

04

Treinamento

Imagem: Syced · CC0 · Openverse

Embora o foco primário do artigo na época fosse aperfeiçoar os sistemas de tradução automática, o documento também demonstrou a aplicação da arquitetura na tarefa de análise sintática de constituintes em inglês (English Constituency Parsing), utilizando conjuntos de dados de escalas limitadas e grandes. O modelo alcançou pontuações elevadas sem a necessidade de ajustes específicos para a tarefa, evidenciando o caráter generalista do modelo para tarefas de processamento de sequências (seq2seq).

Vídeos recomendados

Fontes consultadas

Continue pesquisando