Síntese de fala
Síntese de fala é o processo de produção artificial de fala humana. Um sistema informático utilizado para este propósito é denominado sintetizador de fala, e pode ser implementado em software ou hardware. Um sistema texto-fala converte texto ortográfico em fala. Outros sistemas interpretam representação lingüística simbólica em fala.
Muito antes da invenção do processamento de sinal eletrônico, algumas pessoas tentaram construir máquinas para emular a fala humana. Algumas primeiras lendas do Brazen Head envolveram o Papa Silvestre II (946 – 1003), Albertus Magnus (1198 – 1280), e Roger Bacon (1214 – 1294). Em 1779, o cientista dinamarquês Christian Gottlieb Kratzenstein, que trabalhava na Academia de Ciências da Rússia, construiu modelos do trato vocal humano que podiam produzir os cinco sons das vogais longas (na notação alfabética fonética internacional: [aː], [eː] [Iː], [oː] e [uː]). Em seguida, a "máquina de fala acústico-mecânica" de Wolfgang von Kempelen, de Bratislava, então fazendo parte da Hungria, foi descrita em um artigo em 1791. Esta máquina adicionou modelos da língua e dos lábios, permitindo que fossem produzidas tanto consoantes quanto vogais. Em 1837, Charles Wheatstone produziu uma "máquina de falar" com base no projeto de von Kempelen. Em 1846, Joseph Faber exibiu a Euphonia. Em 1923, Paget ressuscitou o projeto de Wheatstone.
Dispositivos eletrônicos
Os primeiros sistemas de síntese de fala de computador surgiram no final da década de 1950. Em 1968, Noriko Umeda et al. desenvolveu o primeiro sistema texto-fala em inglês no Electrotechnical Laboratory, no Japão. Em 1961, o físico John Larry Kelly, Jr e seu colega Louis Gerstman usaram um computador IBM 704 para sintetizar discursos, um dos eventos mais proeminentes da história da Bell Labs. O sintetizador de fala de Kelly (vocoder) recriou a canção Daisy Bell, com acompanhamento musical de Max Mathews. Coincidentemente, Arthur C. Clarke estava visitando seu amigo e colega John Pierce nas instalações do Bell Labs Murray Hill. Clarke ficou tão impressionado com a demonstração, que a utilizou na cena culminante do seu roteiro para seu romance 2001: Uma Odisséia no Espaço, na qual o computador HAL 9000 canta a mesma música que o astronauta Dave Bowman coloca para dormir. Apesar do sucesso da síntese de fala puramente eletrônica, a pesquisa em sintetizadores de fala mecânicos continua.
As qualidades mais importantes de um sistema de síntese de fala são naturalidade (o quanto a saída se parece com a fala humana) e inteligibilidade (a facilidade com a qual a saída é compreendida). Os sistemas de síntese de fala geralmente tentam maximizar ambas as características. O sintetizador de fala ideal é natural e inteligível. As duas tecnologias primárias que geram formas de onda de fala sintéticas são síntese por concatenação e síntese de formante. Cada tecnologia tem pontos fortes e fracos, de modo que os usos pretendidos de um sistema de síntese de fala normalmente determinarão qual abordagem será utilizada.
Síntese por concatenação
A síntese por concatenação é baseada na concatenação de segmentos de fala gravada. Geralmente a síntese por concatenação produz a fala sintetizada mais natural. Entretanto, as diferenças entre as variações naturais na fala e a natureza das técnicas automatizadas para segmentar as formas de onda às vezes resultam em falhas audíveis na saída. Existem três subtipos principais de síntese por concatenação, síntese por seleção de unidades, síntese por dífonos e síntese por domínio específico. A síntese por seleção de unidades utiliza grandes bancos de dados de fala gravada. Durante a criação do banco de dados, cada enunciado gravado é segmentado em algumas das opções seguintes, sons individuais, dífonos, metades de sons, sílabas, morfemas, palavras, frases e sentenças. Tipicamente a divisão em segmentos é feita por meio de um reconhecedor de fala especialmente modificado, ajustado para um modo de "alinhamento forçado" com alguma correção manual posterior, usando representações visuais como a forma de onda e o espectrograma. Então, um índice das unidades na base de dados de fala é criado com base na segmentação e nos parâmetros acústicos como frequência fundamental (pitch), duração, posição na sílaba e sons vizinhos. Durante a execução, o enunciado é criado com a determinação da melhor cadeia de unidades candidatas a partir do banco de dados (seleção de unidade). Este processo é tipicamente realizado utilizando uma árvore de decisão especialmente ponderada.
Síntese de formantes
A síntese de formantes não utiliza amostras de fala humana durante a execução. Em vez disto, a saída de fala sintetizada é criada usando a síntese aditiva e um modelo acústico (síntese de modelação física). Parâmetros como freqüência fundamental, voicing e níveis de ruído são variados ao longo do tempo para criar uma forma de onda de fala artificial. Este método às vezes é chamado de síntese baseada em regras. Entretanto, muitos sistemas por concatenação também têm componentes baseados em regras. Muitos sistemas baseados em tecnologia de síntese de formantes geram discurso artificial e robótico, que nunca seria confundido com a fala humana. No entanto, a máxima naturalidade nem sempre é o objetivo de um sistema de síntese de fala. Os sistemas de síntese de formantes têm vantagens sobre os sistemas por concatenação. A fala sintetizada pelo formante pode ser inteligível de forma confiável mesmo sob velocidades muito altas, evitando falhas acústicas que comumente afetam os sistemas por concatenação. O discurso sintetizado de alta velocidade é usado pelas pessoas com deficiência visual para navegar rapidamente em computadores usando um leitor de tela. Os sintetizadores de formantes são geralmente programas menores do que os sistemas por concatenação porque não têm um banco de dados de amostras de fala. Portanto, podem ser usados em sistemas embarcados, em que memória e potência do microprocessador são especialmente limitados. Como os sistemas baseados em formantes têm o controle completo de todos os aspectos da fala de saída, uma grande variedade de prosodias e entonações podem ser produzidas transmitindo não apenas perguntas e declarações, como também uma variedade de emoções e tons de voz. Entre os exemplos de síntese de formantes sem ser em tempo real, mas com controle de entonação bastante preciso, estão o trabalho feito no final da década de 1970 para o brinquedo Speak & Spell, da Texas Instruments, e no início dos anos 1980 nas máquinas de arcade Sega e em muitos outros jogos arcade da Atari Inc. usando o TMS5220 LPC Chips. A criação da entonação adequada para estes projetos foi cuidadosa e os resultados ainda precisam ser acompanhados por interfaces texto-fala em tempo real.
Síntese articulatória
A síntese articulatória refere-se às técnicas computacionais para sintetizar a fala a partir de modelos e dos processos de articulação do trato vocal humano. O primeiro sintetizador articular utilizado regularmente para experiências laboratoriais foi desenvolvido no Haskins Laboratories em meados da década de 1970 por Philip Rubin, Tom Baer e Paul Mermelstein. Este sintetizador conhecido como ASY foi baseado em modelos do trato vocal desenvolvidos no Bell Laboratories nos anos 1960 e 1970 por Paul Mermelstein, Cecil Coker e seus colegas. Os modelos de síntese articulatória ainda não foram incorporados em sistemas comerciais de síntese da fala, com exceção do sistema baseado em NeXT originalmente desenvolvido e comercializado pela Trillium Sound Research, uma empresa spin-off da Universidade de Calgary, onde a maior parte da pesquisa original foi realizada.
Síntese baseada no modelo oculto de Markov
Na síntese baseada no modelo oculto de Markov (também chamada de síntese paramétrica estatística), o espectro de frequência (trato vocal), frequência fundamental (fonte de voz) e duração (prosódia) da fala são modelados simultaneamente pelo modelo oculto de Markov. As formas de onda de fala são geradas a partir do modelo oculto de Markov, com base no critério de máxima verosimilhança.
Síntese sinusoidal
A síntese sinusoidal é uma técnica para sintetizar a fala, substituindo os formantes (bandas principais de energia) pelos assobios de tom puro.


