Inteligência artificial
Dados de treino em português europeu: porque escasseiam e o que fazer
A esmagadora maioria do português disponível em corpos públicos é do Brasil. Sistemas treinados nesses dados respondem a um cliente português com o registo errado.
Equipa editorial da Corpshore Portugal
Escrito pela equipa que monta estas operações. Sem autoria individual atribuída: o que está aqui é trabalho revisto internamente, não opinião pessoal.
Publicado a

De onde vem o desequilíbrio?
Da demografia da internet. O Brasil tem cerca de vinte vezes a população de Portugal e uma presença digital proporcionalmente maior. Qualquer recolha que pese por volume acaba esmagadoramente brasileira, e a etiqueta de língua raramente distingue a variante.
O efeito prático aparece no atendimento: construções com gerúndio onde o português europeu usa infinitivo, vocabulário do Brasil em contextos portugueses, e um registo de proximidade onde o cliente espera cortesia formal.
O que fazer na prática?
Recolher e anotar dados de variante europeia com falantes nativos de Portugal, etiquetando a variante explicitamente em vez de assumir que português é uma coisa só. Isso significa construir o conjunto de avaliação primeiro, porque sem ele não se sabe se a correção funcionou.
Avaliar por variante e não em agregado. Um sistema com noventa por cento de acerto global pode ter setenta em português europeu, e a média esconde-o. O mesmo princípio serve para as variantes de Angola, Moçambique e Cabo Verde.
Como se mede a variante de um conjunto de dados?
Com marcadores que não são ambíguos, aplicados sobre uma amostra rotulada manualmente. A construção com gerúndio contra infinitivo preposicionado é o mais fiável: está a fazer contra está fazendo aparece em qualquer texto de alguma extensão e não tem sobreposição entre variantes.
Depois vêm os pares lexicais de alta frequência, que servem bem para texto de serviço: utilizador e usuário, ecrã e tela, telemóvel e celular, morada e endereço. E a colocação pronominal, que difere sistematicamente e é difícil de imitar sem conhecimento nativo.
O que não serve é a ortografia. O Acordo Ortográfico aproximou a grafia das duas variantes o suficiente para que classificar por grafia produza falsos positivos em quantidade. Um classificador construído sobre ortografia parece funcionar em teste e falha em produção, que é o pior modo de falha possível.
Que volume de dados é realmente preciso?
Para avaliação, menos do que as pessoas esperam: entre quinhentos e dois mil exemplos bem escolhidos e bem rotulados chegam para medir com confiança útil se um sistema se comporta de forma diferente nas duas variantes. É trabalho de semanas, não de meses, e é o primeiro que deve ser feito.
Para correcção, muito mais, e depende do que se está a corrigir. Ajustar registo e vocabulário em geração de texto exige ordens de grandeza superiores a avaliar. É por isso que a sequência importa: quem recolhe dados de treino antes de saber onde o sistema falha recolhe a coisa errada em quantidade.
Há ainda um caminho intermédio frequentemente suficiente: recuperação sobre uma base de conhecimento escrita na variante certa, em vez de ajuste do modelo. Se o sistema responde a partir de texto que alguém escreveu em português europeu, boa parte do problema de registo desaparece sem dados de treino nenhuns.
Quem deve fazer a anotação e em que condições?
Falantes nativos da variante, não falantes de português em geral, e com diretrizes escritas antes de começar. A diferença entre anotadores bem instruídos e mal instruídos é maior do que a diferença entre anotadores bons e medianos, e custa muito menos corrigir.
Com calibração regular. Sessões em que vários anotadores marcam os mesmos casos e discutem as divergências revelam ambiguidades nas diretrizes que nenhuma revisão isolada revela, e devem acontecer no início e depois periodicamente, porque a interpretação deriva com o tempo.
E em condições de trabalho que sustentem a atenção. A anotação é repetitiva e a qualidade cai mensuravelmente ao fim de algumas horas contínuas. Operações que medem apenas volume por hora obtêm volume por hora, e a degradação só aparece quando alguém audita uma amostra tardia.
Que questões legais se levantam na recolha?
Duas principais. A primeira é a base legal para tratar dados pessoais que apareçam no material: transcrições de chamadas, mensagens de apoio e correio electrónico contêm quase sempre dados pessoais, e usá-los para treinar um sistema é uma finalidade distinta da finalidade original de os ter recolhido.
A segunda é o direito de autor sobre o texto recolhido. Conteúdo público não é conteúdo livre, e a recolha em massa a partir da internet tem enquadramento próprio na União Europeia, com excepções para prospecção de textos e dados sujeitas a reserva de direitos pelo titular.
A abordagem que evita a maior parte destes problemas é começar pelos dados próprios, com pseudonimização aplicada antes da anotação e uma base legal documentada para a nova finalidade. É menos material do que a internet inteira e é material que descreve exactamente o domínio em que o sistema vai funcionar.
Como se sabe que a correcção funcionou?
Comparando o desempenho na variante europeia antes e depois, sobre o conjunto de avaliação separado que nunca foi usado para afinar. O número que interessa não é o global, é o da variante que estava pior, porque foi por essa que se fez o trabalho todo.
Vale a pena medir também se a outra variante piorou. Ajustar um sistema para produzir português europeu pode degradar a sua produção em português do Brasil, e uma operação que serve os dois mercados pode resolver um problema criando outro sem que ninguém repare durante meses.
E confirmar com pessoas. Métricas automáticas de semelhança textual não capturam registo, que é precisamente o que está em causa. Uma avaliação cega por falantes nativos, em que não sabem qual saída é qual, é o teste que conta e é bastante mais barato do que parece.
Que fontes existem e quais servem?
Corpora públicos de português existem e são maioritariamente brasileiros, com a variante raramente etiquetada. Servem como ponto de partida e exigem classificação prévia, e a classificação tem de ser validada manualmente numa amostra antes de se confiar nela em escala.
Fontes institucionais portuguesas, como publicações oficiais, legislação e documentação da administração, são inequivocamente de variante europeia e de qualidade linguística alta. O problema é o registo: é linguagem administrativa e formal, e treinar atendimento nela produz respostas que soam a ofício.
Dados próprios da operação são os mais valiosos e os mais restritos. Transcrições de chamadas, conversas de apoio e correio electrónico descrevem exactamente o domínio e o registo que interessam, e contêm dados pessoais que exigem base legal para a nova finalidade e pseudonimização antes da anotação.
Dados sintéticos produzidos por falantes nativos a partir de casos reais são o compromisso que funciona com mais frequência: mantêm o registo e o domínio, não carregam dados pessoais, e podem ser produzidos em volume dirigido às lacunas que a avaliação identificou.
Como se mede o registo, e não só a exactidão?
Com avaliação humana cega, que é o único instrumento que capta registo de forma fiável. Falantes nativos da variante comparam saídas sem saber qual veio de onde e pontuam adequação, e a diferença entre sistemas aparece de forma clara mesmo com amostras relativamente pequenas.
Com marcadores automáticos como complemento e não como substituto. A frequência de construção com gerúndio, a colocação pronominal e a incidência de vocabulário da outra variante são mensuráveis automaticamente e detectam degradação grosseira, o que é útil como alarme contínuo entre avaliações humanas.
E com reclamações reais como sinal de terra. Se os clientes de um mercado começam a comentar o tom das respostas, isso é informação de qualidade superior a qualquer métrica interna, e uma operação que não tem canal para essa informação chegar à equipa que ajusta o sistema está a desperdiçá-la.
O erro a evitar é medir apenas o que é fácil. Exactidão factual mede-se com facilidade e adequação de registo não, e uma operação que optimiza o que consegue medir acaba com um sistema factualmente correcto que soa estrangeiro, que é precisamente o problema com que se começou.
Perguntas frequentes
- Porquê tão poucos dados europeus?
- Porque a recolha pesa por volume e o Brasil tem cerca de vinte vezes a população de Portugal.
- O modelo distingue as variantes?
- Nem sempre, e raramente sem lhe ser pedido explicitamente. É preciso avaliar.
- Por onde começar?
- Pelo conjunto de avaliação em variante europeia, antes de recolher dados de treino.
- Quem deve anotar?
- Falantes nativos da variante, não falantes de português em geral.
- Como se etiqueta a variante?
- Explicitamente, no momento da recolha. Depois é praticamente impossível separar de forma fiável.
- A média global esconde o quê?
- Um desempenho muito inferior na variante minoritária, que é frequentemente o mercado que paga.
- Que volume de dados é preciso?
- Menos do que se pensa para avaliação, muito mais para correção. Comece pela avaliação.
- E as variantes africanas?
- Estão ainda menos representadas, e a mesma disciplina de etiquetagem e avaliação se aplica.
Vamos ver os números do seu caso
Diga-nos que processos quer externalizar, em que línguas e com que volumes. Devolvemos uma estimativa em euros e um desenho de operação, sem compromisso.
Respondemos em menos de 6 horas em dias úteis. Se preferir escrever: info@corpshore.solutions