Saltar para o conteúdo

Inteligência artificial

Dados de treino em português europeu: porque escasseiam e o que fazer

A esmagadora maioria do português disponível em corpos públicos é do Brasil. Sistemas treinados nesses dados respondem a um cliente português com o registo errado.

Equipa editorial da Corpshore Portugal

Escrito pela equipa que monta estas operações. Sem autoria individual atribuída: o que está aqui é trabalho revisto internamente, não opinião pessoal.

Publicado a

Dados de treino em português europeu: porque escasseiam e o que fazer

De onde vem o desequilíbrio?

Da demografia da internet. O Brasil tem cerca de vinte vezes a população de Portugal e uma presença digital proporcionalmente maior. Qualquer recolha que pese por volume acaba esmagadoramente brasileira, e a etiqueta de língua raramente distingue a variante.

O efeito prático aparece no atendimento: construções com gerúndio onde o português europeu usa infinitivo, vocabulário do Brasil em contextos portugueses, e um registo de proximidade onde o cliente espera cortesia formal.

O que fazer na prática?

Recolher e anotar dados de variante europeia com falantes nativos de Portugal, etiquetando a variante explicitamente em vez de assumir que português é uma coisa só. Isso significa construir o conjunto de avaliação primeiro, porque sem ele não se sabe se a correção funcionou.

Avaliar por variante e não em agregado. Um sistema com noventa por cento de acerto global pode ter setenta em português europeu, e a média esconde-o. O mesmo princípio serve para as variantes de Angola, Moçambique e Cabo Verde.

Como se mede a variante de um conjunto de dados?

Com marcadores que não são ambíguos, aplicados sobre uma amostra rotulada manualmente. A construção com gerúndio contra infinitivo preposicionado é o mais fiável: está a fazer contra está fazendo aparece em qualquer texto de alguma extensão e não tem sobreposição entre variantes.

Depois vêm os pares lexicais de alta frequência, que servem bem para texto de serviço: utilizador e usuário, ecrã e tela, telemóvel e celular, morada e endereço. E a colocação pronominal, que difere sistematicamente e é difícil de imitar sem conhecimento nativo.

O que não serve é a ortografia. O Acordo Ortográfico aproximou a grafia das duas variantes o suficiente para que classificar por grafia produza falsos positivos em quantidade. Um classificador construído sobre ortografia parece funcionar em teste e falha em produção, que é o pior modo de falha possível.

Que volume de dados é realmente preciso?

Para avaliação, menos do que as pessoas esperam: entre quinhentos e dois mil exemplos bem escolhidos e bem rotulados chegam para medir com confiança útil se um sistema se comporta de forma diferente nas duas variantes. É trabalho de semanas, não de meses, e é o primeiro que deve ser feito.

Para correcção, muito mais, e depende do que se está a corrigir. Ajustar registo e vocabulário em geração de texto exige ordens de grandeza superiores a avaliar. É por isso que a sequência importa: quem recolhe dados de treino antes de saber onde o sistema falha recolhe a coisa errada em quantidade.

Há ainda um caminho intermédio frequentemente suficiente: recuperação sobre uma base de conhecimento escrita na variante certa, em vez de ajuste do modelo. Se o sistema responde a partir de texto que alguém escreveu em português europeu, boa parte do problema de registo desaparece sem dados de treino nenhuns.

Quem deve fazer a anotação e em que condições?

Falantes nativos da variante, não falantes de português em geral, e com diretrizes escritas antes de começar. A diferença entre anotadores bem instruídos e mal instruídos é maior do que a diferença entre anotadores bons e medianos, e custa muito menos corrigir.

Com calibração regular. Sessões em que vários anotadores marcam os mesmos casos e discutem as divergências revelam ambiguidades nas diretrizes que nenhuma revisão isolada revela, e devem acontecer no início e depois periodicamente, porque a interpretação deriva com o tempo.

E em condições de trabalho que sustentem a atenção. A anotação é repetitiva e a qualidade cai mensuravelmente ao fim de algumas horas contínuas. Operações que medem apenas volume por hora obtêm volume por hora, e a degradação só aparece quando alguém audita uma amostra tardia.

Que questões legais se levantam na recolha?

Duas principais. A primeira é a base legal para tratar dados pessoais que apareçam no material: transcrições de chamadas, mensagens de apoio e correio electrónico contêm quase sempre dados pessoais, e usá-los para treinar um sistema é uma finalidade distinta da finalidade original de os ter recolhido.

A segunda é o direito de autor sobre o texto recolhido. Conteúdo público não é conteúdo livre, e a recolha em massa a partir da internet tem enquadramento próprio na União Europeia, com excepções para prospecção de textos e dados sujeitas a reserva de direitos pelo titular.

A abordagem que evita a maior parte destes problemas é começar pelos dados próprios, com pseudonimização aplicada antes da anotação e uma base legal documentada para a nova finalidade. É menos material do que a internet inteira e é material que descreve exactamente o domínio em que o sistema vai funcionar.

Como se sabe que a correcção funcionou?

Comparando o desempenho na variante europeia antes e depois, sobre o conjunto de avaliação separado que nunca foi usado para afinar. O número que interessa não é o global, é o da variante que estava pior, porque foi por essa que se fez o trabalho todo.

Vale a pena medir também se a outra variante piorou. Ajustar um sistema para produzir português europeu pode degradar a sua produção em português do Brasil, e uma operação que serve os dois mercados pode resolver um problema criando outro sem que ninguém repare durante meses.

E confirmar com pessoas. Métricas automáticas de semelhança textual não capturam registo, que é precisamente o que está em causa. Uma avaliação cega por falantes nativos, em que não sabem qual saída é qual, é o teste que conta e é bastante mais barato do que parece.

Que fontes existem e quais servem?

Corpora públicos de português existem e são maioritariamente brasileiros, com a variante raramente etiquetada. Servem como ponto de partida e exigem classificação prévia, e a classificação tem de ser validada manualmente numa amostra antes de se confiar nela em escala.

Fontes institucionais portuguesas, como publicações oficiais, legislação e documentação da administração, são inequivocamente de variante europeia e de qualidade linguística alta. O problema é o registo: é linguagem administrativa e formal, e treinar atendimento nela produz respostas que soam a ofício.

Dados próprios da operação são os mais valiosos e os mais restritos. Transcrições de chamadas, conversas de apoio e correio electrónico descrevem exactamente o domínio e o registo que interessam, e contêm dados pessoais que exigem base legal para a nova finalidade e pseudonimização antes da anotação.

Dados sintéticos produzidos por falantes nativos a partir de casos reais são o compromisso que funciona com mais frequência: mantêm o registo e o domínio, não carregam dados pessoais, e podem ser produzidos em volume dirigido às lacunas que a avaliação identificou.

Como se mede o registo, e não só a exactidão?

Com avaliação humana cega, que é o único instrumento que capta registo de forma fiável. Falantes nativos da variante comparam saídas sem saber qual veio de onde e pontuam adequação, e a diferença entre sistemas aparece de forma clara mesmo com amostras relativamente pequenas.

Com marcadores automáticos como complemento e não como substituto. A frequência de construção com gerúndio, a colocação pronominal e a incidência de vocabulário da outra variante são mensuráveis automaticamente e detectam degradação grosseira, o que é útil como alarme contínuo entre avaliações humanas.

E com reclamações reais como sinal de terra. Se os clientes de um mercado começam a comentar o tom das respostas, isso é informação de qualidade superior a qualquer métrica interna, e uma operação que não tem canal para essa informação chegar à equipa que ajusta o sistema está a desperdiçá-la.

O erro a evitar é medir apenas o que é fácil. Exactidão factual mede-se com facilidade e adequação de registo não, e uma operação que optimiza o que consegue medir acaba com um sistema factualmente correcto que soa estrangeiro, que é precisamente o problema com que se começou.

Perguntas frequentes

Porquê tão poucos dados europeus?
Porque a recolha pesa por volume e o Brasil tem cerca de vinte vezes a população de Portugal.
O modelo distingue as variantes?
Nem sempre, e raramente sem lhe ser pedido explicitamente. É preciso avaliar.
Por onde começar?
Pelo conjunto de avaliação em variante europeia, antes de recolher dados de treino.
Quem deve anotar?
Falantes nativos da variante, não falantes de português em geral.
Como se etiqueta a variante?
Explicitamente, no momento da recolha. Depois é praticamente impossível separar de forma fiável.
A média global esconde o quê?
Um desempenho muito inferior na variante minoritária, que é frequentemente o mercado que paga.
Que volume de dados é preciso?
Menos do que se pensa para avaliação, muito mais para correção. Comece pela avaliação.
E as variantes africanas?
Estão ainda menos representadas, e a mesma disciplina de etiquetagem e avaliação se aplica.

Vamos ver os números do seu caso

Diga-nos que processos quer externalizar, em que línguas e com que volumes. Devolvemos uma estimativa em euros e um desenho de operação, sem compromisso.

Respondemos em menos de 6 horas em dias úteis. Se preferir escrever: info@corpshore.solutions