IA
Avaliação e segurança
Avaliação de respostas de modelos, testes adversariais e revisão de segurança, por falantes nativos.
O que é entregue
Grelhas de avaliação escritas, com exemplos de fronteira
Avaliadores nativos da variante avaliada, não apenas da língua
Resultados por categoria de risco, com exemplos reproduzíveis
Porque é que a exactidão global não chega?
Porque esconde exactamente aquilo que interessa. Um sistema com noventa por cento de acerto global pode ter setenta numa categoria de caso ou numa variante de língua, e a média não o revela. A pergunta que um regulador faz é sobre o grupo em que o sistema se comporta pior, e é a que a média impede de responder.
Medimos por categoria de caso, por variante e por segmento de utilizador quando é relevante. Isso exige um conjunto de avaliação construído para cobrir essas divisões, o que por sua vez exige decidir antecipadamente quais são as divisões que importam, e é uma decisão de negócio e não técnica.
E medimos contra a concordância humana, que é o tecto. Se dois avaliadores experientes discordam em quinze por cento dos casos, nenhum sistema vai passar de oitenta e cinco, e anunciar noventa é sinal de que a avaliação está a medir outra coisa.
Como se testa de forma adversarial?
Procurando activamente as entradas que fazem o sistema falhar, em vez de confirmar que funciona nos casos que alguém escolheu. É trabalho de pessoas e é deliberadamente hostil ao sistema, porque o utilizador real também vai ser, ainda que sem intenção.
As categorias que mais frequentemente falham são previsíveis: entradas ambíguas, entradas em variante ou registo diferente do treino, entradas muito longas ou muito curtas, e entradas que combinam dois pedidos numa frase. Um teste adversarial que não cobre estas quatro não é adversarial.
Testamos também o que acontece quando o sistema é levado a sair do seu âmbito. Um sistema desenhado para responder sobre encomendas que responde sobre outra coisa qualquer quando alguém insiste é um risco de reputação e, conforme o que disser, um risco jurídico.
Como se avalia o registo e não só a exactidão?
Com avaliação humana cega, que é o único instrumento que capta registo de forma fiável. Falantes nativos da variante comparam saídas sem saber qual veio de onde e pontuam adequação, e a diferença entre sistemas aparece com clareza mesmo em amostras relativamente pequenas.
Com marcadores automáticos como complemento e não como substituto: frequência de construção com gerúndio, colocação pronominal e incidência de vocabulário da outra variante são mensuráveis automaticamente e detectam degradação grosseira entre avaliações humanas.
O erro a evitar é medir apenas o que é fácil. Exactidão factual mede-se com facilidade e adequação de registo não, e uma operação que optimiza o que consegue medir acaba com um sistema factualmente correcto que soa estrangeiro ao seu próprio mercado.
O que é que a avaliação contínua acrescenta?
Deteta a degradação, que acontece sem que nada mude no sistema. Os dados de entrada mudam, os utilizadores mudam de comportamento, e um sistema avaliado uma vez no arranque está a ser avaliado sobre um mundo que já não existe.
Fazemo-lo com uma amostra revista periodicamente por pessoas e com casos de controlo conhecidos inseridos na fila. Os casos de controlo medem duas coisas ao mesmo tempo: se o sistema continua a acertar e se a revisão humana continua a acontecer.
E com um limiar escrito a partir do qual a automação de um tipo de caso é suspensa. Ter o limiar definido antes evita a discussão de o definir durante o incidente, que é quando a pressão para não suspender é maior.
Que documentação resulta desta avaliação?
Uma descrição do conjunto de avaliação, dos resultados por categoria e por variante, e das limitações conhecidas do sistema. Essa última parte é a que falta em quase toda a documentação de sistemas automatizados e é a que responde à pergunta que alguém faz quando alguma coisa corre mal.
O registo de alterações e do seu efeito medido: quando o sistema mudou, porquê, e o que aconteceu aos números depois. Um sistema que muda sem registo torna qualquer análise histórica inválida, e a primeira vez que isso importa é sempre durante uma investigação.
E o material que sustenta as obrigações do Regulamento da Inteligência Artificial conforme o nível de risco: gestão de risco, qualidade de dados, documentação técnica e evidência de supervisão humana efectiva. Produzimos o material; a responsabilidade de gestão fica com o cliente, porque não é delegável.
Onde é que este trabalho é feito?
A avaliação de português europeu é feita por falantes nativos de Portugal, porque um avaliador que não é nativo da variante não detecta de forma fiável o que está a avaliar. É o mesmo requisito que se aplica à anotação e pela mesma razão.
Para as variantes africanas, o corredor lusófono. Para avaliação sobre conjuntos sintéticos, a rede global, porque não há dados pessoais envolvidos e a questão de residência não se coloca.
Quando a avaliação implica ler saídas reais que contêm dados pessoais, aplicam-se as mesmas regras que a qualquer outro tratamento, e a revisão humana torna a questão mais sensível do que em processamento automático, porque uma pessoa lê o conteúdo integralmente.
O que é que uma avaliação honesta produz de incómodo?
Normalmente um número pior do que o que a organização esperava, e é esse o valor. Uma avaliação que confirma o que já se acreditava não acrescentou informação, e a resistência que encontramos com mais frequência não é técnica: é que alguém já comunicou um número que a medição não sustenta.
Entregamos o número com o contexto necessário para o interpretar, incluindo o tecto imposto pela concordância humana, que frequentemente explica boa parte da diferença. O objectivo não é mostrar que o sistema é mau; é saber onde falha para decidir o que fazer com essa informação.
Onde pode ser operado o avaliação e segurança
Nem todos os modelos de entrega servem todos os serviços. A tabela indica apenas os que fazem sentido para este trabalho, com a situação de residência de dados de cada um.
| Modelo | Onde | Quando faz sentido | Dados pessoais |
|---|---|---|---|
| Corredor lusófono | Coordenação em Lisboa, operação em Luanda, Maputo e Praia | Quando opera em Angola ou Moçambique e precisa de governação europeia | A camada de Lisboa fica no EEE. A operação local exige cláusulas contratuais-tipo. |
| Rede global | Uzbequistão, Filipinas, Polónia, República Dominicana, México, Colômbia, Turquia e África | Quando precisa de cobertura contínua, de línguas específicas ou do menor custo | A Polónia fica no EEE. Os restantes exigem cláusulas contratuais-tipo. |
A coluna de dados é uma descrição do enquadramento aplicável e não aconselhamento jurídico. O detalhe está em transferências internacionais de dados.
Este serviço exige uma decisão de variante
Serve clientes em Portugal, no Brasil ou nos dois? A resposta muda o desenho da operação, os guiões, quem revê a qualidade e a forma como os resultados são reportados.
Serviços relacionados
- Serviços geridos de IAOperação continuada de fluxos assistidos por IA, com pessoas no circuito onde o risco o exige.
- Dados de treinoRecolha, anotação e revisão de dados para treino de modelos, incluindo português europeu e variantes africanas.
- Agentes e automaçãoAutomação de processos repetitivos e agentes assistidos, com supervisão e limites definidos.
- Inteligência documentalExtração e classificação de informação a partir de documentos, com verificação humana onde importa.
Perguntas frequentes
Porque não basta a exactidão global?
Porque esconde a categoria ou a variante onde o sistema falha, que é precisamente a pergunta que um regulador faz.
Qual é o tecto de exactidão?
A concordância entre avaliadores humanos. Anunciar acima disso é sinal de que a avaliação mede outra coisa.
Como testam de forma adversarial?
Procurando activamente as entradas que falham, incluindo variante diferente, entradas ambíguas e pedidos combinados numa frase.
Como avaliam o registo?
Com avaliação humana cega por falantes nativos, com marcadores automáticos apenas como complemento.
A avaliação é contínua?
É, porque a degradação acontece sem nada mudar no sistema: os dados e o comportamento dos utilizadores mudam.
O que é um caso de controlo?
Um caso conhecido inserido na fila, que mede se o sistema continua a acertar e se a revisão humana continua a acontecer.
Quem decide suspender a automação?
O limiar está escrito antes, o que evita a discussão durante o incidente, que é quando a pressão para não suspender é maior.
Produzem a documentação regulatória?
Produzimos o material. A responsabilidade de gestão fica com o cliente, porque não é delegável.
Vamos ver os números do seu caso
Diga-nos que processos quer externalizar, em que línguas e com que volumes. Devolvemos uma estimativa em euros e um desenho de operação, sem compromisso.
Respondemos em menos de 6 horas em dias úteis. Se preferir escrever: info@corpshore.solutions