O benchmark cego: o que foi medido, como — e o que os números não dizem
A landing mostra os resultados. Esta página mostra o método, a tabela inteira e os limites do estudo.
Em 25/06/2026 comparamos o Cérebro do Mentor — no estudo de caso de uma profissional de saúde — a quatro modelos generalistas de grandes fornecedores, sobre as mesmas perguntas: 200 dentro de um corpus clínico curado e 75 fora dele, avaliadas por dois juízes cegos. O Cérebro foi mais fiel ao acervo (7,7 contra 2,3 do melhor generalista), mais rastreável (7,9 contra 1,0) e se absteve honestamente com muito mais frequência (97% contra 40%).
O que o estudo comparou?
Cinco sistemas responderam ao mesmo conjunto de perguntas, e as respostas foram avaliadas sem que os juízes soubessem qual sistema produziu cada uma. O desenho tem duas partes, e a segunda é a que costuma faltar em comparações de IA:
- 200 perguntas dentro do corpus — mede se o sistema usa bem o material que tem;
- 75 perguntas fora do corpus — mede o que o sistema faz quando não tem material. É aqui que a invenção aparece, e é por isso que essas perguntas existem.
A análise usou intervalo de confiança de 95% e teste de Tukey HSD para comparação múltipla entre sistemas. O corpus é o acervo real de uma mentora de saúde — não um conjunto sintético montado para a ocasião.
A tabela completa
| Sistema | Fidelidade 0–10 ↑ |
Rastreabilidade 0–10 ↑ |
Alucinações por pergunta ↓ |
Abstenção honesta ↑ |
|---|---|---|---|---|
| Cérebro do Mentor | 7,7 | 7,9 | 2,96 | 97% |
| Modelo generalista A | 2,3 | 1,0 | 12,63 | 8% |
| Modelo generalista B | 1,5 | 0,7 | 15,18 | 5% |
| Modelo generalista C | 1,3 | 0,7 | 17,23 | 40% |
| Modelo generalista D | 1,3 | 0,7 | 17,92 | 16% |
Benchmark cego · 25/06/2026 · n = 200 (corpus) + 75 (fora do corpus) · 5 sistemas · 2 juízes cegos
O que cada métrica significa?
- Fidelidade ao acervo — o quanto a resposta reflete o material do mentor, em vez do conhecimento geral com que o modelo foi treinado.
- Rastreabilidade às fontes — se dá para chegar ao documento que sustenta cada afirmação. É o que permite auditar uma resposta meses depois.
- Alucinações por pergunta — quantas afirmações sem lastro aparecem, em média, em cada resposta. Menor é melhor.
- Abstenção honesta — com que frequência o sistema diz que não sabe, em vez de preencher a lacuna. Tratamos isso como qualidade, não como falha: em contexto clínico, a confabulação convincente é um risco, não apenas um erro.
O teste das entidades inventadas
Além das perguntas, o estudo apresentou aos sistemas 30 conceitos que não existem, como se existissem, para ver o que fariam.
Os modelos generalistas produziram descrições convincentes para esses conceitos inexistentes em 53% a 97% das vezes. O Cérebro do Mentor, em nenhuma das 30.
Este é o resultado mais direto do desenho: um sistema que só responde a partir de um acervo definido não tem de onde tirar a descrição de algo que não está lá — e sinaliza a lacuna em vez de preencher.
O que este estudo não prova
Os limites importam tanto quanto os números, e quem publica um benchmark sem eles está vendendo, não medindo.
- Não dizemos “zero alucinação”. A taxa medida foi 2,96 por pergunta — menor que a dos generalistas, e diferente de zero. O “0 de 30” vale para aquele conjunto de entidades inventadas, não como garantia geral.
- É um acervo, não o mercado. O corpus é o de uma mentora de saúde real. Outro acervo, com outra curadoria, pode render outro número — inclusive pior, se o material estiver desorganizado.
- Os juízes são modelos de linguagem, não avaliadores humanos. Usar dois, de forma cega, reduz o viés de juiz único, mas continua sendo avaliação automatizada.
- Os generalistas estão anonimizados (A–D) e são de junho de 2026. Modelos mudam rápido: o número tem data, e a data está declarada.
- Nada disso é conformidade garantida, adequação à legislação nem segurança jurídica. Fidelidade e rastreabilidade são propriedades da resposta — quem responde perante o conselho ou regulador é o profissional.
Onde ler a íntegra
A metodologia completa, os dados e a análise estatística estão no whitepaper aberto: “Inteligência artificial curada por especialista na arquitetura Cérebro do Mentor: fidelidade, rastreabilidade e abstenção honesta frente a modelos de linguagem generalistas”.
Como o sistema chega a esses números está descrito em engenharia: o acervo organizado em grafo por uma ontologia do conselho ou regulador, a extração local e a proveniência de cada afirmação. E o que acontece com os seus dados no caminho está em soberania de dados.