O problema
O modelo responde a versão MAIS PLAUSÍVEL do seu pedido — não necessariamente a SUA. Uma referência cultural, uma gíria, um nome de projeto interno: ele preenche a lacuna com um chute fluente, e você só percebe depois de pagar pela resposta errada.
O protocolo
DETECT — a skill classifica o risco de interpretação da mensagem (referência do seu contexto? gíria? conteúdo recente?). GROUND — em risco médio/alto, declara a interpretação num bloco escaneável (e busca na web quando o mundo externo é a fonte). ANSWER — só então responde. Errou a leitura? Você corrige em uma linha, não depois de 800 tokens.
Benchmark, não opinião
O difícil não é detectar ambiguidade — é ficar quieto quando não há. A especificidade alta é o resultado de que mais me orgulho: a skill não vira burocracia em pergunta simples.
Portável por design
Funciona em Claude Code, Codex, Gemini e qualquer chat — o protocolo é texto, não plugin. É também um padrão que uso nos meus produtos: a Braga Suite exige evidência antes de responder pela mesma razão.
Meu papel
Autor do protocolo, da skill e do benchmark cross-vendor. Código e avaliação públicos.