Open source · pesquisa aplicada

ground-first

A skill que faz o modelo entender O QUE você quis dizer antes de responder — com benchmark cross-vendor público.

Open source Público no GitHub · Benchmark cross-vendor v2 validado

O problema

O modelo responde a versão MAIS PLAUSÍVEL do seu pedido — não necessariamente a SUA. Uma referência cultural, uma gíria, um nome de projeto interno: ele preenche a lacuna com um chute fluente, e você só percebe depois de pagar pela resposta errada.

O protocolo

DETECT — a skill classifica o risco de interpretação da mensagem (referência do seu contexto? gíria? conteúdo recente?). GROUND — em risco médio/alto, declara a interpretação num bloco escaneável (e busca na web quando o mundo externo é a fonte). ANSWER — só então responde. Errou a leitura? Você corrige em uma linha, não depois de 800 tokens.

Benchmark, não opinião

0 chamadas no benchmark v2 36 casos × 3 rodadas × 6 vendors
0.94–1.00 especificidade silêncio quando a pergunta é clara
0.905 acurácia balanceada no escopo do benchmark

O difícil não é detectar ambiguidade — é ficar quieto quando não há. A especificidade alta é o resultado de que mais me orgulho: a skill não vira burocracia em pergunta simples.

Portável por design

Funciona em Claude Code, Codex, Gemini e qualquer chat — o protocolo é texto, não plugin. É também um padrão que uso nos meus produtos: a Braga Suite exige evidência antes de responder pela mesma razão.

Meu papel

Autor do protocolo, da skill e do benchmark cross-vendor. Código e avaliação públicos.

Quer construir algo assim?

Sem compromisso: me conta o contexto e eu digo o que dá para provar primeiro.

Iniciar uma conversa