A Graphite, uma empresa de marketing, fez um estudo sobre os hábitos de escrita dos modelos de IA de ponta, os mais avançados de cada laboratório. Ela levantou as palavras e frases favoritas de cada modelo e achou 13 mil expressões que eram pelo menos duas vezes mais comuns em conteúdo de IA do que em conteúdo humano. A empresa chama cada uma delas de “tell” (“sinal”, em inglês).
Greg Druck, diretor de inteligência artificial da Graphite, apontou ao TechCrunch uma diferença entre as famílias de modelos. Segundo ele, o vocabulário dos modelos Claude chega cada vez mais perto do humano ao longo do tempo, enquanto o dos modelos GPT se afasta.
Mesmo assim, segundo a Graphite, o total de sinais se mantém, em boa parte, estável. “Não é como se os sinais estivessem diminuindo”, disse Druck. Segundo ele, os laboratórios conseguem remover os sinais mais conhecidos, mas outros aparecem, e cada versão de modelo tem os seus.
Alguns sinais são palavras ou expressões curtas. Segundo a Graphite, no Claude Opus 5.5, da Anthropic, o maior sinal é a palavra “dependable” (“confiável”), que aparece 23 vezes mais do que nas amostras humanas. No Astra, da OpenAI, o gosto é por descrever “another dimension” (“outra dimensão”) do assunto de que fala.
Outros sinais são construções de contraste, nas quais uma ideia é posta contra outra. Segundo a reportagem, os modelos ainda recorrem a elas. Segundo a Graphite, o Opus 5.5 já evita a fórmula “it's not X, it's Y” (“não é X, é Y”), mas ainda tende a dizer que algo “é mais do que um X, é um Y”.
No Astra, o maior sinal é o que a Graphite chama de “corrective framing” (“enquadramento corretivo”). Nele, um tema é definido como “not simply X” (“não apenas X”) ou apresentado como alternativa, com “rather than relying on X” (“em vez de depender de X”). Segundo a pesquisa, essas construções foram mais de 100 vezes mais comuns no texto do Astra do que na escrita humana.
Segundo o estudo, o Astra também tende a suavizar afirmações, dizendo que uma ação “may provide” ou “can provide” (“pode oferecer”) certo benefício.
Outro hábito é explicar por que algo importa. Segundo a Graphite, o Opus 5.5 usa a expressão “this matters” (“isso importa”) 116 vezes mais do que a escrita humana. Já “why X matters” (“por que X importa”) aparece 92 vezes mais.
Os sinais mais antigos, como o travessão (o traço longo que separa trechos de uma frase) e a palavra “delve” (verbo inglês que significa “investigar a fundo”), já saíram de cena, segundo o TechCrunch. A reportagem observa que todos os grandes laboratórios parecem ter reagido à ideia de que os modelos abusam do travessão.
Nas amostras da Graphite, o Opus 5.5 usou o travessão 99% menos do que o Opus 5. O Astra agora o usa 88% menos do que as amostras humanas. Já o Gemini 3.1 Pro quase eliminou o travessão da própria escrita.
Por que importa
A Anthropic e a OpenAI destacaram a escrita dos seus modelos ao lançá-los. Ao lançar o Opus 5.5, a Anthropic disse que o modelo “se comunica de forma mais natural do que os anteriores” e que os primeiros usuários acharam a escrita mais clara e fácil de acompanhar.
A OpenAI fez afirmações parecidas ao lançar as versões GPT-6 de Sol e Luna, e disse que os usuários poderiam esperar mais clareza, menos jargão e menos expressões estranhas. O TechCrunch considera surpreendente que os sinais sejam tão persistentes, dado o foco dos laboratórios em estilos de escrita parecidos com o humano.
Na comparação, a Graphite partiu de 10 mil artigos publicados antes do lançamento do ChatGPT, que serviram de grupo de controle, isto é, o conjunto humano usado como referência. Depois, modelos diferentes reescreveram os artigos a partir de resumos, na tentativa de reduzir o máximo possível o viés da fonte. Com amostras equivalentes de pessoas e de cada modelo, os pesquisadores puderam comparar a frequência de certas palavras e frases, além de padrões mais amplos na construção das frases.
Druck duvida que os laboratórios consigam eliminar essas marcas por completo. Para ele, as empresas talvez controlem esses hábitos menos do que se imagina. Ele lembra que os modelos são gigantes, com bilhões de parâmetros (os números internos que o modelo ajusta no treino), e que as empresas só conseguem rodar um número finito de testes. “As coisas escapam”, disse.
