Peça a uma IA para recomendar um laptop, depois diga que precisa de algo mais leve. Se o sistema ler essa segunda mensagem como uma solicitação isolada, você pode receber uma lista de ultrabooks. Ou pode receber outra pilha de workstations de jogos porque ele nunca registrou que você rejeitou o primeiro lote por ser muito pesado. Isso acontece porque muitos sistemas de IA ainda classificam as respostas analisando um único prompt de forma isolada. Eles tratam cada mensagem como o início de uma nova busca, ignorando a história contínua da conversa.

Essa abordagem ignora as nuances de um chat longo. O diálogo humano constrói significado turno após turno. Assumimos que a memória, a intenção e a preferência avançam. Quando a IA falha em fazer o mesmo, parece menos como falar com um assistente e mais como lançar consultas em uma caixa de pesquisa que é resetada após cada clique. Corrigir isso significa mudar a forma como classificamos as respostas possíveis. Em vez de perguntar qual resposta se ajusta a esta frase, precisamos perguntar qual resposta se ajusta a esta pessoa, agora, considerando tudo o que discutimos.

Duas coisas tornam isso possível: personalização e histórico.

Por que o ranking de turno único falha

O ranking de respostas tradicional surgiu de conjuntos de dados de perguntas e respostas. Um modelo vê um prompt, gera um conjunto de respostas candidatas e um ranker pontua cada uma apenas em relação a esse prompt. O candidato com a pontuação mais alta vence. Isso funciona para fatos isolados. Falha para trabalhos contínuos.

Imagine um usuário planejando uma viagem. No primeiro turno, ele pergunta sobre hotéis econômicos em Bangkok. O modelo sugere uma lista perto da Khao San Road. O usuário responde: "Esses parecem barulhentos. Tenho filhos, então preciso de uma piscina e acesso fácil ao Skytrain". Um ranker de turno único vê apenas a segunda frase. Ele pode retornar uma lista genérica de resorts familiares espalhados pela Tailândia, perdendo as restrições específicas já estabelecidas: Bangkok, econômico, silencioso, piscina, perto do transporte público.

O resultado é tecnicamente pertinente ao tema, mas praticamente inútil. O usuário tem que repetir o contexto. A fricção aumenta. A confiança diminui.

Personalização: Quem está perguntando

Personalização significa adaptar as respostas às preferências e dados específicos do usuário. Ela responde à pergunta: quem é esta pessoa?

Isso vai além de inserir um nome em uma saudação. Significa que o sistema sabe, por meio de perfis explícitos ou padrões aprendidos, como o usuário gosta que a informação seja entregue. Um desenvolvedor que solicita consistentemente exemplos em Python deve ver amostras de código Python mesmo quando sua consulta menciona uma tarefa de programação geral, a menos que especifique o contrário. Um vegetariano que pediu receitas na semana passada não deve ter que lembrar o sistema de excluir carne. Alguém que prefere tópicos concisos em vez de prosa deve receber tópicos.

Sinais concretos podem incluir preferências autorrelatadas, comportamento passado em várias sessões ou metadados como localização e tipo de dispositivo. A chave é que esses sinais alimentam a etapa de ranking, não apenas a etapa de geração. Quando as respostas candidatas são pontuadas, o ranker deve impulsionar as respostas que se alinham ao perfil conhecido.

Por exemplo, se duas respostas candidatas respondem corretamente a "Como faço backup das minhas fotos?", mas uma sugere armazenamento em nuvem e a outra sugere uma unidade NAS local, o ranker deve saber que este usuário em particular expressou interesse anteriormente em propriedade offline e privacidade. A opção de NAS deve ter uma pontuação mais alta. Sem personalização, o modelo joga uma moeda para o alto.

Histórico: O que já foi dito

Histórico significa usar turnos passados em uma conversa para guiar a próxima resposta. Ele responde à pergunta: o que já estabelecemos?

Até pronomes simples exigem histórico. Quando um usuário diz "Deixe-o azul", o modelo deve saber ao que o "o" se refere. Essa referência reside em um turno anterior. Em conversas mais longas, as dependências tornam-se complexas. As restrições se acumulam. O usuário pode rejeitar uma opção, qualificar um pedido ou introduzir um novo objetivo que