DoorDash troca modelos tradicionais por agentes de IA para personalizar recomendações

13 min
DoorDash troca modelos tradicionais por agentes de IA para personalizar recomendações

Entenda como a DoorDash utiliza memória do consumidor e IDs semânticos para transformar recomendações no e-commerce.

A DoorDash está reformulando sua arquitetura de recomendações ao migrar de modelos preditivos tradicionais para sistemas baseados em agentes de IA. A nova abordagem combina memória do consumidor em linguagem natural, IDs semânticos para representar produtos e mecanismos de recuperação que permitem personalização em grande escala.

Em vez de depender apenas de vetores numéricos, a arquitetura busca oferecer aos modelos uma compreensão mais explícita sobre preferências, contexto, restrições e histórico do consumidor.

A estratégia também tenta resolver um dos principais problemas do uso de LLMs em sistemas de recomendação: o custo de gerar decisões personalizadas em tempo real para milhões de usuários.

  • Memória em linguagem natural: transforma o histórico do consumidor em informações compreensíveis por LLMs.

  • Semantic IDs com RQ-VAE: organizam produtos em uma estrutura conceitual e hierárquica.

    # publicidade

  • Recuperação generativa em lote: reduz o custo de usar modelos de linguagem em grande escala.

  • Grounded search: limita recomendações ao catálogo realmente disponível.

  • Arquitetura híbrida: combina agentes e LLMs com sistemas tradicionais de ranking.

Da recomendação pontual para a memória do consumidor

Durante anos, sistemas de e-commerce utilizaram embeddings numéricos para representar o comportamento dos usuários.

Cliques, compras, buscas e interações eram transformados em vetores matemáticos. Esses vetores funcionam bem para tarefas tradicionais, como classificação e ranking, mas possuem uma limitação importante: eles não explicam claramente o que o consumidor gosta ou por que determinada recomendação faz sentido.

Um vetor pode indicar que dois usuários possuem comportamentos semelhantes.

Mas um agente de IA precisa de informações mais explícitas para raciocinar sobre uma decisão.

Por exemplo, existe uma diferença importante entre representar um usuário como uma sequência numérica e fornecer ao sistema informações como:

"O cliente costuma comprar refeições vegetarianas durante a semana, prefere opções abaixo de determinado valor e tende a escolher produtos de determinadas marcas."

É exatamente nesse ponto que entra a memória do consumidor em linguagem natural.

A ideia é transformar sinais comportamentais em blocos narrativos que possam ser utilizados diretamente no contexto de modelos de linguagem.

O perfil deixa de ser apenas uma representação matemática e passa a incluir informações explícitas sobre:

  • Preferências alimentares

  • Sensibilidade a preços

  • Afinidade com marcas

  • Restrições dietéticas

  • Hábitos de compra

  • Preferências recorrentes

  • Contexto recente de navegação

Isso permite que um agente tenha uma visão mais próxima de uma conversa sobre o consumidor, em vez de trabalhar exclusivamente com representações vetoriais.

Comparativo entre modelos tradicionais e arquitetura baseada em agentes

Característica

Modelos legados de recomendação

Arquitetura com agentes de IA

Perfil do consumidor

Embeddings numéricos densos

Blocos de memória em linguagem natural

Identificação do catálogo

SKU aleatório ou taxonomia rígida

Semantic IDs hierárquicos com RQ-VAE

Contexto utilizado

Histórico recente e sinais pontuais

Memória de longo prazo, sessão e tempo real

Tomada de decisão

Modelos de classificação e ranking

LLMs, ferramentas e agentes autônomos

Disponibilidade de produtos

Recuperação tradicional

Busca grounded no catálogo ativo

Personalização complexa

Limitada pelo modelo e features

Capacidade de combinar múltiplas restrições

Arraste para o lado para ver toda a tabela.

Como funcionam os blocos de memória versionados

Transformar o histórico de um consumidor em linguagem natural cria outro problema: como garantir que a memória utilizada em um experimento seja exatamente a mesma que foi usada anteriormente?

A resposta está no versionamento.

Cada bloco de memória pode receber uma versão específica. Isso permite comparar diferentes estratégias de extração e realizar experimentos sem perder rastreabilidade.

Por exemplo, uma primeira versão pode representar um usuário assim:

"Prefere restaurantes econômicos e costuma pedir comida italiana."

Uma nova estratégia de extração pode gerar uma memória mais detalhada:

"Nas últimas oito semanas, o usuário demonstrou preferência por refeições italianas, com maior frequência durante os finais de semana. Seu ticket médio indica preferência por pedidos abaixo de determinado valor."

As duas versões podem ser avaliadas em experimentos diferentes.

Esse versionamento permite:

  • Realizar testes A/B.

  • Comparar estratégias de geração de memória.

  • Reproduzir experimentos anteriores.

  • Avaliar mudanças offline.

  • Identificar regressões.

  • Fazer uma espécie de "viagem no tempo" da memória utilizada pelo sistema.

Sem esse controle, seria difícil saber se uma mudança na qualidade das recomendações foi causada pelo modelo, pelo prompt, pela extração do histórico ou por alterações nos próprios dados.

Memória em linguagem natural não elimina os modelos tradicionais

A mudança para uma arquitetura baseada em agentes não significa abandonar todo o investimento anterior em machine learning.

Na prática, a estratégia pode ser híbrida.

Os blocos narrativos de memória podem ser codificados e transformados novamente em representações utilizadas pelos sistemas tradicionais de ranking.

Isso permite combinar duas abordagens.

De um lado:

A capacidade de raciocínio e interpretação dos LLMs.

Do outro:

A velocidade e eficiência de modelos especializados em classificação e ranking.

Essa arquitetura híbrida evita a necessidade de substituir toda a infraestrutura existente de uma única vez.

Também permite utilizar LLMs para tarefas nas quais eles oferecem mais valor, enquanto modelos menores e especializados continuam executando operações previsíveis e de alto volume.

O problema dos SKUs aleatórios para agentes de IA

Outro desafio aparece no catálogo.

Em sistemas tradicionais de e-commerce, um produto costuma ser identificado por um SKU ou outro identificador interno.

Para o computador, isso é suficiente.

Para um agente que precisa raciocinar sobre alternativas, substituições e relações entre produtos, não necessariamente.

Imagine que um consumidor procura um determinado molho de pimenta.

O produto está indisponível.

Um SKU tradicional pode informar apenas que aquele item específico não está mais em estoque.

Mas isso não explica automaticamente ao sistema quais produtos são conceitualmente semelhantes.

Uma arquitetura baseada em semantic IDs tenta resolver esse problema.

Em vez de representar cada item como um identificador isolado, os produtos recebem representações que refletem sua posição dentro de uma estrutura semântica.

Isso permite estabelecer relações como:

Alimento → Condimento → Molho → Picante → Categoria específica

Dessa forma, o sistema pode encontrar produtos próximos mesmo quando o item original não está disponível.

Como o RQ-VAE ajuda a criar IDs semânticos

A abordagem utiliza técnicas de quantização vetorial, como RQ-VAE, para representar itens dentro de uma estrutura hierárquica.

A ideia é substituir identificadores completamente arbitrários por sequências que carreguem informações sobre a proximidade conceitual entre os produtos.

Isso pode melhorar tarefas como:

  • Substituição de produtos indisponíveis.

  • Busca por itens semelhantes.

  • Descoberta de alternativas.

  • Personalização baseada em preferências.

  • Recomendação entre categorias relacionadas.

Em um supermercado, por exemplo, o sistema pode precisar encontrar uma alternativa que respeite simultaneamente:

  • Preferências alimentares.

  • Faixa de preço.

  • Marca favorita.

  • Disponibilidade local.

  • Restrições dietéticas.

Um simples mecanismo de "produtos semelhantes" pode não ser suficiente.

Um agente com acesso a uma estrutura semântica pode avaliar diferentes restrições antes de tomar a decisão.

A substituição automática de produtos ganha contexto

A indisponibilidade de produtos é um problema frequente em operações de supermercado e conveniência.

Uma recomendação tradicional pode simplesmente sugerir o item mais parecido com base em características gerais.

Uma arquitetura baseada em memória e semantic IDs pode considerar informações adicionais.

Imagine que o produto favorito de um usuário está esgotado.

O sistema precisa decidir entre:

  • Um produto da mesma marca, mas mais caro.

  • Um produto semelhante, mas de outra marca.

  • Uma opção compatível com determinada restrição alimentar.

  • Um produto em promoção.

  • Uma alternativa disponível imediatamente.

A recomendação deixa de ser apenas uma comparação entre vetores.

Ela pode se tornar uma decisão contextual.

O agente combina a memória do consumidor, a estrutura semântica do catálogo e o inventário disponível para encontrar uma alternativa mais adequada.

Por que gerar recomendações com LLMs em tempo real seria caro demais

Existe um problema óbvio nessa arquitetura.

LLMs são mais caros e mais lentos do que modelos tradicionais de ranking.

Gerar uma recomendação complexa para cada usuário em tempo real poderia exigir uma quantidade enorme de tokens.

A solução é separar duas etapas:

  1. Criar a estrutura conceitual da recomendação.

  2. Preencher essa estrutura com produtos disponíveis no momento.

A primeira etapa pode acontecer offline.

O sistema utiliza LLMs para criar uma espécie de blueprint de carrossel personalizado.

Por exemplo:

"Sugestões vegetarianas para refeições rápidas durante a semana."

Ou:

"Produtos recorrentes que o consumidor costuma comprar, organizados por prioridade."

Esse plano pode ser gerado antecipadamente.

Depois, no momento da exibição, o sistema consulta a infraestrutura de recuperação para preencher o carrossel com itens realmente disponíveis.

Essa abordagem reduz a necessidade de executar um LLM completo para cada interação.

Carrosséis gerados em lote e hidratados em tempo real

A arquitetura desacopla a inteligência da apresentação.

Em vez de perguntar ao LLM, em tempo real:

"Quais produtos devo mostrar agora para este usuário?"

O sistema pode preparar antecipadamente o conceito da recomendação.

Depois, utiliza um mecanismo de recuperação, como uma base vetorial, para encontrar os produtos concretos que correspondem àquela intenção.

O fluxo pode funcionar assim:

Histórico do consumidor

Geração de memória em linguagem natural

LLM cria o blueprint da recomendação

Blueprint armazenado para uso posterior

Consulta ao catálogo disponível

Recuperação dos produtos relevantes

Carrossel exibido ao usuário

Essa estratégia tenta combinar personalização sofisticada com um custo operacional mais controlado.

Agentes autônomos para missões completas de compra

O objetivo mais ambicioso dessa arquitetura não é apenas melhorar um carrossel.

É permitir que agentes executem tarefas completas para o consumidor.

Imagine um pedido como:

"Monte as compras da semana para uma família de quatro pessoas, mantendo o orçamento e considerando minhas preferências alimentares."

Esse tipo de tarefa exige muito mais do que um sistema tradicional de recomendação.

O agente precisa coordenar:

  • Preferências pessoais.

  • Histórico de consumo.

  • Receitas.

  • Produtos disponíveis.

  • Estoque local.

  • Preços.

  • Orçamento.

  • Substituições.

  • Restrições alimentares.

Esse é um problema de múltiplas etapas.

O sistema precisa pesquisar, comparar, selecionar e validar antes de concluir a ação.

É justamente nesse cenário que os agentes podem representar uma mudança maior em relação aos sistemas tradicionais de recomendação.

O papel do grounded search na prevenção de alucinações

Um dos maiores riscos de utilizar LLMs em sistemas comerciais é a alucinação.

Um modelo pode recomendar um produto que:

  • Não existe.

  • Está indisponível.

  • Não é vendido naquela loja.

  • Possui um preço incorreto.

  • Não atende à restrição do consumidor.

Por isso, a arquitetura utiliza o conceito de grounded search.

Em vez de permitir que o modelo invente livremente uma resposta, o agente precisa basear suas decisões em dados recuperados do catálogo ativo.

O processo pode ser resumido assim:

Pergunta ou objetivo do usuário

Busca no catálogo real

Recuperação de produtos disponíveis

Informações retornadas ao agente

Decisão baseada nesses dados

Isso reduz o espaço para respostas inventadas.

O agente pode continuar raciocinando sobre a melhor escolha, mas os objetos sobre os quais ele toma decisões precisam existir dentro do ambiente real.

Segurança e resiliência quando o agente pode agir

Quando um sistema passa de recomendar para executar ações, os riscos aumentam.

Recomendar um produto errado é uma coisa.

Adicionar produtos ao carrinho, realizar uma compra ou executar uma transação financeira é outra completamente diferente.

Por isso, uma arquitetura baseada em agentes precisa combinar modelos probabilísticos com verificações determinísticas.

O agente pode decidir:

"Estes produtos parecem adequados para o usuário."

Mas antes da execução, o sistema pode verificar regras objetivas.

Por exemplo:

  • O valor total está dentro do orçamento?

  • Todos os produtos estão disponíveis?

  • Existe alguma restrição alimentar violada?

  • O usuário possui autorização para essa ação?

  • O preço mudou desde a recomendação?

  • A quantidade solicitada é válida?

O modelo de linguagem participa da decisão.

Mas não deve ser a única camada responsável pela execução.

Comparativo entre recomendação tradicional e agentes de IA

A mudança pode ser entendida como uma evolução de sistemas que respondem a uma única pergunta para sistemas capazes de coordenar múltiplas etapas.

Aspecto

Recomendação tradicional

Sistema baseado em agentes

Objetivo

Prever o próximo item relevante

Resolver uma missão completa

Contexto

Features e histórico recente

Memória, sessão e contexto em tempo real

Perfil do usuário

Vetores numéricos

Memória em linguagem natural

Catálogo

IDs e taxonomias tradicionais

Semantic IDs e recuperação contextual

Raciocínio

Predição pontual

Planejamento em múltiplas etapas

Disponibilidade

Pode depender do ranking

Grounded search no catálogo ativo

Execução

Normalmente limitada à recomendação

Pode utilizar ferramentas e realizar ações

Validação

Métricas de relevância

Guardrails e verificações determinísticas

Arraste para o lado para ver toda a tabela.

O que essa arquitetura pode representar para o futuro do e-commerce

A principal mudança não está apenas no uso de LLMs.

Está na transformação do sistema de recomendação em uma camada capaz de compreender contexto, pesquisar informações, raciocinar sobre restrições e executar tarefas.

Os modelos tradicionais continuarão importantes.

Eles são rápidos, baratos e extremamente eficientes para tarefas específicas.

A tendência, porém, é que sistemas mais complexos utilizem uma combinação de tecnologias.

Um modelo especializado pode recuperar os melhores candidatos.

Uma base vetorial pode encontrar informações relevantes.

Um semantic ID pode ajudar a navegar pelo catálogo.

Um LLM pode interpretar a intenção.

E um agente pode coordenar todas essas etapas.

A grande dificuldade será fazer isso sem transformar cada recomendação em uma chamada cara e lenta para um modelo frontier.

Por isso, estratégias como processamento em lote, recuperação em tempo real, memória versionada e grounded search tendem a se tornar peças importantes dessa nova geração de sistemas.

A experiência da DoorDash mostra uma direção interessante para plataformas de comércio: o futuro das recomendações pode deixar de ser apenas "qual item você provavelmente vai clicar?".

A pergunta passa a ser muito mais ampla:

"O que o usuário está tentando realizar e como um sistema inteligente pode ajudá-lo a chegar ao resultado?"

Para responder a isso em escala, não basta trocar um modelo de ranking por um LLM. É necessário construir uma arquitetura inteira de memória, recuperação, representação semântica, validação e execução.

É nesse ponto que a recomendação tradicional começa a evoluir para algo mais próximo de um agente de compras capaz de entender, planejar e agir dentro de limites controlados.

D

· Editor-chefe

Especialista em tecnologia, criador de conteúdo e fundador do portal Mercado de TI e Casa do Dev. Analiso tendências de mercado, Inteligência Artificial e carreira, entregando informações precisas, tr...

LinkedIn Site

Tags relacionadas

COMPARTILHAR