AIREITER

Mistral Agentic Search: o que é e o que dizem os números

Última Atualização: 2026-08-20 18:59:14

No FinanceBench, que reúne 368 documentos da SEC, cerca de 53.900 páginas e 150 perguntas, a Mistral afirma que sua nova camada Agentic Search elevou a precisão das respostas em 47 a 53 pontos percentuais sobre o RAG de passagem única usando um ciclo apenas de busca. Com o ciclo completo de navegação, o ganho chega a 59 pontos e o consumo de tokens cai em até um terço. O custo aparece na latência: o ciclo completo ainda leva 154 segundos no p90 e 71 segundos, em média.

Anunciado em 20 de agosto de 2026, o Mistral Agentic Search é uma camada de recuperação voltada a acervos corporativos difíceis, como documentos regulatórios, contratos e PDFs digitalizados. Não se trata de uma melhoria para busca na web. A espera de minutos é o preço cobrado pela maior precisão.

Página oficial de anúncio do Mistral Agentic Search

Como funciona o Mistral Agentic Search

Lançado em 20 de agosto de 2026, o Mistral Agentic Search adiciona um ciclo de múltiplas etapas a um índice já existente. Ele usa cinco ferramentas: search, open, navigate, read e grep. Está disponível no Mistral Search Toolkit e integrado às Libraries do Studio e do Vibe. O índice continua sendo seu, sem necessidade de fine-tuning; o ciclo agêntico assume as perguntas que a recuperação de chunks, sozinha, não consegue resolver.

O ciclo de cinco ferramentas na prática

O exemplo da própria Mistral ajuda a visualizar o processo: os gastos de defesa nacional dos Estados Unidos no ano-calendário de 1953. Uma única chamada de busca encontrou os números de janeiro a junho, mas deixou de fora o período entre julho e dezembro. No caminho agêntico, foram feitas duas buscas, o documento treasury_bulletin_1954_02.pdf foi identificado e, em seguida, a página 15, Tabela 3, foi lida. O resultado trouxe os valores dos doze meses, totalizando 44.463 milhões de dólares no ano.

FerramentaFunção
searchConsulta o índice em busca das fontes mais prováveis
openAbre um documento localizado
navigateVai até páginas, tabelas ou seções dentro do documento
readExtrai o conteúdo daquele ponto
grepLocaliza padrões de tokens, códigos ou identificadores exatos

O RAG de passagem única recupera um conjunto fixo de chunks e precisa responder de uma vez; se a recuperação for fraca, ele não consegue pedir outro documento. Já o ciclo pode comparar fontes, seguir referências em notas de rodapé e tabelas e se recuperar de resultados parciais. Segundo a Mistral, a troca envolve menos tentativas e interações desperdiçadas, não mais.

O que os benchmarks mostram de fato

O anúncio traz duas suítes de benchmark, ambas reportadas pela fornecedora e executadas com as configurações padrão do Search Toolkit, sem ajustes. Nas palavras da Mistral, “estes resultados são pisos, não tetos”. O FinanceBench (Islam et al., 2023; lançamento aberto no GitHub) reúne 368 documentos 10-K, 10-Q e 8-K da SEC, com cerca de 147 páginas cada segundo a contagem da Mistral, e 150 perguntas. Na configuração da empresa, as respostas são avaliadas por um LLM calibrado com rótulos humanos.

Ganhos de precisão do Mistral Agentic Search no FinanceBench em comparação com RAG de passagem única

Incluir as ferramentas de navegação — open, navigate, read e grep — sobre o ciclo somente de busca acrescentou mais 8,7 p.p. para o Mistral Medium 3.5 e 6,7 p.p. para o GLM-5.2. Em relação ao ciclo agêntico apenas de busca, o ciclo completo de navegação consumiu 23,9% menos tokens com o Mistral Medium 3.5 e 33,7% menos com o GLM-5.2. A latência também melhora: o p90 cai de 255 para 154 segundos, e a média, de 108 para 71 segundos. Vale destacar a base de comparação: a redução de tokens é medida contra o ciclo agêntico somente de busca, não contra o RAG de passagem única.

Comparação de latência entre ciclos somente de busca e de navegação completa no FinanceBench

O OfficeQA Pro é a suíte mais difícil: são 696 edições históricas dos Treasury Bulletins dos Estados Unidos, cerca de 89.000 páginas de PDFs governamentais digitalizados e repletos de tabelas, além de 133 perguntas. Com o ciclo completo, o GLM-5.2 alcançou 51,9% de precisão, um salto de 45,6 p.p. que implica uma base de 6,3% em passagem única; o Mistral Medium 3.5 melhorou 27,1 p.p. A navegação também reduziu em até 7,0% o número de interações.

A Mistral avaliou seu próprio Mistral Medium 3.5 e o Z.ai GLM-5.2, de terceiros, e ambos apresentaram ganhos no mesmo padrão. O anúncio também cita uma pesquisa da Kimi segundo a qual o GLM-5.2 obtém 41,4% no OfficeQA Pro sob uma infraestrutura Claude Code, contra 51,9% na infraestrutura da Mistral. Não há link para uma fonte primária da Kimi; portanto, essa diferença de 10,5 p.p. entre infraestruturas é uma caracterização da Mistral. A conclusão da empresa — “a qualidade da recuperação escala com a capacidade do modelo” — é que o gargalo está na infraestrutura, não no modelo.

Quando o RAG de passagem única continua sendo melhor

A própria Mistral diz que a recuperação indexada segue sendo a base, e que o ciclo agêntico entra em cena quando os resultados iniciais não bastam. A decisão depende principalmente do formato dos documentos e do orçamento de latência:

Seu tipo de cargaMelhor ponto de partida
Consultas diretas em documentos curtos e limposRAG de passagem única
Recuperação semântica ou por palavras-chave em alto volumeRAG de passagem única
Respostas em locais já conhecidosRAG de passagem única
Documentos regulatórios, contratos e manuais com tabelas e notas de rodapéAgentic Search
PDFs digitalizados e com muitas tabelasAgentic Search
Respostas distribuídas entre vários documentos que exigem conciliaçãoAgentic Search
Exigência de latência interativa, em segundosRAG de passagem única

Se um p90 de 154 segundos inviabiliza seu produto, nenhum ganho de precisão resolve o problema. Para análise em lote de demonstrações financeiras, a história é outra.

Agentic Search não é a ferramenta web_search

Ao pesquisar esse produto, o Google exibe a documentação de websearch da Mistral — mas é outra coisa. As ferramentas web_search e web_search_premium pertencem à Agents API e fazem recuperação na web ao vivo, com citações. Elas custam, respectivamente, US$ 30 e US$ 50 por 1.000 chamadas na página de preços da API da Mistral, além dos tokens do modelo. O Agentic Search segue na direção oposta: investiga seu próprio acervo indexado e não consulta a web aberta. São problemas diferentes, e apenas um deles tem preço publicado; não há valores para o Agentic Search no anúncio.

Dois caminhos para começar

  1. Search Toolkit. Módulos abertos para ingestão, embeddings e indexação, implantáveis em nuvem ou em ambientes on-premises, com parsers, chunking, modelos de embedding, esquemas Vespa, perfis de ranking e recuperação híbrida configuráveis.
  2. Libraries no Studio e no Vibe. A opção gerenciada. Um Search Starter App pode criar um índice local sobre seu acervo usando a configuração padrão, o caminho mais rápido para reproduzir o setup do benchmark antes de ajustar qualquer coisa.

Independentemente do caminho, passe as mesmas perguntas representativas pelo RAG de passagem única e pelo ciclo completo. Compare a qualidade das respostas, o uso de tokens e a latência p90 antes de se comprometer.

O que ainda não está claro no lançamento

A Mistral não publicou preços do Agentic Search, e os resultados dos benchmarks foram reportados pela própria fornecedora; não havia uma replicação prática independente disponível no lançamento. As primeiras reações públicas ainda são impressões iniciais:

“a mistral acabou de adicionar busca agêntica à api e esse é o caminho certo. colocar uma busca no estilo Perplexity dentro de uma ferramenta nativa de agente nos poupa de escrever pipelines frágeis de web scraping e gerenciar rotação de proxies por conta própria.” — @AbdoKerdawy, desenvolvedor de produtos de IA (X)

As alegações sobre tokens já receberam críticas que o anúncio da Mistral não responde por completo:

“A ferramenta de recuperação com busca agêntica da Mistral afirma reduzir falhas de busca em passagem única em mais de 40%. Se ela evita consultas ao banco de dados, isso reduz o número de tokens que você precisa gastar?” — @therawlogs, blogueiro independente (X)

A resposta oficial é a redução de 24–34% em tokens em relação ao ciclo somente de busca. Saber se isso se mantém fora dos acervos de benchmark é justamente o que uma execução independente no conjunto aberto FinanceBench poderia esclarecer.

Produtos próximos enfrentam a mesma limitação física: o modo de busca agêntica Toast-1 da Mixedbread limita seu ciclo a quatro rodadas e oito chamadas de recuperação paralelas, e a própria documentação afirma claramente que ele é mais lento que uma única busca. Latência é o imposto que os fornecedores dessa categoria pagam por precisão.

Respostas diretas

O Mistral Agentic Search está disponível pela Agents API?

Não. Ele é oferecido pelo Mistral Search Toolkit e pelas Libraries no Studio e no Vibe; a ferramenta web_search da Agents API é um produto separado para web ao vivo, com preços próprios.

O Agentic Search realmente reduz o uso de tokens?

Segundo os benchmarks oficiais, o ciclo completo de navegação usou 23,9–33,7% menos tokens que um ciclo agêntico somente de busca no FinanceBench; uma replicação independente ainda não foi publicada.

Quais modelos funcionam com o Agentic Search?

A Mistral testou o Mistral Medium 3.5 e o Z.ai GLM-5.2, com ganhos consistentes, e descreve a camada como agnóstica a modelos, sem necessidade de fine-tuning.

Quanto custa o Mistral Agentic Search?

Não há preço publicado para o Agentic Search em si. O valor de US$ 30 por 1.000 chamadas na página de preços da Mistral pertence à ferramenta agêntica web_search, mais antiga.

A troca em aberto é simples: aqui, precisão é comprada com minutos. Para trabalho em lote sobre documentos regulatórios, contratos e registros governamentais digitalizados, um salto de 45 a 59 p.p. em precisão — nos resultados de ciclo completo do OfficeQA Pro e do FinanceBench, respectivamente — e uma redução de um terço nos tokens frente a um ciclo mais lento podem ser uma troca racional. Para qualquer uso voltado ao usuário final, 71 segundos de latência média ainda desclassificam a solução. E, até que alguém fora da Mistral repita o FinanceBench, os números mais fortes desta página seguem sendo os da própria fornecedora.

Leituras relacionadas: o guia da API GLM-5.2 e a análise do GLM-5.2 abordam o segundo modelo de benchmark usado nos testes da Mistral.