O que a Endex realmente mudou por debaixo do capô
A Endex descreve o abandono da geração aumentada por recuperação (RAG) como abordagem principal. Em vez de buscar trechos de texto e gerar respostas a partir deles, seus agentes usam os modelos de raciocínio da série o da OpenAI para extrair fatos, identificar inconsistências e contextualizar métricas do jeito que um analista faria.
A empresa também relata ter simplificado um pipeline que antes era bem elaborado. Segundo ela, dependia de prompts complexos, encadeamento de completions e várias etapas de verificação — e o o1 permitiu simplificar tudo isso sem perder precisão. Já o o3-mini entregou o que a Endex chama de inteligência equivalente com um terço da latência por interação, usado em tarefas de múltiplas etapas, como analisar pacotes de informações confidenciais e reconciliar modelos financeiros.
São duas afirmações distintas que vale separar: uma é uma aposta arquitetural (raciocínio em vez de recuperação), a outra é um trade-off de custo e latência (um modelo de raciocínio menor para as etapas de alto volume). Ambas são o tipo de decisão que um time de aplicação só toma depois de construir uma estrutura de avaliação.
O frontend é o entregável, não uma caixa de chat
O detalhe mais concreto para quem constrói interfaces de agentes é o que a Endex devolve ao usuário. Os agentes entregam resultados como e-mails, documentos, modelos em Excel ou apresentações de slides — os mesmos formatos que os times financeiros já usam no dia a dia — em vez de uma transcrição de conversa. As tarefas citadas são igualmente específicas: visões gerais de transações precedentes, resumos de desempenho de resultados, preparação de memorandos para comitês de investimento e due diligence de data rooms.
O CEO Tarun Amasa coloca a ambição explicitamente em torno da interface, e não apenas da capacidade bruta do modelo.
Nosso trabalho vai além das APIs — é sobre construir as interfaces entre agente e usuário que vão mudar a forma como os analistas financeiros trabalham. Montana Labs
Esse enquadramento importa porque nomeia a verdadeira superfície do produto. O modelo produz o raciocínio; o papel do frontend é transformar esse raciocínio em um memorando ou modelo que um profissional possa entregar a um comitê. O recurso de permitir que analistas rastreiem as conclusões do agente até suas fontes é tanto um compromisso de interface quanto de modelo — as citações precisam aparecer, ser clicáveis e estar ligadas a notas de rodapé específicas.
Confiança se constrói com verificação cruzada e citação, não só com respostas
A Endex mira nos modos de falha que os times financeiros mais temem: um ajuste de reconciliação de EBITDA que passou batido, uma cláusula de mudança de controle ignorada. A resposta da empresa são agentes que sinalizam reformulações em notas de rodapé e apontam inconsistências com citações específicas, deslocando o papel do analista da verificação manual para a tomada de decisão.
Para medir se o modelo realmente lê os documentos que importam, a Endex criou seu próprio benchmark — o Finance Agent Retrieval (FAR) — para avaliar o uso de contexto em dados tabulares e gráficos. A empresa relata usar os recursos de visão do o1 para processar apresentações a investidores, modelos em Excel e formulários 8-K. Criar um benchmark específico para tabelas e gráficos é um sinal revelador: pontuações genéricas de recuperação não mostram se o modelo leu a célula certa em uma demonstração financeira.
Sobre preferência, a empresa relata que, em testes cegos com usuários, especialistas financeiros preferiram as respostas do o1 em 70% das vezes em comparação com modelos sem raciocínio. Também descreve o ajuste fino por reforço do GPT-4o mini e do o1 para transformar conjuntos de dados personalizados em melhorias de raciocínio em tarefas como análise de transações precedentes e extração de entidades.
A implicação específica: raciocínio verificável é a superfície do produto em finanças
A lição da Endex não é que os modelos de raciocínio são melhores — é onde o esforço de engenharia foi direcionado. A Endex investiu em um benchmark para compreensão de gráficos e tabelas, em uma estrutura de avaliação que acompanha latência, tempo até o primeiro token e profundidade de raciocínio, e em formatos de saída que combinam com os artefatos já usados em finanças, com citações rastreáveis.
Para um domínio regulado e sensível a detalhes, o contrato do frontend é que toda conclusão possa ser rastreada até um documento fonte. Essa restrição molda tudo que vem antes — a escolha do modelo, a decisão de raciocinar em vez de recuperar, e a escolha de um modelo com menor latência para as etapas repetitivas. Times que constroem agentes verticais devem ler isso menos como um endosso a um modelo específico e mais como uma demonstração de que a interface para apresentar e citar o raciocínio é onde está o trabalho de produto que realmente perdura.
Find this story relevant to you?
Contact us to find a unique solution