LegalAI Bench Brazil

Avaliação comparativa de oito plataformas de inteligência artificial em cinquenta tarefas de mercado de capitais, societário e governança corporativa no direito brasileiro

8 plataformas50 prompts400 avaliações de respostas na amostra principal36 avaliações em modo de pesquisa profunda
Sobre a avaliadora

Natalia Minotto é advogada com sete anos de experiência em escritórios de advocacia de grande porte, incluindo um ano no escritório de Nova York do Mayer Brown LLP. Sua atuação concentra-se em mercado de capitais, companhias abertas e governança corporativa.

É graduada em Direito pela Universidade de São Paulo (USP), no Brasil, e pela Université Lumière Lyon 2, na França. Em setembro de 2026, iniciará o curso MBA na University of Chicago Booth School of Business, com foco na interseção entre direito, tecnologia e negócios.

linkedin.com/in/nataliaminotto
Retrato profissional de Natalia Minotto

1Sumário executivo

Este estudo compara oito plataformas de inteligência artificial em cinquenta tarefas de direito brasileiro, no recorte de mercado de capitais, societário e governança corporativa. Cada resposta foi pontuada em quatro dimensões distintas (Correção Jurídica, Completude, Adequação de Forma e Confiabilidade da Fonte), divididas entre dois eixos (Resposta e Fonte). A avaliação foi realizada por uma avaliadora especialista, a partir de pautas com avaliação às cegas, em que as oito respostas de cada prompt aparecem codificadas e em ordem sorteada, com a chave código-plataforma selada até a devolução das notas.

A contribuição pretendida é preencher uma lacuna específica na literatura pública de benchmarks independentes: a disponibilidade ainda limitada de estudos que comparem plataformas brasileiras e estrangeiras com base em tarefas especializadas de direito brasileiro extraídas da prática profissional.1

O que os dados mostram

  • No eixo Resposta, ChatGPT, Harvey e Claude apresentaram médias próximas. As faixas de incerteza das diferenças pareadas são compatíveis tanto com vantagem de uma plataforma quanto de outra ou com ausência de diferença; o estudo não fornece evidência estatística suficiente para apontar uma liderança consistente, mas tampouco demonstra equivalência. O Harvey liderou descritivamente o eixo Fonte, com média de 9,70.
  • A Completude foi a dimensão com os resultados gerais mais baixos: 49,8% das respostas receberam nota intermediária e apenas 42,2% atingiram a nota máxima (Tabela 9). Isso indica que uma resposta pode estar correta no que afirma e, ainda assim, omitir elementos juridicamente relevantes.
  • O desempenho das plataformas jurídicas brasileiras, Jus IA e Inspira, foi substancialmente inferior em duas categorias dependentes de fontes extraídas da base de dados da CVM: Regulação do mercado de capitais e Jurisprudência da CVM. Nessas categorias, a diferença em relação às generalistas estrangeiras foi de 5,88 pontos; nas outras oito categorias, caiu para 1,11 ponto (Tabela 7).
  • No recorte de seis prompts, o modo de pesquisa profunda não apresentou vantagem uniforme. No eixo Resposta, melhorou os resultados do Gemini e da Maritaca, manteve o Harvey próximo do desempenho na busca direta e reduziu as médias do Jus IA, do Claude e do ChatGPT. Os efeitos devem ser interpretados como específicos das plataformas e tarefas avaliadas (Tabela 11).

Todos os números deste sumário são desenvolvidos, e têm sua base de cálculo evidenciada, nas seções 3 e 4.

2Metodologia

2.1 Escopo

O estudo tem como objetivo apresentar um benchmark que englobe plataformas de inteligência artificial usualmente utilizadas por advogados brasileiros no dia a dia da sua prática, desde as generalistas mais conhecidas, como ChatGPT e Claude, até plataformas jurídicas específicas, como Harvey, Jus IA e Inspira.

A escolha de qual plataforma utilizar depende de múltiplos fatores, dos quais quatro se destacam. O primeiro é o custo de acesso: plataformas gratuitas tendem a ser mais acessadas, enquanto o acesso às que dependem de assinatura ou contrato corporativo depende do quanto o advogado está disposto a destinar do seu orçamento a ferramentas de inteligência artificial, ou de o escritório onde trabalha contratar a plataforma. O segundo é a qualidade da resposta: se a resposta é razoavelmente satisfatória e verificável, a ponto de efetivamente economizar tempo. O terceiro é a natureza do trabalho jurídico: critérios distintos podem prevalecer conforme a área de atuação e a tarefa — por exemplo, um advogado de contencioso que redige peças processuais com frequência pode atribuir maior peso à cobertura de jurisprudência do que um advogado que atue no consultivo de mercado de capitais. O quarto é a confidencialidade e governança de dados: se a plataforma oferece transparência e controle suficientes sobre o tratamento das informações, incluindo eventual uso para treinamento dos modelos e as garantias e proteções do plano contratado.

Este relatório se propõe a abordar esses quatro fatores do processo de escolha, com foco no segundo, referente à qualidade da resposta. Para tanto, foi realizada a comparação das respostas das plataformas analisadas para cinquenta prompts, extraídos e adaptados da prática jurídica da avaliadora, por meio da avaliação de cada resposta com base em critérios pré-definidos, transparentes e auditáveis. Os quatro fatores voltam a ser tratados de forma conjunta na seção 4, em que os resultados são traduzidos para a decisão prática.

Por fim, este estudo também visa somar aos materiais existentes de benchmark de plataformas de inteligência artificial para o meio jurídico brasileiro, considerando as suas variáveis e fomentando a pesquisa e o desenvolvimento da indústria de legal tech no país.

2.2 Plataformas avaliadas

Foram avaliadas oito plataformas, agrupadas em quatro categorias de produto: generalista estrangeira, generalista brasileira, jurídica estrangeira e jurídica brasileira. As plataformas têm propostas de valor, bases de dados e modelos de contratação distintos. A comparação recai, portanto, sobre seu desempenho nas mesmas tarefas e não pressupõe equivalência entre os produtos. Para definir quais modelos e configurações seriam utilizados, o critério adotado foi “a melhor configuração disponível para a finalidade deste estudo na data-base de junho de 2026”, quando os prompts foram rodados. Para viabilizar o acesso aos melhores modelos e configurações, parte das plataformas foi assinada (ChatGPT, Claude, Jus IA e Inspira) e parte teve o acesso viabilizado por licença corporativa (Copilot e Harvey).

Tabela 1. Plataformas avaliadas, categoria de produto, modelo e forma de acesso.

Plataforma1CategoriaModelo2Acesso
ChatGPTGeneralista estrangeiraGPT-5.5Assinatura individual
ClaudeGeneralista estrangeiraOpus 4.8Assinatura individual
GeminiGeneralista estrangeira3.1 ProAssinatura paga Google One de 400 GB, que inclui Google AI Plus
CopilotGeneralista estrangeiraNão selecionável na interface testada; roteamento automáticoLicença corporativa Microsoft
HarveyJurídica estrangeiraModo Auto (roteamento automático e orquestração)Licença corporativa
MaritacaGeneralista brasileiraSabiá-4Camada gratuita
Jus IAJurídica brasileiraSistema nativo da plataformaFreemium; versão plena por assinatura individual
InspiraJurídica brasileiraSistema nativo da plataformaAssinatura individual; canal B2C

1A Legora, outra plataforma jurídica estrangeira, foi considerada, mas não foi avaliada porque não oferece assinatura individual e a avaliadora não dispunha de acesso por meio de organização contratante da plataforma.
2A avaliação se deu na função de chat em todas as plataformas, exceto na Inspira, na qual os prompts relacionados à busca de precedentes de processos administrativos foram submetidos à ferramenta de busca processual própria da plataforma. A seção 3.3 detalha essa opção e seus efeitos.

2.3 Configurações fixadas

A premissa é medir cada plataforma no melhor ajuste disponível em junho de 2026, e não o modelo isolado. A comparação recai sobre o produto na configuração testada, conforme utilizado pela avaliadora.

Tabela 2. Configurações fixadas em cada plataforma na data-base de junho de 2026.

PlataformaRaciocínioFundamentação (grounding)Onde foram inseridas as instruções-base (brief)
ChatGPTAltoBusca web ligada pela avaliadoraProjeto
ClaudeExtended thinking, esforço máximoBusca web ligada pela avaliadoraProjeto
GeminiDeep Think ligadoAutomático, sem controle de ativação exposto ao usuário1Gem
CopilotThink Deeper ligadoBusca web ativa por padrão, sem alternador acionado pela avaliadora2Início do prompt
MaritacaNão aplicávelPesquisa na web ligada pela avaliadoraInício do prompt
Jus IANão aplicávelFontes nativasInício do prompt
InspiraNão aplicávelReferências nativasInício do prompt
HarveyEmbutido no modo AutoKnowledge Sources: Brazil + busca webCustomização de estilo

1No Gemini, o grounding em resultados do Google Search é automático e não expõe controle de ativação ao usuário; algumas respostas apenas documentam que são fundamentadas em resultados de busca.
2No Copilot, a busca na web é parte integrante do produto e executada por meio do Bing. Nas versões corporativas, há controles administrativos e uma opção de ativação ou desativação pelo usuário, mas a avaliadora não pôde verificar a configuração do ambiente corporativo da organização (tenant).

As mesmas instruções-base, com texto idêntico, foram fornecidas a cada plataforma como equalizador:

Você assiste uma advogada brasileira de mercado de capitais, regulatório, societário e contratos. Jurisdição: direito brasileiro vigente. Idioma: português. Regras: (1) cite a norma e o dispositivo específicos, não referências genéricas; (2) se não tiver certeza da norma vigente, diga isso em vez de inventar; (3) adeque linguagem e estrutura ao gênero pedido; (4) seja conciso; (5) não invente normas, números, dispositivos, partes ou fatos não fornecidos.

A forma de fornecimento das instruções-base variou conforme a arquitetura de cada produto, como registra a última coluna da Tabela 2: nas plataformas que disponibilizavam campo persistente dentro de um projeto, as instruções foram carregadas nesse espaço; nas demais, no início de cada prompt.

Sobre o Harvey, uma ressalva de configuração merece registro. À época da coleta, a plataforma incorporava modelos de outros fornecedores, incluindo OpenAI, Anthropic e Google, responsáveis, respectivamente, pelo ChatGPT, Claude e Gemini. O usuário podia selecionar manualmente um modelo específico ou utilizar o modo Auto, no qual, segundo o fabricante, cada consulta era direcionada ao modelo ou conjunto de modelos considerado mais adequado. A seleção manual era opcional.2

Para fins deste estudo, o modo Auto foi mantido em todas as avaliações, sem seleção manual de um modelo específico. Essa escolha preservou a uniformidade da coleta e permitiu avaliar o Harvey na configuração concebida para selecionar os modelos mais adequados a cada consulta. Os resultados refletem, portanto, o desempenho do produto em sua arquitetura multimodelo.

2.4 O banco de prompts

Os cinquenta prompts avaliados foram adaptados de interações profissionais da avaliadora com diferentes plataformas ao longo do ano anterior à pesquisa. Os temas foram intencionalmente limitados às suas áreas de especialização: direito societário, regulatório de mercado de capitais, companhias abertas e governança corporativa. Consequentemente, os prompts são restritos a essas práticas específicas do direito brasileiro, com a contrapartida de maior precisão na análise.

Para utilização neste estudo, essas interações foram anonimizadas — isto é, sem menção a clientes, operações ou qualquer informação confidencial —, reescritas em formato padronizado e resumidas de modo que cada tarefa pudesse ser respondida em um único turno, sem necessidade de perguntas complementares. A adaptação contou com auxílio do assistente de inteligência artificial do Claude; o enquadramento em categorias, a redação final e a validação de cada prompt foram definidos pela avaliadora.

Quatro regras centrais orientaram a construção do banco e motivaram a adaptação do material original: (i) formulação de prompts curtos e autossuficientes, com gabaritos objetivos, para que tanto a resposta quanto a correção independessem de perguntas complementares; (ii) adoção de gabaritos ancorados em normas e nas interpretações doutrinárias e jurisprudenciais prevalecentes na data-base da coleta; (iii) anonimização dos prompts, com exclusão de nomes e de quaisquer dados que permitissem identificar empresas, pessoas ou projetos específicos; e (iv) seleção de prompts cuja correção pudesse ser auditada por um revisor independente com acesso ao conjunto integral de materiais da pesquisa.

Os prompts foram distribuídos em dez categorias, de cinco prompts cada, correspondentes a diferentes tipos de demanda típicos das práticas delimitadas. As categorias contemplam tarefas que mobilizam capacidades distintas das plataformas e apresentam diferentes graus de dificuldade.

Tabela 3. As dez categorias do banco de prompts e o que cada uma exige da plataforma.

GrupoCategoriaO que a categoria exige da plataforma
ASocietário “puro”Precisão conceitual sobre um instituto determinado da Lei 6.404/76 (Lei das Sociedades por Ações) e análise do dispositivo correspondente
BRegulação do mercado de capitaisLeitura sistemática da regulação, considerando as orientações da área técnica da CVM
CJurisprudência da CVMLocalização de precedente do Colegiado, com número de processo e conteúdo verificáveis
DProcesso administrativo na CVMCorreção procedimental sobre rito, penalidades e prescrição
EDoutrina e jurisprudênciaSíntese de construção doutrinária com recepção pela CVM
FAnálise e elaboração de documentosLeitura crítica de documento anexo e produção de minuta a partir dele
GElaboração de ato societárioTécnica de redação de ato societário, com adaptação correta ao caso concreto
HFato relevante e comunicado ao mercadoAdequação de gênero e calibragem de linguagem sob risco regulatório
IRegulatório aplicado e consultasAplicação de norma a situação concreta, com conclusão objetiva
JGeneralista e transversalArticulação de mais de um instituto societário numa mesma resposta, no contexto de uma operação

2.5 Critérios de avaliação: dois eixos, quatro dimensões

Cada resposta foi avaliada em dois eixos separados. O eixo “Resposta” mede a qualidade do conteúdo entregue e se divide em três dimensões: Correção Jurídica, Completude e Adequação de Forma. O eixo “Fonte” mede a precisão, a especificidade, a verificabilidade e a adequação das citações e bases utilizadas, por meio da dimensão Confiabilidade da Fonte.

A separação dos dois eixos se justifica porque uma resposta pode estar substancialmente certa e não citar base legal verificável, enquanto outra pode citar adequadamente, mas errar a conclusão. Somar os dois eixos em um número único apagaria justamente a informação que o advogado usa para decidir quanto de revisão a resposta exige: resposta com os dois eixos altos pede revisão leve; resposta com conteúdo alto e fonte baixa é útil, mas as citações precisam ser conferidas uma a uma, em pesquisa paralela; resposta com conteúdo baixo é retrabalho. O BigLaw Bench utiliza estrutura semelhante, reportando separadamente um answer score e um source score3. O índice composto apresentado na seção 3.1 a seguir é secundário, apresentado apenas para conferir leitura unificada alternativa.

Cada resposta recebe nota 0, 1 ou 2 em cada uma das quatro dimensões, com base nos critérios gerais definidos antes da coleta, reproduzidos na Tabela 4, e em uma resposta esperada específica para cada prompt. Os fundamentos jurídicos e os elementos essenciais de cada resposta esperada foram registrados pela avaliadora na respectiva pauta de correção. Esses registros tornam a avaliação auditável e reduzem a margem de subjetividade.

Tabela 4. Descritores de pontuação. As três primeiras dimensões compõem o eixo Resposta; a quarta constitui, sozinha, o eixo Fonte.

EixoDimensãoNota 0Nota 1Nota 2
RespostaCorreção JurídicaErro material de premissa: base normativa ou conceitual erradaNúcleo certo, com imprecisão relevanteCorreta, sem erros relevantes
CompletudeOmite elementos essenciaisCobre o principal, mas omite elemento secundário relevanteCobre todos os pontos essenciais
Adequação de FormaGênero ou registro errado (ex.: explica quando se pediu para redigir)Gênero certo, com desvios materiais (prolixo, genérico)Gênero, estrutura e registro adequados
FonteConfiabilidade da FonteCita ou se baseia em autoridade incorreta, revogada ou não verificável, ou não oferece suporte quando necessárioCita ou se baseia em fontes parcialmente adequadas, mas genéricas, incompletas, imprecisas ou pouco verificáveisCita ou se baseia em fontes corretas, específicas, adequadas e verificáveis

Ambos os eixos foram aplicados a todos os prompts. Com relação ao eixo Fonte, nos prompts em que citações formais não eram apropriadas ou necessárias para a resposta, a nota considerou a correção e a verificabilidade das bases utilizadas, a conformidade com as normas aplicáveis e, quando pertinente, a aderência aos documentos fornecidos; a mera ausência de citação formal não gerou, por si só, nota zero.

A pontuação de cada eixo é calculada da seguinte forma e reportada prioritariamente em separado:

Resposta (0 a 10) = (Correção Jurídica + Completude + Adequação de Forma) ÷ 6 × 10

Fonte (0 a 10) = Confiabilidade da Fonte ÷ 2 × 10

O divisor 6 do eixo Resposta corresponde ao máximo somado das suas três dimensões (2 + 2 + 2); o divisor 2 do eixo Fonte, ao máximo da sua única dimensão. A conversão dos resultados para uma escala comum de 0 a 10 facilita a comparação do desempenho das plataformas em cada eixo, sem eliminar a distinção conceitual entre eles. Por essa razão, a análise principal apresenta e examina separadamente as pontuações de Resposta e Fonte.

Quanto ao formato, trinta e cinco prompts pedem resposta em chat e quinze envolvem produção ou análise de documento.

2.6 Coleta e avaliação às cegas

A coleta e a avaliação foram realizadas em etapas separadas e sequenciais. A coleta foi feita por automação de navegador em todas as plataformas, exceto no Harvey, em que a coleta foi realizada manualmente devido à impossibilidade de uso da automação. O conteúdo integral de cada resposta foi salvo, sem edição, no momento da coleta, com a finalidade de viabilizar auditoria posterior sem depender de links ou dos recursos de compartilhamento oferecidos pelas plataformas. Antes de cada captura, confirmou-se que as instruções-base estavam ativas; quando não foi possível obter essa confirmação, a coleta foi descartada e refeita.

A etapa de pontuação foi completamente manual e às cegas. Para cada prompt, todas as respostas foram reunidas em uma pauta de correção, em ordem sorteada e codificadas de A a H ou de A a N, nos casos dos prompts que também rodaram em modo de pesquisa profunda (deep research), com preservação da formatação original e anonimização do conteúdo. Respostas entregues como arquivo nativo foram fornecidas à parte, no formato original anonimizado. A chave código-plataforma ficou selada em arquivo separado até a devolução das notas de cada bloco.

O papel do assistente de inteligência artificial usado no projeto foi deliberadamente limitado pela avaliadora, de forma a evitar conflito na análise, dado que o Claude é uma das plataformas avaliadas. O assistente atuou na adaptação dos prompts originais em prompts padronizados (seção 2.4); na preparação das pautas anonimizadas; e na consolidação da avaliação em planilha. Não teve papel autoral no gabarito, não pontuou nenhuma resposta e não produziu resumo ou comparação entre respostas — a comparação foi feita diretamente pela avaliadora, sobre as respostas integrais das oito plataformas, para cada um dos cinquenta prompts.

3Resultados

3.1 Desempenho agregado

Figura 1
Qualidade da resposta e confiabilidade da fonte, por plataforma
Média das cinquenta avaliações da amostra principal de cada plataforma. Escala de 0 a 10. Os dois eixos são reportados separadamente, nunca somados.
Eixo RespostaEixo Fonte
0246810Harvey8,779,70ChatGPT8,879,50Copilot8,309,00Claude8,638,40Gemini7,536,70Maritaca6,576,00Jus IA6,505,90Inspira6,035,70
Ver tabelaOcultar tabela

Tabela 5. Desempenho agregado. Médias das cinquenta avaliações da amostra principal de cada plataforma (excluindo respostas no modo de pesquisa profunda), nos dois eixos e no índice composto, em escala de 0 a 10. Plataformas ordenadas pelo índice composto.

PlataformaCategoria de produtoRespostaFonteÍndice compostoNão entregas (n/50)
HarveyJurídica estrangeira8,779,709,240
ChatGPTGeneralista estrangeira8,879,509,190
CopilotGeneralista estrangeira8,309,008,650
ClaudeGeneralista estrangeira8,638,408,521
GeminiGeneralista estrangeira7,536,707,122
MaritacaGeneralista brasileira6,576,006,290
Jus IAJurídica brasileira6,505,906,203
InspiraJurídica brasileira6,035,705,875

Os eixos Resposta e Fonte são analisados separadamente. Para facilitar a leitura conjunta dos resultados, a tabela apresenta também um índice composto, calculado pela média simples das pontuações dos dois eixos — isto é, (Resposta + Fonte) ÷ 2. A fórmula atribui o mesmo peso a cada eixo, ambos expressos em escala de 0 a 10. O índice constitui apenas uma síntese descritiva; a comparação principal examina separadamente os resultados de Resposta e Fonte.

As “não entregas” correspondem a respostas em que houve recusa expressa, ausência de resultado ou falha técnica de processamento. Todas as não entregas receberam pontuação zero nas quatro dimensões de análise, o que afetou substancialmente as médias apresentadas, a depender da plataforma.

O desempenho agregado evidenciado na tabela acima comporta três leituras: a primeira diz respeito às plataformas mais bem colocadas; a segunda, ao eixo Fonte; e a terceira, à relação entre os resultados dos dois eixos.

A primeira leitura é que as diferenças entre as três plataformas mais bem colocadas no eixo Resposta são pequenas. Na amostra dos cinquenta prompts, o ChatGPT obteve média 0,10 ponto superior à do Harvey. Na análise estatística por reamostragem pareada (bootstrap), o intervalo de confiança de 95% (IC 95%)4 para essa diferença foi de −0,23 a +0,43. Isso significa que, considerada a incerteza da estimativa, os resultados são compatíveis tanto com uma vantagem de 0,23 ponto para o Harvey quanto com uma vantagem de 0,43 ponto para o ChatGPT. A diferença entre as médias do ChatGPT e do Claude foi de +0,23 (IC 95%: −0,20 a +0,73); e, entre Harvey e Claude, de +0,13 (IC 95%: −0,30 a +0,63). Como, nas três comparações, os intervalos de confiança incluem tanto valores positivos quanto negativos, não excluindo a hipótese de diferença nula entre as plataformas, não há evidência estatística de vantagem consistente entre elas. Dessa forma, os resultados posicionam ChatGPT, Harvey e Claude como um grupo de desempenho próximo no topo da classificação, sem evidência estatística suficiente para apontar a superioridade de qualquer uma delas nesse eixo.

A segunda leitura é que o Harvey obteve a maior média no eixo Fonte, com 9,70, seguido pelo ChatGPT, com 9,50, e pelo Copilot, com 9,00. A vantagem do Harvey sobre o ChatGPT foi de apenas 0,20 ponto na escala de 0 a 10, equivalente a dois pontos adicionais na soma das cinquenta avaliações na escala original da rubrica. O resultado indica desempenho elevado das duas plataformas nesse eixo e uma liderança descritiva, mas estreita, do Harvey, insuficiente, por si só, para demonstrar superioridade consistente na confiabilidade das fontes.

A terceira leitura é que os resultados dos dois eixos tendem a variar na mesma direção: em geral, as plataformas mais bem avaliadas em Resposta também figuram entre as mais bem avaliadas em Fonte. Os eixos, contudo, não são redundantes. O Harvey supera o ChatGPT em Fonte, embora obtenha pontuação ligeiramente inferior em Resposta; de forma semelhante, o Copilot supera o Claude em Fonte, apesar do resultado inferior em Resposta. Essas inversões demonstram a utilidade de apresentar os dois eixos separadamente, enquanto o índice composto funciona apenas como síntese do desempenho agregado.

3.2 Desempenho por categoria

A Tabela 6 traz as pontuações de cada plataforma no eixo Resposta, por categoria.

Figura 2
Eixo Resposta por plataforma e categoria
Cada célula é a média dos cinco prompts da categoria. Passe o cursor para ver o valor e o nome completo da categoria.
ABCDEFGHIJChatGPT8,679,6710,009,3310,008,007,338,009,338,33Harvey8,679,009,678,679,338,677,338,679,008,67Claude8,339,009,339,009,337,008,008,009,009,33Copilot8,338,339,338,679,677,006,008,338,009,33Gemini8,006,677,339,008,676,007,677,007,677,33Maritaca6,007,007,006,337,335,335,336,677,677,00Jus IA7,333,673,008,008,337,005,337,677,337,33Inspira7,004,670,007,008,336,007,006,676,337,33
Ver tabelaOcultar tabela

Tabela 6. Eixo Resposta por plataforma e categoria, em escala de 0 a 10. As categorias de A a J correspondem à Tabela 3.

PlataformaABCDEFGHIJ
ChatGPT8,679,6710,009,3310,008,007,338,009,338,33
Harvey8,679,009,678,679,338,677,338,679,008,67
Claude8,339,009,339,009,337,008,008,009,009,33
Copilot8,338,339,338,679,677,006,008,338,009,33
Gemini8,006,677,339,008,676,007,677,007,677,33
Maritaca6,007,007,006,337,335,335,336,677,677,00
Jus IA7,333,673,008,008,337,005,337,677,337,33
Inspira7,004,670,007,008,336,007,006,676,337,33
Média da categoria7,797,256,968,258,886,886,757,638,048,08

Duas leituras se destacam. A primeira é a variação das médias agregadas entre categorias. As duas menores médias correspondem às categorias que envolvem redação de documentos pelas plataformas — Elaboração de ato societário (6,75) e Análise e elaboração de documentos (6,88) —, enquanto as duas maiores médias correspondem às categorias que requerem explicação — Doutrina e jurisprudência (8,88) e Processo administrativo na CVM (8,25). Neste recorte, as plataformas tiveram melhor desempenho em tarefas explicativas do que em tarefas de redação.

A segunda é sobre a variação por categoria. Seis das oito plataformas variam menos de 3,7 pontos entre suas respectivas maior e menor média; as exceções são Jus IA (5,33) e Inspira (8,33), com amplitude concentrada na categoria que requer localização de precedentes da CVM. A seção 3.3, a seguir, examina esse ponto, que requer contexto para uma leitura mais especializada.

3.3 Desempenho por tipo de produto e categoria de prompt

Agrupando as plataformas por tipo de produto, a comparação por categoria fica da seguinte forma:

Tabela 7. Eixo Resposta por blocos de comparação e categoria, em ordem decrescente da amplitude. A amplitude corresponde à diferença entre a maior e a menor média dos quatro blocos e é utilizada apenas para ordenar as categorias.

CategoriaGeneralistas estrangeiras (n = 4)Jus IA e Inspira (n = 2)MaritacaHarveyAmplitude
C. Jurisprudência da CVM9,001,507,009,678,17
B. Regulação do mercado de capitais8,424,177,009,004,83
F. Análise e elaboração de documentos7,006,505,338,673,33
D. Processo administrativo na CVM9,007,506,338,672,67
A. Societário “puro”8,337,176,008,672,67
I. Regulatório aplicado e consultas8,506,837,679,002,17
E. Doutrina e jurisprudência9,428,337,339,332,08
G. Elaboração de ato societário7,256,175,337,332,00
H. Fato relevante e comunicado ao mercado7,837,176,678,672,00
J. Generalista e transversal8,587,337,008,671,67
Média das categorias B e C8,712,837,009,33
Média das oito categorias, exceto B e C8,247,136,468,63
Média dos cinquenta prompts8,336,276,578,77

A ordenação das dez categorias pela amplitude entre os quatro blocos de comparação mostra que as diferenças de desempenho não se distribuem uniformemente. Jurisprudência da CVM (C) apresenta a maior amplitude, de 8,17 pontos, seguida por Regulação do mercado de capitais (B), com 4,83, e Análise e elaboração de documentos (F), com 3,33. Nas demais sete categorias, a amplitude não ultrapassa 2,67 pontos. B e C destacam-se, portanto, como as categorias que mais diferenciam os blocos avaliados.

Esse resultado permite uma leitura específica do desempenho das plataformas jurídicas brasileiras. Nas categorias B e C, que concentram os prompts de pesquisa regulatória e jurisprudencial na base da CVM, Jus IA e Inspira ficam 5,88 pontos abaixo da média das generalistas estrangeiras (2,83 vs. 8,71). Nas outras oito categorias, essa diferença cai para 1,11 ponto (7,13 vs. 8,24). O déficit das plataformas jurídicas brasileiras não se distribui, portanto, de maneira uniforme, mas é substancialmente maior nas tarefas que exigem a localização de conteúdo na base de dados da CVM.

Uma hipótese compatível com esse padrão é o contexto em que essas plataformas foram construídas. O Poder Judiciário brasileiro encerrou 2025 com 75,5 milhões de processos pendentes e registrou, no mesmo ano, 40,9 milhões de casos novos (o maior volume da série histórica iniciada em 2009), com taxa de congestionamento de 62,6%. Em comparação indicativa realizada pelo CNJ com dados europeus consolidados pela Comissão Europeia para a Eficiência da Justiça (CEPEJ), o Brasil apresentou 19,18 casos novos por cem habitantes, ante 4,44 no conjunto europeu considerado.5

Nesse cenário, é plausível que as plataformas jurídicas brasileiras direcionem seus produtos a soluções voltadas à esfera judicial. As decisões do Colegiado da CVM, por sua vez, têm natureza administrativa e são divulgadas em repositório próprio, distinto dos sistemas dos tribunais judiciais. A escala desse universo é consideravelmente mais restrita: em 2025, foram julgados 49 processos administrativos sancionadores pela CVM, contra o registro de 40,9 milhões de novos casos judiciais no mesmo ano.6

Este estudo, por delimitação de escopo, não inclui prompts de contencioso judicial. As duas plataformas jurídicas brasileiras não foram, portanto, testadas nas matérias em que a sua base de dados provavelmente viabilizaria melhor desempenho.

Os resultados da Inspira exigem uma qualificação metodológica adicional. A Inspira oferece uma ferramenta complementar de busca de jurisprudência administrativa, separada do chat, com filtro específico para decisões da CVM. Em um teste amostral, o chat da plataforma não respondeu a esse tipo de consulta e direcionou o usuário à ferramenta de busca especializada. Por isso, essa ferramenta foi utilizada nos prompts de busca de precedentes da CVM. A avaliadora verificou posteriormente, contudo, que a ferramenta aceita apenas consultas por palavras-chave e não retornou resultados quando os prompts foram inseridos na íntegra. Para preservar a padronização e a comparabilidade entre plataformas, os prompts não foram reformulados como buscas por palavras-chave; manteve-se o texto integral submetido às outras sete plataformas. O resultado da categoria reflete, portanto, a interação entre o protocolo do estudo e o formato de consulta exigido pela ferramenta.

Por fim, na comparação entre os quatro blocos da Tabela 7, o Harvey apresentou as maiores médias nas duas categorias mais dependentes de fontes brasileiras, relativas à regulação e à jurisprudência da CVM. Isso não significa, contudo, que tenha liderado individualmente essas categorias: na Tabela 6, o ChatGPT obteve pontuação ligeiramente superior em ambas. Ainda assim, o desempenho elevado do Harvey é compatível com a hipótese de que a ativação do filtro Knowledge Sources: Brazil tenha contribuído para os resultados.

3.4 Desempenho por dimensão

A apresentação do desempenho nos eixos esconde em quais dimensões dentro do eixo Resposta (composto por três dimensões) as pontuações se perdem. A Tabela 8 abaixo abre as médias brutas por dimensão, em escala de 0 a 2.

Figura 3
Correção Jurídica e Adequação de Forma, por plataforma
Escala bruta de 0 a 2. A distância entre os dois pontos mede quanto a forma da resposta se adianta ao seu conteúdo.
Correção JurídicaAdequação de Forma
0,81,01,21,41,61,82,0Maritaca+0,72Jus IA+0,34Gemini+0,20Inspira+0,20Harvey+0,18Copilot+0,08Claude+0,02ChatGPT+0,00Δ
Ver tabelaOcultar tabela

Tabela 8. Médias brutas por dimensão, em escala de 0 a 2. As três primeiras colunas compõem o eixo Resposta; a quarta é o eixo Fonte.

PlataformaCorreção JurídicaCompletudeAdequação de FormaConfiabilidade da FonteAdequação − Correção
ChatGPT1,801,721,801,900,00
Harvey1,761,561,941,94+0,18
Claude1,761,641,781,68+0,02
Copilot1,721,461,801,80+0,08
Gemini1,521,281,721,34+0,20
Jus IA1,281,001,621,18+0,34
Inspira1,260,901,461,14+0,20
Maritaca1,021,181,741,20+0,72

A última coluna mostra quanto a média de Adequação de Forma supera a média de Correção Jurídica, o que indica eventual descompasso médio entre as duas dimensões ao longo dos cinquenta prompts. Nas três plataformas com maior média no eixo Resposta, esse descompasso foi pequeno: 0,00 no ChatGPT, +0,18 no Harvey e +0,02 no Claude. Por outro lado, a Maritaca foi a plataforma que apresentou a maior diferença (+0,72), resultante de média elevada em Adequação de Forma (1,74) e menor média em Correção Jurídica (1,02). Esse dado sinaliza que respostas formalmente bem apresentadas podem coexistir com menor correção jurídica e, por isso, recomenda revisão técnica cuidadosa mesmo quando a resposta “parece pronta”.

O dado mais relevante da tabela, porém, é a coluna de Completude. Nenhuma plataforma alcança 1,75, e é a única dimensão em que mesmo as líderes ficam claramente abaixo do teto. A distribuição das 400 avaliações confirma o padrão:

Figura 4
Distribuição das notas em cada dimensão
400 avaliações de respostas da amostra principal.
Correção Jurídica7,2%34,0%58,8%Completude8,0%49,8%42,2%Adequação de Forma20,8%76,2%Confiabilidade da Fonte37,25%57,5%0%25%50%75%100%
Ver tabelaOcultar tabela

Tabela 9. Distribuição das 400 avaliações de respostas da amostra principal em cada dimensão. Cada célula apresenta a contagem absoluta e, entre parênteses, o percentual.

DimensãoNota 0Nota 1Nota 2
Correção Jurídica29 (7,2%)136 (34,0%)235 (58,8%)
Completude32 (8,0%)199 (49,8%)169 (42,2%)
Adequação de Forma12 (3,0%)83 (20,8%)305 (76,2%)
Confiabilidade da Fonte21 (5,25%)149 (37,25%)230 (57,5%)

Metade das respostas do estudo ficou na nota intermediária de Completude, porque cobriram o principal, mas deixaram de fora ao menos um elemento secundário relevante. A implicação prática disso é que a revisão exigida é menos de verificação do que está escrito e mais de identificação do que ficou de fora — um tipo de trabalho mais difícil de delegar e mais difícil de identificar que está incompleto.

3.5 Dispersão das notas e não entregas

A média é uma estatística incompleta para avaliar o conjunto. A distribuição mostra com que frequência cada plataforma devolveu respostas de alta ou baixa pontuação entre os cinquenta prompts testados.

Figura 5
Com que frequência a plataforma entrega algo aproveitável
Proporção das cinquenta respostas de cada plataforma acima de 8,33 e igual ou abaixo de 5,00 no eixo Resposta. As faixas intermediárias não aparecem no gráfico.
40%20%0%20%40%60%80%ChatGPT86%Harvey86%2%Claude90%4%Copilot78%8%Gemini58%12%Maritaca30%38%Jus IA34%26%Inspira26%28%
Ver tabelaOcultar tabela

Tabela 10. Dispersão da pontuação no eixo Resposta ao longo das cinquenta avaliações de cada plataforma.

PlataformaRespostaDesvio-padrãoMenor notaRespostas ≥ 8,33Respostas ≤ 5,00Não entregas
ChatGPT8,871,186,6786%0%0
Harvey8,771,245,0086%2%0
Claude8,631,660,0090%4%1
Copilot8,301,435,0078%8%0
Gemini7,532,170,0058%12%2
Maritaca6,571,753,3330%38%0
Jus IA6,502,340,0034%26%3
Inspira6,032,540,0026%28%5

O ChatGPT apresentou a menor dispersão de desempenho entre os cinquenta prompts testados e nenhuma resposta abaixo de 6,67. O Claude teve a maior taxa de respostas bem avaliadas (90% iguais ou superiores a 8,33, à frente de todas as outras) e, ao mesmo tempo, registrou uma não entrega, que levou sua menor nota a zero.

A Maritaca apresentou perfil distinto na amostra principal: não registrou não entregas e teve desvio-padrão intermediário (1,75), mas concentrou a maior proporção de respostas com pontuação igual ou inferior a 5,00 (38%). A ausência de falhas totais de entrega não se traduziu, portanto, em estabilidade de desempenho adequado; nesse recorte, o principal risco foi a frequência de respostas de baixa pontuação, e não a falta de output.

Na amostra principal, oito das onze não entregas ocorreram na Inspira e no Jus IA: todas as cinco da Inspira e duas das três do Jus IA concentraram-se na categoria C. As três não entregas restantes ocorreram no Gemini, com duas, e no Claude, com uma. A seção 3.3 detalha a nota metodológica aplicável à ferramenta de busca da Inspira e seus efeitos sobre os resultados da amostra principal.

Na trilha de pesquisa profunda, as duas não entregas adicionais ocorreram no mesmo prompt. Nesse caso, Claude e Jus IA não conseguiram verificar a norma mencionada no enunciado e que embasava a pergunta, motivo pelo qual não apresentaram resposta.

3.6 Modos de falha

Do total de 436 avaliações (400 da amostra principal e 36 da amostra em pesquisa profunda), 365 receberam observações qualitativas. Abaixo, estão refletidos os seis modos de falha mais frequentemente identificados, que reúnem 263 ocorrências, apresentadas em ordem de incidência.

Modo 1 — Resposta incompleta por falta de elemento secundário relevante (142 ocorrências)

O modo mais frequente e o mais difícil de detectar em revisão. A resposta estava correta no que afirmava, mas omitia ao menos um elemento secundário relevante, que variava conforme a categoria do prompt. Exemplos recorrentes foram a falta de uma hipótese legal, de uma particularidade ou exceção relevante, ou de um elemento necessário ao documento cuja minuta foi elaborada.

“Faltou mencionar as reservas admitidas pela Lei e suas limitações; hipótese restrita às companhias dos incisos I e II do §3º — impreciso; faltou referência a ao menos um processo específico.” (prompt 25, dividendo obrigatório)

Por que importa: é o erro que sobrevive à revisão superficial. Verificar se o que está escrito está certo é rápido; perceber o que deveria estar e não está exige o conhecimento que se pretendia delegar.

Modo 2 — Norma revogada ou desatualizada (31 ocorrências)

Citação de norma ou artigo revogado. O banco de prompts foi desenhado para expor esse comportamento, por meio da seleção de prompts cujo gabarito era materialmente impactado por alteração legal recente.

“Norma desatualizada e definições imprecisas — condiciona o controle compartilhado a acordo de acionistas (afirmação incorreta).” (prompt 1) · “Norma revogada pela RCVM 160.” (prompt 30)

Por que importa: é o erro mais perigoso para quem não domina o tema, porque a resposta é internamente coerente e a citação parece verificável.

Modo 3 — Prolixidade e gênero fora do padrão (31 ocorrências)

A resposta está certa, mas não tem a forma que o documento pede. É o modo dominante nas categorias de redação.

“Resposta correta e completa, mas prolixa, excessivamente extensa — fora do padrão de mercado, repetindo informações que constam na Proposta da Administração.” (prompt 29) · “A minuta está extensa, com informações que não costumam ser apresentadas neste documento, o que contradiz o art. 57 da RCVM 160, que descreve o aviso ao mercado como aviso resumido.” (prompt 30)

Por que importa: mede a distância entre a resposta e o produto de trabalho.

Modo 4 — Fonte genérica, parcial ou não verificável (30 ocorrências)

Afirmação correta sem ancoragem, norma citada sem dispositivo, ou referência que não se confirma na fonte.

“Afirmação genérica, sem fontes; resposta e conclusão incompletas: não mencionou as reservas estatutárias nem trouxe jurisprudência da CVM, expressamente solicitada no prompt.” (prompt 25) · “Conclusão com embasamento doutrinário não verificável, contrária ao entendimento do Colegiado da CVM.” (prompt 12)

Por que importa: é a diferença entre uma resposta que economiza tempo e uma que apenas o desloca para a etapa de conferência.

Modo 5 — Dispositivo errado (16 ocorrências)

Erro no artigo, no parágrafo ou no inciso citado, ainda que o conteúdo esteja substancialmente correto.

“Artigo errado (correto: art. 37); afirma que preferenciais não votam, mas podem votar, se previsto no estatuto.” (prompt 5) · “Não existe §4º no art. 26.” (prompt 30)

Por que importa: é um tipo de erro que facilmente migra do rascunho para o documento final sem ser percebido e pode impactar negativamente a credibilidade do advogado.

Modo 6 — Não entrega (13 ocorrências)

Recusa expressa, ausência de resultado ou falha técnica de processamento.

“Busca pela superfície de pesquisa (filtro Órgão Julgador = CVM) não retornou resultados; sem resposta.” (prompts 11 a 15) · “Não processou os dois templates de escritura; limite de 100 páginas-imagem.” (prompt 27)

Por que importa: a falta de resposta implica tempo gasto pelo profissional sem obtenção de resultado utilizável. Sob os critérios adotados, a não entrega pontua zero em todas as dimensões e permanece nas médias.

Uma mesma resposta pode apresentar mais de um modo de falha; as ocorrências não são, portanto, mutuamente exclusivas.

3.7 Pesquisa profunda — trilha própria

Seis prompts do banco foram rodados também no modo de pesquisa profunda (deep research) das plataformas que o ofereciam na data-base deste estudo, totalizando 36 avaliações. A avaliação seguiu os mesmos critérios definidos na seção 2.5, também por meio de pautas de correção às cegas, preservada a anonimização. Os resultados foram registrados em trilha separada e não entraram nas médias principais da seção 3.1, porque o objetivo era comparar o modo de busca direta com o modo de pesquisa profunda dentro de cada plataforma.

Figura 6
Efeito do modo de pesquisa profunda sobre a qualidade da resposta
Diferença do eixo Resposta entre o modo de pesquisa profunda e o modo de busca direta, nos mesmos seis prompts. À direita, o modo profundo melhorou; à esquerda, piorou.
−2,0−1,5−1,0−0,50,0+0,5+1,0+1,5+2,0Gemini+1,94Maritaca+0,83Harvey−0,28Jus IA−0,83Claude−1,39ChatGPT−1,67
Ver tabelaOcultar tabela

Tabela 11. Comparação entre o modo de pesquisa profunda e o modo de busca direta, nos mesmos seis prompts. Os dois eixos são reportados separadamente.

PlataformaEixo RespostaEixo Fonte
Pesquisa profundaBusca
direta
ΔPesquisa profundaBusca
direta
Δ
Gemini8,616,67+1,948,335,00+3,33
Maritaca7,506,67+0,836,675,83+0,83
Harvey9,179,44−0,289,179,170,00
Jus IA4,175,00−0,833,333,330,00
Claude8,069,44−1,397,509,17−1,67
ChatGPT8,069,72−1,6710,009,17+0,83

Os resultados indicaram que o modo de pesquisa profunda não produz aprimoramento uniforme. No eixo Resposta, o modo elevou as médias do Gemini (+1,94) e da Maritaca (+0,83), manteve o Harvey próximo do resultado da busca direta (−0,28) e reduziu as médias do Jus IA (−0,83), do Claude (−1,39) e do ChatGPT (−1,67). No eixo Fonte, os efeitos também variaram entre as plataformas.

Portanto, o resultado sugere que a utilidade do recurso de pesquisa profunda depende da plataforma e da tarefa, sem sustentar uma regra geral de ganho de desempenho. O aumento do Gemini no eixo Fonte, de 5,00 para 8,33, é o exemplo mais expressivo de ganho observado. Como a comparação abrangeu uma amostra parcial de seis prompts por plataforma, deve ser lida como indicação restrita a esse conjunto.

4Guia prático de uso

Esta seção traduz os resultados quantitativos e qualitativos para a decisão cotidiana. Ela não substitui o julgamento do advogado sobre o caso concreto e pressupõe revisão técnica de toda resposta, em qualquer plataforma.

4.1 Os quatro fatores da decisão, considerados em conjunto

A seção 2.1 identificou quatro fatores determinantes para a escolha da plataforma ideal por um advogado: custo de acesso, qualidade da resposta, natureza do trabalho jurídico e confidencialidade e governança de dados. Este estudo mede diretamente a qualidade de resposta. A decisão real, porém, não se toma por um fator isolado, razão pela qual as notas deste relatório não devem ser lidas como recomendação autônoma. Os três outros fatores são tratados a seguir, para que a leitura seja conjunta.

Quanto ao custo de acesso, as condições publicadas pelos fornecedores em agosto de 2026 são as seguintes:

Tabela 12. Condições públicas de acesso. Preços consultados nas páginas oficiais dos fornecedores em agosto de 20267.

PlataformaForma de acessoAcesso gratuito ou de testePlano/configuração testada1
ChatGPTAssinatura individual, autoatendimentoSim, com limites de uso e de recursosPlano Plus, US$ 20/mês
ClaudeAssinatura individual, autoatendimentoSim, com uso limitadoPlano Pro, US$ 20/mês
GeminiAssinatura individual, autoatendimentoSim, com limites inferiores aos planos pagosGoogle AI Plus, incluído em assinatura paga Google One de 400 GB, preço regular de R$ 24,99/mês
CopilotLicença corporativa MicrosoftSim, sem custo adicional para contas corporativas qualificadasLicença corporativa; preço específico do contrato não informado
HarveyContrato corporativoNãoContrato corporativo, com preço não divulgado publicamente
MaritacaChat gratuito; assinatura opcionalSim, 10 mensagens por diaCamada gratuita (plano pago: R$ 59,90/mês)
Jus IAAssinatura individual, autoatendimentoSim, acesso experimental limitadoPlano Profissional, preço regular de R$ 108,90/mês
InspiraAssinatura individual, autoatendimentoNão, apenas teste de 3 diasPlano individual, preço regular de R$ 248,00/mês

1 Os preços correspondem às condições observadas na data de consulta e podem variar em razão de localização, tributos, promoções e negociação contratual. As versões dos modelos disponíveis nas assinaturas também podem ter mudado desde a realização dos testes; por isso, as condições atuais de acesso não devem ser confundidas com a configuração efetivamente avaliada.

A transparência dos preços varia entre os produtos. As plataformas brasileiras avaliadas divulgam preços de tabela em reais para alguns planos; OpenAI (ChatGPT) e Anthropic (Claude) publicam os preços dos planos individuais em dólar, com eventual conversão para reais apresentada no checkout; e a Microsoft divulga preço público de referência por usuário para o Microsoft 365 Copilot, embora as condições de contratos corporativos possam variar. O Harvey, o ChatGPT Enterprise e determinadas modalidades corporativas não apresentam preço público de contrato, de modo que a comparação de custos permanece parcial e pode não refletir condições negociadas.

A relevância da natureza do trabalho jurídico para a escolha da plataforma deve ser avaliada em dois níveis: (i) no nível macro, o contexto mais amplo da prática (a plataforma de melhor desempenho para demandas típicas de contencioso pode diferir da melhor para o consultivo de mercado de capitais); e (ii) no nível micro, as tarefas específicas de cada demanda (dentro de uma mesma área de atuação, a plataforma pode apresentar desempenhos distintos ao localizar uma norma, encontrar um precedente, explicar uma construção doutrinária, analisar documentos ou redigir uma minuta). O fator “natureza do trabalho jurídico”, portanto, deve combinar o contexto jurídico mais amplo com as tarefas específicas que serão exigidas da plataforma. Os resultados deste estudo mostram que o desempenho agregado pode ocultar essas diferenças.

A tabela a seguir resume, dentro do recorte do estudo, as implicações dos resultados por natureza do trabalho jurídico e tarefa:

Tabela 13. Implicações dos resultados por natureza do trabalho jurídico e tarefa.

Natureza do trabalho jurídico — nível macroTarefas avaliadas —
nível micro
Implicação para a escolha da plataforma
Consultivo e pesquisa jurídicaLocalizar normas; explicar institutos ou construções doutrinárias; realizar pesquisa exploratóriaDevem ser priorizadas a confiabilidade, a atualidade e a rastreabilidade das fontes. Harvey e ChatGPT apresentaram os melhores resultados no eixo Fonte, mas a incidência de citações a normas revogadas confirma a necessidade de conferência. Os resultados do modo de pesquisa profunda não indicaram vantagem uniforme.
Regulatório de mercado de capitaisLocalizar precedentes da CVM; redigir documentos para atendimento à regulação, como fatos relevantes, comunicados ao mercado ou avisos ao mercadoA elevada dispersão observada na pesquisa de precedentes da CVM indica que o nível de cobertura dessa base específica deve ser verificado antes da escolha da plataforma. Na redação de documentos regulatórios, os resultados foram mais homogêneos e não indicaram vantagem decisiva de um produto.
Societário e contratualRedigir atos societários e minutas; analisar documentos anexos e produzir nova minutaA capacidade de interpretar os documentos fornecidos, observar requisitos formais e devolver arquivo editável pode ser tão relevante quanto a qualidade substantiva. A revisão profissional continua necessária, sobretudo diante da ocorrência de minutas materialmente corretas, mas fora do padrão de mercado.
Outras
práticas
Não avaliadasOs resultados não permitem recomendar plataformas para práticas não abrangidas pelo estudo. Essa limitação é especialmente relevante para o contencioso judicial, dada sua expressão no mercado jurídico brasileiro: não foram testadas tarefas como elaboração de peças processuais, pesquisa de jurisprudência judicial ou gestão de contencioso.

Por fim, quanto à confidencialidade e à governança de dados, a análise deve recair sobre a modalidade de contratação efetivamente utilizada, e não apenas sobre a plataforma. Segundo informações públicas divulgadas pelos fornecedores, planos corporativos tendem a oferecer compromissos mais explícitos e controles mais amplos do que planos individuais ou gratuitos. O Harvey, por exemplo, publica os termos do seu contrato-padrão, que incluem garantias contratuais relativas ao uso e à retenção dos dados.8 Ofertas corporativas de plataformas generalistas, como ChatGPT Enterprise e Claude for Work, também divulgam proteções próprias para dados empresariais, embora não tenham sido as configurações testadas neste estudo.9 A distinção, contudo, não é absoluta: a Maritaca declara não utilizar para treinamento as conversas dos usuários, inclusive na camada gratuita.10 Como esses aspectos não foram testados nem auditados, os resultados não permitem comparar especificamente as plataformas nesse fator.

Combinados os quatro fatores, os resultados apontam soluções distintas conforme o contexto de uso. No recorte avaliado, o Harvey se apresenta como opção consistente para escritórios de grande porte (big law) com atuação consultiva, societária ou contratual. Além disso, teve baixa dispersão e liderou o eixo Fonte, apresentando desempenho elevado nas duas categorias de pesquisa mais dependentes de fontes brasileiras.

Para profissionais autônomos e escritórios de menor porte que busquem reduzir a frequência de respostas de baixa pontuação sem elevar substancialmente o custo, ChatGPT e Claude apresentaram desempenho próximo ao do Harvey e estão disponíveis em assinaturas individuais de US$ 20 mensais. Antes do uso profissional, contudo, a adequação desses planos deve ser avaliada à luz dos requisitos aplicáveis de confidencialidade e governança de dados.

A Maritaca oferece camada gratuita, mas seu desempenho foi heterogêneo: Correção Jurídica foi sua dimensão mais frágil, embora tenha pontuado bem em Adequação de Forma. Jus IA e Inspira, embora posicionadas como ferramentas jurídicas especializadas no mercado brasileiro, apresentaram variabilidade comparativamente alta e não superaram de forma consistente as plataformas generalistas. Assim, diferenças de preço, interface ou grau de especialização jurídica não eliminam a necessidade de revisão técnica rigorosa.

Essas indicações se restringem às práticas e tarefas avaliadas e não devem ser extrapoladas para outros contextos.

5Conclusão

O estudo comparou oito plataformas em cinquenta prompts correspondentes a tarefas especializadas de direito brasileiro. Os resultados não sustentam a superioridade absoluta de uma ferramenta. No eixo Resposta, ChatGPT, Harvey e Claude apresentaram médias próximas, e a análise pareada não forneceu evidência estatística suficiente para afirmar vantagem consistente de uma delas sobre as demais; isso, contudo, não demonstra equivalência. A liderança descritiva também variou conforme o eixo considerado e o uso do índice composto. Para o uso profissional, os dados ajudam a identificar padrões de desempenho, tipos recorrentes de falha e o provável grau de revisão exigido no recorte testado; não medem, por si sós, ganhos de produtividade nem o grau em que uma tarefa pode ser delegada.

Nesse contexto, a principal preocupação identificada foi a completude. A falha mais recorrente não consistiu na apresentação de informações falsas, mas na omissão de elementos juridicamente relevantes. Trata-se de um risco menos evidente: uma resposta pode estar correta no que afirma e, ainda assim, ser insuficiente. Como essa deficiência muitas vezes só pode ser identificada por quem já domina a matéria, eventuais ganhos de produtividade dependem da revisão técnica do advogado — não apenas para verificar o conteúdo apresentado, mas também para reconhecer o que deixou de ser considerado.

Essas conclusões devem ser lidas à luz das limitações descritas na seção 6 a seguir, tendo em vista que descrevem o desempenho nas tarefas, nos modelos e nas configurações especificamente testados, e não constituem avaliações definitivas das plataformas nem garantias de desempenho em outros contextos.

6Limitações

A aplicação de um protocolo comum e de critérios uniformes de avaliação permitiu comparar as plataformas em bases consistentes. Essa padronização confere utilidade à análise, mas também impõe limites à interpretação dos resultados, expostos a seguir:

  • Escopo e representatividade. A amostra é restrita a cinquenta prompts correspondentes a tarefas das práticas de mercado de capitais, societário e governança corporativa. A seleção das oito plataformas não abrange todo o mercado. Foi realizada uma única execução por combinação de prompt e plataforma, de modo que o estudo não captura a variação que poderia ocorrer entre respostas sucessivas. Os resultados por categoria, baseados em cinco prompts cada, e os resultados do modo de pesquisa profunda, baseados em seis prompts por plataforma, devem ser lidos como indicações restritas ao conjunto testado.
  • Avaliação das respostas. A avaliação foi conduzida por uma única especialista, sem segunda avaliação independente ou medida de concordância entre avaliadores. A identificação das plataformas foi mascarada, mas elementos como estilo, formatação e arquivos em formatos nativos podem ter permitido seu reconhecimento indireto.
  • Configuração, interação e momento da avaliação. Os resultados refletem os modelos, as funcionalidades e as interfaces disponíveis em junho de 2026, utilizados segundo os fluxos específicos de cada plataforma. O protocolo adotou uma execução única a partir do prompt original, sem sucessivas rodadas de esclarecimento ou refinamento; portanto, mede a resposta inicial produzida em condições padronizadas, e não necessariamente o melhor resultado que um usuário experiente poderia obter por meio de interação iterativa. No caso da Inspira, o protocolo de prompt literal também interagiu com o formato de busca por palavras-chave da plataforma. Atualizações posteriores de modelos, funcionalidades ou interfaces podem alterar o desempenho observado.
  • Dimensões não avaliadas. O estudo não inclui parâmetro humano nem mede o tempo de execução ou de revisão. Por isso, seus resultados não permitem estimar diretamente ganhos de produtividade ou o grau de delegabilidade das tarefas. Segurança, privacidade e confidencialidade também não foram testadas nem auditadas; as referências da seção 4.1 limitam-se a resumir declarações públicas dos fornecedores e não substituem a análise do plano, do contrato e dos controles efetivamente aplicáveis. Tampouco foram avaliados integração com fluxos de trabalho, facilidade de uso do produto, custo total de propriedade ou tarefas de outras práticas, inclusive de contencioso judicial.

Dentro desses limites, o estudo oferece uma base comparativa útil para identificar tendências, formular critérios de escolha e orientar verificações adicionais. Os resultados devem ser utilizados como evidência sobre o recorte específico avaliado, e não como classificação definitiva das plataformas ou garantia de desempenho em outros contextos.

O banco de prompts, os outputs anonimizados, as pautas de correção e a planilha completa de pontuação poderão ser integralmente disponibilizados para fins de auditoria ou discussão metodológica, mediante solicitação à autora.

7Referências

Almeida, T. S., Abonizio, H., Nogueira, R., & Pires, R. (2024). Sabiá-2: A new generation of Portuguese large language models [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2403.09887

Carvalho Neto, P. B. de. (2026). LegalBench-BR: A benchmark for evaluating large language models on Brazilian legal decision classification [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2604.18878

Delfino, P., Cuconato, B., Haeusler, E. H., & Rademaker, A. (2017). Passing the Brazilian OAB exam: Data preparation and some experiments [Preprint]. arXiv. https://doi.org/10.48550/arXiv.1712.05128

Guha, N., Nyarko, J., Ho, D. E., Ré, C., Chilton, A., Narayana, A., Chohlas-Wood, A., Peters, A., Waldon, B., Rockmore, D. N., Zambrano, D., Talisman, D., Hoque, E., Surani, F., Fagan, F., Sarfaty, G., Dickinson, G. M., Porat, H., Hegland, J., … Li, Z. (2023). LegalBench: A collaboratively built benchmark for measuring legal reasoning in large language models [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2308.11462

Guo, A., & Rodrigues, A. (2025). Putting AI to the Test in Real-World Legal Work: An AI evaluation report for in-house counsel. Retrieved from https://www.legalbenchmarks.ai/research/phase-1-research

HazyResearch. (n.d.). LegalBench [Benchmark website]. Stanford University. Retrieved August 17, 2026, from https://hazyresearch.stanford.edu/legalbench/

HazyResearch. (n.d.). LegalBench [Source code]. GitHub. Retrieved August 17, 2026, from https://github.com/HazyResearch/legalbench

Laitz, T., Almeida, T. S., Abonizio, H., Malaquias Junior, R., Bonás, G. K., Piau, M., Larcher, C., Pires, R., & Nogueira, R. (2026). Sabiá-4 technical report [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2603.10213

Malaquias Junior, R., Pires, R., Romero, R., & Nogueira, R. (2024). Juru: Legal Brazilian large language model from reputable sources [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2403.18140

Pacheco, E. C. B., Suriani, F. M., & Ribeiro, R. (2025). Rabula: A benchmark for evaluating LLMs in Brazilian legal tasks. In Proceedings of the First Argument Mining and Empirical Legal Research Workshop (AMELR 2025) (CEUR Workshop Proceedings, Vol. 4089, Paper 6). https://ceur-ws.org/Vol-4089/paper6.pdf

Pires, R., Malaquias Junior, R., & Nogueira, R. (2025). Automatic legal writing evaluation of LLMs [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2504.21202

Pires, R., Almeida, T. S., Larcher Junior, C., Bonás, G., Abonizio, H., Piau, M., Malaquias Junior, R., Laitz, T., & Nogueira, R. (2026). Magis-Bench: Evaluating LLMs on magistrate-level legal tasks [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2605.08437

Vals AI. (2025, February 27). Vals Legal AI Report. https://www.vals.ai/industry-reports/vlair-2-27-25

8Como citar este relatório

Ao citar este relatório, utilize o formato exigido pelo veículo ou pela instituição de destino. Os modelos abaixo referem-se a esta edição em português; ao citar a edição em inglês (https://legalaibench-brazil.netlify.app/en/), utilize o título e o endereço daquela edição.

ABNT (NBR 6023)

MINOTTO, Natalia. LegalAI Bench Brazil: avaliação comparativa de IA jurídica no direito brasileiro. [S. l.], 2026. Disponível em: https://legalaibench-brazil.netlify.app/. Acesso em: [data de acesso].

APA (7ª edição)

Minotto, N. (2026). LegalAI Bench Brazil: avaliação comparativa de IA jurídica no direito brasileiro [Relatório independente]. https://legalaibench-brazil.netlify.app/

Bluebook (21ª edição)

Natalia Minotto, LegalAI Bench Brazil: Avaliação Comparativa de IA Jurídica no Direito Brasileiro (2026), https://legalaibench-brazil.netlify.app/.

BibTeX

@misc{minotto2026legalaibench,
author = {Minotto, Natalia},
title = {LegalAI Bench Brazil: Avaliação comparativa de IA jurídica no direito brasileiro},
year = {2026},
url = {https://legalaibench-brazil.netlify.app/},
note = {Relatório bilíngue (PT/EN)}
}

Notas

  1. Os benchmarks públicos brasileiros identificados até a data-base concentram-se em tarefas derivadas de exames jurídicos ou na classificação de decisões judiciais. Não foram identificados estudos públicos independentes que comparassem plataformas jurídicas brasileiras e estrangeiras com base em prompts extraídos da prática profissional de um advogado que atua no âmbito do direito brasileiro. Os benchmarks internacionais identificados são predominantemente em língua inglesa e não avaliam conjuntamente o direito brasileiro e plataformas jurídicas brasileiras.
  2. Harvey Team. (2025, 13 de maio). Expanding Harvey’s model offerings. https://www.harvey.ai/blog/expanding-harveys-model-offerings; Grupen, N. (2026, 10 de março). Why Harvey is multi-model by design. Harvey. https://www.harvey.ai/blog/why-harvey-is-multi-model-by-design.
  3. Harvey Team. (2024, 29 de agosto). Introducing BigLaw Bench. https://www.harvey.ai/blog/introducing-biglaw-bench. Trata-se de benchmark produzido pelo próprio fornecedor avaliado.
  4. IC 95% é uma faixa que resume a incerteza da diferença média estimada pelo procedimento de bootstrap pareado aplicado aos cinquenta prompts. Quando o intervalo abrange valores negativos e positivos, os resultados são compatíveis, dentro desse procedimento, tanto com vantagem de uma plataforma quanto da outra ou com diferença nula. Isso não demonstra equivalência nem autoriza a generalização dos resultados para além do conjunto testado.
  5. Conselho Nacional de Justiça. (2026). Justiça em números 2026 (ano-base 2025). https://www.cnj.jus.br/wp-content/uploads/2026/06/justica-em-numeros-2026.pdf. A nota de divulgação do CNJ não detalha o critério de equivalência entre as categorias processuais brasileiras e as adotadas pela Comissão Europeia para a Eficiência da Justiça (CEPEJ), cujos ciclos de avaliação não abrangem o Brasil. Para a comparação internacional, o CNJ somou todas as instâncias e todos os tipos de processo constantes dos dados da CEPEJ. O próprio relatório adverte que os 40,9 milhões de casos novos podem incluir a contabilização do mesmo processo em diferentes fases ou instâncias no mesmo ano; considerando apenas ações originárias, processos de conhecimento e execuções extrajudiciais, o total seria de 24,7 milhões.
  6. Comissão de Valores Mobiliários. (s.d.). Pesquisa avançada: Jurisprudência CVM. Recuperado em 12 de agosto de 2026, de https://www.gov.br/cvm/pt-br/assuntos/jurisprudencia; Comissão de Valores Mobiliários. (2026). Relatório de atividade sancionadora CVM 2025: 4º trimestre — versão resumida (pp. 15–16). https://www.gov.br/cvm/pt-br/centrais-de-conteudo/publicacoes/relatorios/relatorio-de-atividade-sancionadora/relatorio-de-atividade-sancionadora-cvm-2025-4o-trimestre-versao-resumida.pdf/view. O relatório registra 49 processos administrativos sancionadores julgados pelo Colegiado em 2025, dos quais 43 de rito ordinário e seis de rito simplificado.
  7. Fontes consultadas em agosto de 2026: OpenAI. (s.d.). ChatGPT pricing. https://chatgpt.com/pricing; Anthropic. (s.d.). Plans & pricing. https://claude.com/pricing; Google. (s.d.). Google AI subscriptions. https://gemini.google/br/subscriptions; Microsoft. (s.d.). Microsoft 365 Copilot — preços. https://www.microsoft.com/pt-br/microsoft-365-copilot/pricing; Maritaca AI. (s.d.). Planos. https://www.maritaca.ai/planos; Jusbrasil. (s.d.). Jus IA — Planos e preços. https://ia.jusbrasil.com.br/planos; Inspira. (s.d.). Planos. https://www.inspire-se.co/; Harvey. (s.d.). Harvey. https://www.harvey.ai/
  8. Harvey AI Corporation. (s.d.). Secure legal AI for the most sensitive matters. Recuperado em 16 de agosto de 2026, de https://www.harvey.ai/security; Harvey AI Corporation. (s.d.). Platform Agreement. Recuperado em 16 de agosto de 2026, de https://www.harvey.ai/legal/platform-agreement.
  9. OpenAI. (s.d.). ChatGPT Work admin FAQ. Recuperado em 16 de agosto de 2026, de https://learn.chatgpt.com/docs/enterprise/work-admin-faq; OpenAI. (s.d.). Pricing. Recuperado em 16 de agosto de 2026, de https://learn.chatgpt.com/docs/pricing; Anthropic. (s.d.). Is my data used for model training? — Commercial products. Recuperado em 16 de agosto de 2026, de https://privacy.claude.com/en/articles/7996868-is-my-data-used-for-model-training. A OpenAI informa que o ChatGPT Enterprise não utiliza dados empresariais para treinamento por padrão e oferece controles de acesso, retenção e residência de dados; a Anthropic declara que, por padrão, não utiliza os inputs e outputs de produtos comerciais, como o Claude for Work, para treinar seus modelos.
  10. Maritaca AI. (s.d.). Inteligência artificial para o Brasil. Recuperado em 16 de agosto de 2026, de https://www.maritaca.ai/. A empresa declara que as conversas do chatbot são armazenadas para acesso posterior pelo usuário, mas não são utilizadas para treinamento, independentemente de o plano ser pago ou gratuito.

LegalAI Bench Brazil

A comparative evaluation of eight artificial intelligence platforms on fifty capital markets, corporate law, and corporate governance tasks under Brazilian law

8 platforms50 prompts400 answer evaluations in the main sample36 deep research evaluations
About the evaluator

Natalia Minotto is a lawyer with seven years of experience in Big Law, including one year at Mayer Brown LLP’s New York office. Her practice focuses on capital markets, publicly held companies and corporate governance.

Natalia holds law degrees from the University of São Paulo (USP), Brazil, and Université Lumière Lyon 2, France. She will begin her MBA at the University of Chicago Booth School of Business in September 2026, focusing on the intersection of law, technology, and business.

linkedin.com/in/nataliaminotto
Professional portrait of Natalia Minotto

1Executive summary

This study compares eight artificial intelligence platforms on fifty Brazilian law tasks in capital markets, corporate law, and corporate governance. Each answer was scored on four distinct dimensions (Legal Accuracy, Completeness, Form and Style, and Source Reliability), grouped into two axes (Answer and Source). Scoring was done by an expert evaluator working from blinded scoring sheets, in which the eight answers to each prompt appear coded and in randomized order, with the code-to-platform key kept sealed until scoring was complete.

The intended contribution is to address a gap in the publicly available benchmark literature: few independent studies compare Brazilian and non-Brazilian platforms on specialized Brazilian law tasks drawn from professional practice.1

What the data show

  • On the Answer axis, ChatGPT, Harvey, and Claude had similar mean scores. The uncertainty ranges of the paired differences are compatible with an advantage for either platform or with no difference at all; the study does not provide sufficient statistical evidence to identify a consistent leader, but neither does it establish equivalence. Harvey had the highest descriptive mean on the Source axis, at 9.70.
  • Completeness was the dimension with the lowest overall results: 49.8% of answers received the intermediate score and only 42.2% reached the maximum (Table 9). An answer can therefore be correct in what it states and still omit legally relevant elements.
  • The Brazilian legal platforms, Jus IA and Inspira, performed substantially worse in the two categories that depend on sources drawn from the database of Brazil’s Securities and Exchange Commission (Comissão de Valores Mobiliários, or CVM): Capital markets regulation and CVM case law. In those categories, the gap to the non-Brazilian general-purpose platforms was 5.88 points; across the other eight categories, it fell to 1.11 points (Table 7).
  • Across the six prompts tested, deep research mode showed no consistent advantage over standard mode. On the Answer axis, it improved Gemini’s and Maritaca’s results, kept Harvey close to its standard-mode performance, and lowered the averages of Jus IA, Claude, and ChatGPT. These effects should be read as specific to the platforms and tasks evaluated (Table 11).

Every figure in this summary is developed, with its underlying calculation shown, in sections 3 and 4.

2Methodology

2.1 Scope

The study aims to present a benchmark covering artificial intelligence platforms commonly used by Brazilian lawyers in their day-to-day practice, from the best-known general-purpose products, such as ChatGPT and Claude, to specialized legal platforms, such as Harvey, Jus IA, and Inspira.

The decision of which platform to use depends on multiple factors, four of which stand out. The first is cost of access: free platforms tend to be used more widely, while access to subscription-based or enterprise products depends on how much lawyers are willing to allocate to AI tools — or on whether their firms subscribe to the platform. The second is answer quality: whether the answer is reasonably satisfactory and verifiable — enough to actually save time. The third is the nature of the legal work: different criteria may carry more weight depending on the practice area and task — for example, a litigator who regularly drafts briefs and other court filings may place greater weight on case-law coverage than a lawyer advising on capital markets matters. The fourth is confidentiality and data governance: whether the platform provides sufficient transparency and control over how information is handled, including any use of data for model training and the safeguards and protections available under the chosen plan.

This report addresses these four factors in the decision process, with a focus on the second — output quality. To that end, the answers of the evaluated platforms to fifty prompts, drawn and adapted from the evaluator’s legal practice, were compared by scoring each answer against predefined, transparent, auditable criteria. The four factors are revisited together in section 4, where the results are translated into practical decision-making.

Finally, this study also aims to add to the existing body of benchmarks of artificial intelligence platforms for the Brazilian legal market, taking its variables into account and fostering research and development in the country’s legal tech industry.

2.2 Platforms evaluated

Eight platforms were evaluated, grouped into four product categories: non-Brazilian general-purpose, Brazilian general-purpose, non-Brazilian legal, and Brazilian legal. The platforms differ in their value propositions, data sources, and commercial models. The comparison therefore concerns their performance on the same tasks and does not assume that they are equivalent products. To determine the model and configuration used for each platform, the study applied a single criterion: the best available setup for the study’s purposes as of the June 2026 cutoff, when the prompts were run. The evaluator purchased individual subscriptions to ChatGPT, Claude, Jus IA, and Inspira and accessed Copilot and Harvey through corporate licenses.

Table 1. Platforms evaluated: product category, model, and access.

Platform1CategoryModel2Access
ChatGPTNon-Brazilian general-purposeGPT-5.5Individual subscription
ClaudeNon-Brazilian general-purposeOpus 4.8Individual subscription
GeminiNon-Brazilian general-purpose3.1 ProPaid 400 GB Google One subscription, which includes Google AI Plus
CopilotNon-Brazilian general-purposeNot selectable in the tested interface; automatic routingMicrosoft corporate license
HarveyNon-Brazilian legalAuto mode (automatic routing and orchestration)Corporate license
MaritacaBrazilian general-purposeSabiá-4Free tier
Jus IABrazilian legalPlatform-native systemFreemium; full version by individual subscription
InspiraBrazilian legalPlatform-native systemIndividual subscription; B2C channel

1Legora, another non-Brazilian legal platform, was considered for inclusion but was not evaluated because it does not offer individual subscriptions and the evaluator did not have access through an organization that had contracted the platform.
2All platforms were evaluated through their chat function, except Inspira, where the prompts involving searches for administrative-proceeding precedents were submitted to the platform’s own case-search tool. Section 3.3 details this choice and its effects.

2.3 Fixed configurations

The study was designed to evaluate each platform using the best configuration available as of June 2026, rather than to evaluate the underlying model in isolation. The comparison is of the product as configured and used by the evaluator.

Table 2. Configurations fixed on each platform as of the June 2026 cutoff date.

PlatformReasoningGroundingWhere the baseline instructions were placed
ChatGPTHighWeb search turned on by the evaluatorProject
ClaudeExtended thinking, maximum effortWeb search turned on by the evaluatorProject
GeminiDeep Think onAutomatic, with no user-facing activation control1Gem
CopilotThink Deeper onWeb search active by default; the evaluator did not change the default setting2Beginning of each prompt
MaritacaNot applicableWeb search turned on by the evaluatorBeginning of each prompt
Jus IANot applicableNative sourcesBeginning of each prompt
InspiraNot applicableNative referencesBeginning of each prompt
HarveyBuilt into Auto modeKnowledge Sources: Brazil + web searchBeginning of each prompt

1On Gemini, grounding in Google Search results is automatic and exposes no user-facing activation control; some answers merely document that they are grounded in search results.
2On Copilot, web search is an integral part of the product and runs through Bing. Corporate versions offer admin controls and a user-facing toggle, but the evaluator could not verify how the organization’s tenant was configured.

The same baseline instructions, with identical wording, were provided to every platform to standardize the comparison. The Portuguese-language baseline instructions provided to all platforms are translated below for purposes of this English-language version:

You assist a Brazilian lawyer practicing capital markets, regulatory, corporate, and contract law. Jurisdiction: Brazilian law in force. Language: Portuguese. Rules: (1) cite the specific statute and provision, not generic references; (2) if unsure of the rule in force, say so instead of making it up; (3) match language and structure to the requested document type; (4) be concise; (5) do not invent statutes, numbers, provisions, parties, or facts not provided.

How the baseline instructions were supplied depended on each product’s architecture, as shown in the last column of Table 2. On platforms with a dedicated field for persistent instructions, they were entered there; on the others, they were included at the beginning of each prompt.

One caveat regarding Harvey’s test setup deserves note. When the responses were collected, Harvey incorporated models from other vendors, including OpenAI, Anthropic, and Google—the makers of ChatGPT, Claude, and Gemini, respectively. Users could manually select a specific model or use Auto mode, in which, according to the vendor, each query was routed to the model or set of models deemed most suitable. Manual selection was optional.2

For this study, Auto mode was kept for all evaluations, with no manual model selection. That choice preserved the uniformity of collection and allowed Harvey to be evaluated in the configuration designed to select the most suitable models for each query. The results therefore reflect the product’s performance in its multi-model architecture.

2.4 The prompt bank

The fifty prompts were adapted from the evaluator’s professional interactions with different platforms over the year preceding the study. The subject matter was deliberately limited to her areas of specialization: corporate law, capital markets, publicly held companies, and corporate governance. The prompts are therefore restricted to these specific Brazilian law practices, with greater analytical precision as the trade-off.

For use in this study, those interactions were anonymized — that is, stripped of any mention of clients, transactions, or other confidential information — rewritten in a standardized format, and condensed so that each task could be answered by the platforms in a single turn, with no follow-up questions. The adaptation was assisted by Claude’s artificial intelligence assistant; category assignment, final wording, and validation of each prompt were decided by the evaluator.

Four central rules guided the development of the prompt bank and the adaptation of the original material: (i) short, self-contained prompts with objective answer keys, so that responses could be produced and scored without follow-up questions; (ii) answer keys grounded in the statutes in force and in the prevailing interpretations reflected in legal scholarship and case law as of the data-collection cutoff date; (iii) anonymization of the prompts by removing names and any data that could identify specific companies, individuals, or projects; and (iv) selection of prompts whose scoring could be audited by an independent reviewer with access to the complete set of research materials.

The prompts were distributed across ten categories of five prompts each, corresponding to different types of work typical of the covered practices. The categories span tasks that draw on distinct platform capabilities and vary in difficulty.

Table 3. The ten prompt categories and the capabilities tested in each.

GroupCategoryWhat the category requires of the platform
ACore corporate lawConceptual precision on a specific concept of Law No. 6,404/76 (the Brazilian Corporations Law) and analysis of the corresponding provision
BCapital markets regulationSystematic reading of the regulation, taking into account the guidance of the CVM’s technical staff
CCVM case lawLocating a precedent of the CVM’s Board of Commissioners, with verifiable case number and content
DCVM administrative proceedingsProcedural accuracy on procedure, penalties, and limitation periods
ELegal scholarship and case lawSynthesis of a scholarly interpretation and how it has been treated by the CVM
FDocument review and draftingCritical reading of an attached document and drafting from it
GCorporate document draftingDrafting technique for corporate acts, correctly adapted to the case at hand
HMaterial facts and market noticesAppropriateness of document type and language calibration under regulatory risk
IApplied regulatory questionsApplying a rule to a concrete situation, with an objective conclusion
JGeneral and cross-cuttingCombining more than one corporate law concept in a single answer, in the context of a transaction

2.5 Evaluation criteria: two axes, four dimensions

Each answer was evaluated on two separate axes. The "Answer" axis measures the quality of the content delivered and comprises three dimensions: Legal Accuracy, Completeness, and Form and Style. The "Source" axis measures the precision, specificity, verifiability, and appropriateness of the citations and bases relied upon, through the Source Reliability dimension.

The two axes are kept separate because an answer may reach a substantively correct conclusion without supporting it with verifiable legal authority, while another may cite reliable authority yet reach the wrong conclusion. Combining the two axes into a single score would obscure the information lawyers need to determine how much review an answer requires and what kind. An answer that scores highly on both axes may require less review; one with strong substantive content but weak source support may still be useful, but its supporting legal authorities must be verified independently; and one with weak substantive content may require substantial revision. BigLaw Bench uses a similar framework, reporting an answer score and a source score separately.3 The composite index presented in section 3.1 below is a secondary measure, included only to provide an alternative aggregate view.

Each answer was assigned a score of 0, 1, or 2 on each of the four dimensions. Scoring was based on the general criteria established before data collection and set out in Table 4, together with a prompt-specific answer key. For each prompt, the evaluator recorded the applicable legal grounds and the essential elements of the expected answer in the corresponding scoring sheet. This documentation makes the evaluation auditable and reduces subjectivity.

Table 4. Score criteria. The first three dimensions make up the Answer axis; the fourth alone constitutes the Source axis.

AxisDimension012
AnswerLegal AccuracyMaterial error in the underlying premise: incorrect legal or conceptual basisCorrect core conclusion, but with a material inaccuracyCorrect, with no material errors
CompletenessOmits essential elementsCovers the main points but omits a relevant secondary elementCovers all essential points
Form and StyleIncorrect document type or register (e.g., provides an explanation when a draft was requested)Correct document type, but with material deficiencies in form or style (e.g., overly verbose or generic)Appropriate document type, structure, and register
SourceSource ReliabilityCites or relies on incorrect, superseded, or unverifiable authority, or provides no support when support is requiredCites or relies on sources that provide only partial support or are overly general, incomplete, imprecise, or difficult to verifyCites or relies on sources that are accurate, specific, appropriate, and verifiable

Both axes were applied to every prompt. For prompts that did not call for formal citations, the Source score instead reflected whether the answer rested on an accurate and verifiable legal basis, complied with applicable legal requirements, and, where relevant, was consistent with the documents provided. The absence of a formal citation therefore did not automatically result in a score of zero.

Each axis is scored as follows:

Answer (0 to 10) = (Legal Accuracy + Completeness + Form and Style) ÷ 6 × 10

Source (0 to 10) = Source Reliability ÷ 2 × 10

The divisor of 6 is the maximum combined score across the three dimensions of the Answer axis (2 + 2 + 2), while the divisor of 2 is the maximum score for the single dimension that constitutes the Source axis. Converting both scores to a common 0-to-10 scale makes it easier to compare platform performance on each axis while preserving the conceptual distinction between them. Accordingly, the main analysis reports and examines the Answer and Source scores separately.

In terms of output format, thirty-five prompts required a chat response, while fifteen involved drafting or reviewing a document.

2.6 Collection and blinded scoring

Collection and scoring took place in separate, sequential stages. During collection, browser automation was used to submit the prompts and record the resulting outputs on all platforms except Harvey. For Harvey, where automation was not feasible, the same procedure was carried out manually. Each output was saved in full and without edits, thereby creating a stable record for subsequent auditing that did not depend on links or platform-specific sharing features. Before recording each output, the evaluator confirmed that the baseline instructions were active. If this could not be verified, the run was discarded and repeated.

Scoring was entirely manual and blinded. For each prompt, all answers were compiled into a blinded scoring sheet, in randomized order and coded A through H — or A through N for the prompts that also ran in deep research mode — with the original formatting preserved and the content anonymized. Answers delivered as native files were provided separately, in their original anonymized format. The code-to-platform key remained sealed in a separate file until scoring for each batch was complete.

Because Claude served as the project’s AI assistant while also being one of the platforms evaluated, its role was deliberately limited to minimize any potential conflict of interest. It assisted with standardizing the original prompts (section 2.4), preparing the anonymized scoring sheets, and compiling the scores in a spreadsheet. Claude did not draft or otherwise contribute to the answer keys, score any outputs, or produce summaries or comparisons. For each of the fifty prompts, the evaluator directly compared the complete outputs from all eight platforms.

3Results

3.1 Aggregate performance

Figure 1
Answer quality and source reliability, by platform
Average of each platform’s fifty main-sample evaluations. 0-to-10 scale. The two axes are reported separately, never added.
Answer axisSource axis
0246810Harvey8.779.70ChatGPT8.879.50Copilot8.309.00Claude8.638.40Gemini7.536.70Maritaca6.576.00Jus IA6.505.90Inspira6.035.70
Show tableHide table

Table 5. Aggregate performance. Mean scores from the fifty evaluations in each platform’s main sample, excluding deep research runs. Answer, Source, and composite index scores are reported on a 0-to-10 scale. Platforms are ordered by the composite index.

PlatformProduct categoryAnswerSourceComposite indexUnanswered prompts (n/50)
HarveyNon-Brazilian legal8.779.709.240
ChatGPTNon-Brazilian general-purpose8.879.509.190
CopilotNon-Brazilian general-purpose8.309.008.650
ClaudeNon-Brazilian general-purpose8.638.408.521
GeminiNon-Brazilian general-purpose7.536.707.122
MaritacaBrazilian general-purpose6.576.006.290
Jus IABrazilian legal6.505.906.203
InspiraBrazilian legal6.035.705.875

The Answer and Source axes are analyzed separately. To provide an overall summary, Table 5 also reports a composite index calculated as the simple average of the scores on the two axes: (Answer + Source) ÷ 2. Both axes use a 0-to-10 scale and receive equal weight. The composite index is descriptive only; the primary analysis examines the Answer and Source scores separately.

“Unanswered prompts” comprise cases in which the platform expressly refused to answer, returned no output, or encountered a technical processing failure. Each such case was assigned a score of zero on each of the four dimensions. The effect on the reported means therefore varied with the number recorded for each platform.

Three observations emerge from the aggregate results in Table 5, concerning the highest-scoring platforms, the Source axis, and the relationship between the two axes.

First, the differences among the three highest-scoring platforms on the Answer axis were small. Across the fifty prompts, ChatGPT’s mean Answer score was 0.10 points higher than Harvey’s. In the paired bootstrap analysis, the 95% confidence interval (95% CI)4 for that difference ranged from −0.23 to +0.43. This interval is compatible with outcomes ranging from a 0.23-point advantage for Harvey to a 0.43-point advantage for ChatGPT, including no difference. The mean difference between ChatGPT and Claude was +0.23 (95% CI: −0.20 to +0.73), while the difference between Harvey and Claude was +0.13 (95% CI: −0.30 to +0.63). All three intervals include zero. The analysis therefore does not provide sufficient statistical evidence of a consistent advantage for any one platform. Taken together, these results place ChatGPT, Harvey, and Claude in a top group with similar observed means on the Answer axis, but do not identify a statistically supported leader.

Second, Harvey had the highest mean Source score (9.70), followed by ChatGPT (9.50) and Copilot (9.00). The difference between Harvey and ChatGPT was only 0.20 points on the 0-to-10 scale, equivalent to a two-point difference in the sum of the fifty Source Reliability ratings on the rubric’s original 0-to-2 scale. Both platforms therefore performed strongly on this axis, with Harvey holding a narrow descriptive lead that, by itself, does not establish consistently superior source reliability.

Third, scores on the two axes generally move in the same direction: platforms with higher Answer scores also tend to rank higher on Source. The axes are not redundant, however. Harvey scores higher than ChatGPT on Source but slightly lower on Answer; similarly, Copilot scores higher than Claude on Source but lower on Answer. These rank reversals illustrate the value of reporting the axes separately, while the composite index serves only as a summary measure of aggregate performance.

3.2 Performance by category

Table 6 reports each platform’s scores on the Answer axis scores by category.

Figure 2
Answer axis by platform and category
Each cell is the average of the category’s five prompts. Hover to see the value and the full category name.
ABCDEFGHIJChatGPT8.679.6710.009.3310.008.007.338.009.338.33Harvey8.679.009.678.679.338.677.338.679.008.67Claude8.339.009.339.009.337.008.008.009.009.33Copilot8.338.339.338.679.677.006.008.338.009.33Gemini8.006.677.339.008.676.007.677.007.677.33Maritaca6.007.007.006.337.335.335.336.677.677.00Jus IA7.333.673.008.008.337.005.337.677.337.33Inspira7.004.670.007.008.336.007.006.676.337.33
Show tableHide table

Table 6. Scores on the Answer axis by platform and category, on a 0-to-10 scale. Categories A–J correspond to those in Table 3.

PlatformABCDEFGHIJ
ChatGPT8.679.6710.009.3310.008.007.338.009.338.33
Harvey8.679.009.678.679.338.677.338.679.008.67
Claude8.339.009.339.009.337.008.008.009.009.33
Copilot8.338.339.338.679.677.006.008.338.009.33
Gemini8.006.677.339.008.676.007.677.007.677.33
Maritaca6.007.007.006.337.335.335.336.677.677.00
Jus IA7.333.673.008.008.337.005.337.677.337.33
Inspira7.004.670.007.008.336.007.006.676.337.33
Mean across platforms7.797.256.968.258.886.886.757.638.048.08

Two patterns stand out. First, mean performance varied across categories. The two lowest category means were for document-drafting tasks: Corporate document drafting (6.75) and Document review and drafting (6.88). The two highest were for explanatory tasks: Legal scholarship and case law (8.88) and CVM administrative proceedings (8.25). Within this sample, the platforms performed better on explanatory tasks than on drafting tasks.

The second pattern concerns variation across categories within each platform. For six of the eight platforms, the difference between their highest and lowest category scores was less than 3.7 points. The two exceptions were Jus IA, with a range of 5.33 points, and Inspira, with a range of 8.33 points. In both cases, the wider range was driven primarily by their low scores in the category requiring CVM precedents research. Section 3.3 provides the additional context needed to interpret this pattern.

3.3 Performance by product type and prompt category

Table 7 compares Answer scores by prompt category across four comparison groups defined by product type.

Table 7. Mean Answer scores by comparison group and prompt category, ordered from largest to smallest cross-group range. For each category, the range is the difference between the highest and lowest group means and is used only to order the categories.

CategoryNon-Brazilian general-purpose platforms (n = 4)Jus IA and Inspira (n = 2)MaritacaHarveyRange
C. CVM case law9.001.507.009.678.17
B. Capital markets regulation8.424.177.009.004.83
F. Document review and drafting7.006.505.338.673.33
D. CVM administrative proceedings9.007.506.338.672.67
A. Core corporate law8.337.176.008.672.67
I. Applied regulatory questions8.506.837.679.002.17
E. Legal scholarship and case law9.428.337.339.332.08
G. Corporate document drafting7.256.175.337.332.00
H. Material fact and market notices7.837.176.678.672.00
J. General and cross-cutting8.587.337.008.671.67
Mean for categories B and C8.712.837.009.33
Mean for the eight categories excluding B and C8.247.136.468.63
Mean across all fifty prompts8.336.276.578.77

The cross-group differences vary substantially by prompt category. CVM case law (C) has the largest range (8.17 points), followed by Capital markets regulation (B) (4.83) and Document review and drafting (F) (3.33). In the other seven categories, the range does not exceed 2.67 points. Categories B and C therefore show the greatest differentiation among the comparison groups.

This pattern is particularly informative about the performance of the Brazilian legal platforms. In categories B and C, which contain the regulatory and case-law research prompts involving the CVM database, the mean score for Jus IA and Inspira is 5.88 points below that of the non-Brazilian general-purpose platforms (2.83 versus 8.71). Across the other eight categories, the gap narrows to 1.11 points (7.13 versus 8.24). The performance gap is therefore not uniform: it is substantially wider for tasks that require research in the CVM database.

The context in which these platforms were developed offers one possible explanation for this pattern. At the end of 2025, Brazil’s judiciary had 75.5 million pending cases. During that year, it recorded 40.9 million new cases, the highest annual total in the series dating back to 2009. The congestion rate was 62.6%. In an indicative comparison conducted by Brazil’s National Council of Justice (Conselho Nacional de Justiça, CNJ) using European data compiled by the European Commission for the Efficiency of Justice (CEPEJ), Brazil recorded 19.18 new cases per 100 inhabitants, compared with 4.44 across the European jurisdictions included in the comparison.5

Against that backdrop, it is plausible that Brazilian legal platforms would prioritize solutions designed for litigation. Decisions issued by the CVM’s Board of Commissioners, by contrast, are administrative acts published in the agency’s own repository of administrative decisions, separate from court systems. The difference in scale is also marked: in 2025, only 49 administrative sanctioning decisions were issued by the CVM.6

By design, this study did not include litigation prompts. The two Brazilian legal platforms were therefore not tested on the types of matters for which their databases might support stronger performance.

The Inspira results require an additional methodological qualification. Inspira offers a complementary tool for searching administrative case law, separate from its chat interface, with a dedicated filter for CVM decisions. In a spot check, Inspira’s chat did not answer this type of query and instead directed the user to the specialized search tool. Accordingly, that tool was used for the CVM precedent-search prompts. The evaluator later found, however, that the tool accepts only keyword queries and returned no results when the prompts were entered in full. To preserve standardization and comparability across platforms, the prompts were not reformulated as keyword searches; instead, the full prompts submitted to the other seven platforms were retained. The category result therefore reflects the interaction between the study protocol and the query format required by the tool.

Finally, among the four comparison groups in Table 7, Harvey had the highest mean scores in the two categories most dependent on Brazilian sources: capital markets regulation and CVM case law. This does not mean that Harvey led either category at the individual-platform level; Table 6 shows that ChatGPT scored slightly higher in both. Even so, Harvey’s strong performance is consistent with the hypothesis that the Knowledge Sources: Brazil filter contributed to its results.

3.4 Performance by dimension

Reporting performance at the axis level does not show which of the three dimensions within the Answer axis account for lower scores. Table 8 reports the mean score for each dimension on the original 0-to-2 scale.

Figure 3
Legal Accuracy and Form and Style, by platform
Raw 0-to-2 scale. The distance between the two dots measures how far an answer’s form runs ahead of its content.
Legal AccuracyForm and Style
0.81.01.21.41.61.82.0Maritaca+0.72Jus IA+0.34Gemini+0.20Inspira+0.20Harvey+0.18Copilot+0.08Claude+0.02ChatGPT+0.00Δ
Show tableHide table

Table 8. Mean scores by dimension on the original 0-to-2 scale. Legal Accuracy, Completeness, and Form and Style comprise the Answer axis; Source Reliability constitutes the Source axis.

PlatformLegal AccuracyCompletenessForm and StyleSource ReliabilityForm and Style –
Legal Accuracy
ChatGPT1.801.721.801.900.00
Harvey1.761.561.941.94+0.18
Claude1.761.641.781.68+0.02
Copilot1.721.461.801.80+0.08
Gemini1.521.281.721.34+0.20
Jus IA1.281.001.621.18+0.34
Inspira1.260.901.461.14+0.20
Maritaca1.021.181.741.20+0.72

The final column shows the difference between each platform’s mean scores for Form and Style and Legal Accuracy, calculated as Form and Style minus Legal Accuracy. Among the three platforms with the highest mean Answer scores, this gap was small: 0.00 for ChatGPT, +0.18 for Harvey, and +0.02 for Claude. Maritaca, by contrast, had the largest gap (+0.72), reflecting a relatively high mean score for Form and Style (1.74) and the lowest mean score for Legal Accuracy (1.02). This pattern indicates that polished presentation may coexist with weaker legal accuracy and therefore warrants careful substantive review even when an answer appears ready for use.

The most notable pattern in Table 8, however, concerns Completeness. No platform reaches a mean Completeness score of 1.75, making it the only dimension in which even the highest-performing platforms remain clearly below the maximum score of 2. The distribution of the 400 evaluations reinforces this pattern:

Figure 4
Distribution of scores in each dimension
400 answer evaluations in the main sample.
Legal Accuracy7.20%34.00%58.80%Completeness8.00%49.80%42.20%Form and Style20.80%76.20%Source Reliability37.25%57.50%0%25%50%75%100%
Show tableHide table

Table 9. Distribution of scores by dimension across the 400 answer evaluations in the main sample. Each cell reports the count and corresponding percentage.

DimensionScore 0Score 1Score 2
Legal Accuracy29 (7.20%)136 (34.00%)235 (58.80%)
Completeness32 (8.00%)199 (49.80%)169 (42.20%)
Form and Style12 (3.00%)83 (20.80%)305 (76.20%)
Source Reliability21 (5.25%)149 (37.25%)230 (57.50%)

Nearly half of the study’s answers received the intermediate Completeness score of 1, because they covered the essentials but left out at least one relevant secondary element. The practical implication is that the required review is less about verifying what the answer says and more about identifying what it omits. This type of review is harder to delegate because an answer that covers the essentials may not be readily recognizable as incomplete.

3.5 Score dispersion and unanswered prompts

A mean score alone does not show how performance varies across the tested tasks. The score dispersion shows how frequently each platform produced high- and low-scoring answers across the fifty prompts.

Figure 5
Frequency of high- and low-scoring answers
Share of each platform’s fifty answers above 8.33 and at or below 5.00 on the Answer axis. Intermediate bands are not shown.
40%20%0%20%40%60%80%ChatGPT86%Harvey86%2%Claude90%4%Copilot78%8%Gemini58%12%Maritaca30%38%Jus IA34%26%Inspira26%28%
Show tableHide table

Table 10. Dispersion of the Answer axis score across each platform’s fifty evaluations.

PlatformAnswerStd. deviationLowest scoreAnswers ≥ 8.33Answers ≤ 5.00Unanswered prompts
ChatGPT8.871.186.6786%0%0
Harvey8.771.245.0086%2%0
Claude8.631.660.0090%4%1
Copilot8.301.435.0078%8%0
Gemini7.532.170.0058%12%2
Maritaca6.571.753.3330%38%0
Jus IA6.502.340.0034%26%3
Inspira6.032.540.0026%28%5

ChatGPT had the lowest score dispersion across the fifty prompts, with a standard deviation of 1.18 and no Answer score below 6.67. Claude had the highest proportion of high-scoring answers (90% scored 8.33 or higher) but also had one unanswered prompt, resulting in a minimum score of 0.00.

Maritaca displayed a distinct pattern in the main sample: it had no unanswered prompt and an intermediate standard deviation (1.75), yet it had the largest proportion of answers scoring 5.00 or lower (38%). The fact that every prompt received an answer therefore did not imply consistently adequate performance. In this sample, the principal concern was the frequency of low-scoring outputs rather than unanswered prompts.

In the main sample, eleven prompts were unanswered. Of these, eight were concentrated in two platforms: Inspira accounted for five cases and Jus IA for three. All five Inspira cases and two of the Jus IA cases occurred in category C. The remaining three cases were distributed across Gemini (two cases) and Claude (one case). Section 3.3 explains the methodological issue with Inspira’s search tool and its impact on the results.

In the deep research track, the same prompt went unanswered by both Claude and Jus IA. The prompt relied on a legal rule that neither platform could verify.

3.6 Failure modes

Of the 436 evaluations (400 in the main sample and 36 in the deep research sample), 365 were accompanied by qualitative comments. The six most frequently identified failure modes are presented below in descending order of frequency and account for 263 occurrences. The evaluator’s comments quoted below were translated from Portuguese.

Mode 1 — Incomplete answer missing a relevant secondary element (142 occurrences)

This was the most frequent failure mode and the hardest to detect during review. The answer was correct in what it stated but omitted at least one relevant secondary element, which varied by prompt category. Recurring examples included the omission of an applicable statutory circumstance, a relevant qualification or exception, or an element required in the document being drafted.

“It failed to mention the reserves admitted by law and their limitations; the discussion was imprecisely limited to the companies referred to in items I and II of § 3; and it failed to cite at least one specific proceeding.” (prompt 25, mandatory dividend)

Why it matters: this is the error that survives superficial review. Checking whether what is written is right is quick; noticing what should be there and is not requires precisely the knowledge one meant to delegate.

Mode 2 — Revoked or outdated rule (31 occurrences)

A citation to a revoked statute or provision. The prompt bank was designed to expose this behavior by including prompts whose answer keys were materially affected by recent legal changes.

“Outdated rule and imprecise definitions — it incorrectly makes shared control conditional on a shareholders’ agreement.” (prompt 1) · “Rule revoked by CVM Resolution 160.” (prompt 30)

Why it matters: This is the most dangerous type of error for users without subject-matter expertise because the answer is internally coherent and the citation appears verifiable.

Mode 3 — Excessive length or mismatch with the requested document type (31 occurrences)

The output is substantively correct but does not conform to the form required for the requested document. This was the predominant failure mode in the drafting categories.

“Correct and complete answer, but verbose and excessively long — inconsistent with prevailing market practice, repeating information already contained in the Management Proposal (Proposta da Administração).” (prompt 29) · “The draft is lengthy and includes information not ordinarily presented in this type of document, contradicting art. 57 of CVM Resolution 160, which describes the notice to the market as a summary notice.” (prompt 30)

Why it matters: It reflects the gap between an answer and a usable work product.

Mode 4 — Generic, partial, or unverifiable source (30 occurrences)

A correct statement without grounding, a law or regulation cited without identification of the specific provision, or a reference that cannot be verified against the cited source.

“Generic statement with no sources; incomplete answer and conclusion: it mentioned neither the statutory reserves nor the CVM case law expressly requested in the prompt.” (prompt 25) · “Conclusion based on unverifiable legal scholarship and contrary to the position of the CVM’s Board of Commissioners.” (prompt 12)

Why it matters: It distinguishes an answer that saves time from one that merely shifts the work to the verification stage.

Mode 5 — Incorrect provision (16 occurrences)

An error in the cited article, paragraph, or item, even though the substantive content is otherwise correct.

“Incorrect article (correct: art. 37); it states that preferred shares do not vote, but they may vote if the bylaws so provide.” (prompt 5) · “There is no §4 in art. 26.” (prompt 30)

Why it matters: This type of error can easily pass unnoticed from the draft into the final document and may undermine the lawyer’s credibility.

Mode 6 — Unanswered prompts (13 occurrences)

An explicit refusal, absence of any result, or a technical processing failure.

“The search interface (Adjudicating Body filter = CVM) returned no results; no answer was produced.” (prompts 11 to 15) · “The platform did not process the two indenture templates because of its 100-image-page limit.” (prompt 27)

Why it matters: An unanswered prompt means that professional time was spent without producing a usable result. Under the study’s criteria, an unanswered prompt is assigned a score of zero on every dimension and remains included in the mean scores.

A single answer can present more than one failure mode; the occurrences are therefore not mutually exclusive.

3.7 Deep research — a separate track

Six prompts from the bank were also run in deep research mode on each platform that offered this feature as of the study’s cutoff date, totaling 36 evaluations. The outputs were scored under the same criteria described in section 2.5, using blinded scoring sheets and preserving anonymization. The results were analyzed as a separate track and excluded from the main-sample means reported in section 3.1 because the purpose was to compare standard and deep research modes within each platform.

Figure 6
Effect of deep research mode on answer quality
Difference on the Answer axis between deep research mode and standard mode, on the same six prompts. Right of the axis, deep research improved; left, it worsened.
−2.0−1.5−1.0−0.50.0+0.5+1.0+1.5+2.0Gemini+1.94Maritaca+0.83Harvey−0.28Jus IA−0.83Claude−1.39ChatGPT−1.67
Show tableHide table

Table 11. Mean Answer and Source scores in deep research and standard modes for the same six prompts. The two axes are reported separately.

PlatformAnswerSource
Deep researchStandard
mode
ΔDeep researchStandard
mode
Δ
Gemini8.616.67+1.948.335.00+3.33
Maritaca7.506.67+0.836.675.83+0.83
Harvey9.179.44−0.289.179.170.00
Jus IA4.175.00−0.833.333.330.00
Claude8.069.44−1.397.509.17−1.67
ChatGPT8.069.72−1.6710.009.17+0.83

The results indicate that deep research mode did not consistently improve performance. On the Answer axis, mean scores were higher in deep research mode for Gemini (+1.94) and Maritaca (+0.83), differed little for Harvey (−0.28), and were lower for Jus IA (−0.83), Claude (−1.39), and ChatGPT (−1.67). Differences on the Source axis also varied across platforms.

Taken together, these results suggest that the usefulness of deep research depends on both the platform and the task; they do not support a general conclusion that deep research improves performance. The largest observed gain was Gemini’s Source score, which increased from 5.00 to 8.33. Because the comparison covered only a six-prompt subset for each platform, the findings should be interpreted as limited to that subset.

4Practical guide

This section applies the quantitative and qualitative findings to day-to-day platform selection in legal practice. It does not replace a lawyer’s judgment in any particular matter and assumes that every output, regardless of platform, will undergo technical review.

4.1 The four decision factors, considered together

Section 2.1 identified four key factors in a lawyer’s choice of platform: cost of access, answer quality, nature of the legal work, and confidentiality and data governance. This study directly measures answer quality. Real decisions, however, are not made on a single factor, which is why the scores presented in this report should not be treated as a standalone recommendation. The remaining three factors are addressed below to provide an integrated assessment.

On cost of access, the publicly available access terms published by the vendors as of August 2026 are summarized below.

Table 12. Publicly available access terms. Pricing information retrieved from vendors’ official websites in August 2026 7.

PlatformAccess modelFree or trial accessPlan/configuration tested1
ChatGPTIndividual subscription, self-serviceYes, with usage and feature limitsPlus plan; US$20/month
ClaudeIndividual subscription, self-serviceYes, with limited usePro plan; US$20/month
GeminiIndividual subscription, self-serviceYes, with lower limits than the paid plansGoogle AI Plus, included with a paid 400 GB Google One subscription; regular price R$24.99/month
CopilotMicrosoft corporate licenseYes, at no extra cost for qualifying corporate accountsCorporate license; contract-specific pricing not disclosed
HarveyAccess under a corporate agreementNoCorporate agreement; pricing not publicly disclosed
MaritacaFree chat; optional paid subscriptionYes, 10 messages per dayFree tier; paid plan R$59.90/month
Jus IAIndividual subscription, self-serviceYes, with limited trial accessProfessional plan; regular price R$108.90/month
InspiraIndividual subscription, self-serviceThree-day trial onlyIndividual plan; regular price R$248.00/month

1 Pricing reflects the terms available on the date accessed and may vary by location, taxes, promotions, and negotiated terms. The model versions included with each subscription may also have changed since testing; current access terms should therefore not be treated as the setup actually evaluated in the study.

Price transparency varies across products. The Brazilian platforms evaluated publish prices in Brazilian reais for some plans. OpenAI (ChatGPT) and Anthropic (Claude) publish individual plan prices in U.S. dollars, with conversion to Brazilian reais, where applicable, shown at checkout. Microsoft publishes a public reference price per user for Microsoft 365 Copilot, although terms under corporate agreements may vary. Harvey, ChatGPT Enterprise, and certain corporate arrangements have no public contract price, so the cost comparison remains partial and may not reflect negotiated terms.

The relevance of the nature of the legal work to platform selection should be assessed at two levels: (i) at the macro level, the broader practice context (the best-performing platform for typical litigation matters may differ from the best one for capital markets advisory work); and (ii) at the micro level, the specific tasks within each matter (within a single practice area, a platform may perform differently at locating a rule, finding a precedent, explaining a scholarly interpretation, reviewing documents, or drafting). The "nature of the legal work" factor should therefore combine the broader legal context with the specific tasks the platform will be asked to perform. The study’s results show that aggregate performance can mask these differences.

Within the scope of the study, Table 13 summarizes what the findings imply for platform selection by nature of the legal work and task.

Table 13. What the results imply, by nature of the legal work and task.

Nature of the legal work — macro levelTasks evaluated —
micro level
What it means for platform selection
Advisory work and legal researchLocating rules; explaining legal concepts or interpretations in legal scholarship; conducting exploratory researchSource reliability, currency, and traceability should be prioritized. Harvey and ChatGPT recorded the highest mean scores on the Source axis, but the occurrence of citations to superseded legal rules confirms that independent verification remains necessary. Deep research mode showed no consistent advantage.
Capital markets regulatory workLocating CVM precedents; drafting regulatory documents such as material facts, notices to the market, and other market announcementsThe high dispersion observed in CVM precedent research indicates that coverage of this specific database should be verified before selecting a platform. Results for regulatory drafting were more consistent and showed no decisive advantage for any platform.
Corporate and contract workDrafting corporate acts and other instruments; reviewing attached documents and producing a new draftThe ability to interpret the documents provided, comply with formal requirements, and return an editable file may be as important as substantive quality. Professional review remains necessary, especially given drafts that were substantively correct but inconsistent with prevailing market practice.
Other practice
areas
Not evaluatedThe results do not support platform recommendations for practices outside the study’s scope. This limitation is particularly relevant for litigation, given its weight in the Brazilian legal market: tasks such as drafting court filings, researching judicial case law, and litigation management were not tested.

Finally, on confidentiality and data governance, the analysis should focus on the contracting arrangement actually used, not just the platform. According to public information provided by the vendors, corporate plans tend to offer more explicit commitments and broader controls than individual or free plans. Harvey, for example, publishes its standard contractual terms, which include protections concerning data use and retention.8 General-purpose enterprise offerings, including ChatGPT Enterprise and Claude for Work, likewise provide specific protections for business data, although those were not the plans evaluated in this study.9 The distinction is not absolute, however: Maritaca states that it does not use user conversations for training, including on the free tier.10 As these aspects were neither tested nor audited, the results do not support a platform-by-platform comparison on this factor.

Considering the four factors together, the findings point to different solutions depending on the context of use. Within the evaluated scope, Harvey stands out as a consistent option for large law firms handling advisory, corporate, or contract work. It also showed low score dispersion and led the Source axis, performing strongly in the two research categories most dependent on Brazilian sources.

For solo practitioners and smaller firms seeking to reduce the frequency of low-scoring outputs without substantially increasing costs, ChatGPT and Claude delivered performance close to Harvey’s and are each available through an individual subscription priced at US$20 per month. Before professional use, however, the suitability of those plans should be assessed against the applicable confidentiality and data-governance requirements.

Maritaca offers a free tier, but its performance was uneven: Legal Accuracy was its weakest dimension, although it scored well on Form and Style. Jus IA and Inspira, despite being positioned as specialized legal tools in the Brazilian market, showed comparatively high variability and did not consistently outperform the general-purpose platforms. Accordingly, differences in price, interface design, or degree of legal specialization do not eliminate the need for rigorous technical review.

These observations are limited to the practices and tasks evaluated and should not be extrapolated to other contexts.

5Conclusion

This study compared eight platforms across fifty prompts involving specialized tasks in Brazilian law. The results do not establish that any one platform is superior overall. On the Answer axis, ChatGPT, Harvey, and Claude had similar mean scores, and the paired analysis did not yield sufficient statistical evidence of a consistent advantage for any one of them. That absence of evidence, however, does not establish equivalence. The descriptive leader also varied depending on the axis examined and on whether the composite index was used. For professional use, the findings help identify performance patterns, recurring failure modes, and the likely level of review required within the tested scope. They do not, on their own, measure productivity gains or establish the extent to which a task can be delegated.

Against that background, the main concern identified was completeness. The most common failure was not the presentation of false information but the omission of legally relevant elements. This is a less visible risk: an answer can be correct in what it states and still be insufficient. Because this deficiency is often detectable only by someone with subject-matter expertise, any productivity gains depend on technical review by a lawyer — not only to verify the content provided, but also to recognize what has been omitted.

These conclusions should be read in light of the limitations described in section 6. They describe only the performance observed on the specific tasks, models, and setups tested and should not be read as definitive assessments of the platforms or as guarantees of performance in other contexts.

6Limitations

Applying a common protocol and uniform evaluation criteria made it possible to compare the platforms on a consistent basis. That standardization is what makes the analysis useful, but it also limits how the results can be interpreted, as set out below:

  • Scope and representativeness. The sample is limited to fifty prompts covering capital markets, corporate law, and corporate governance tasks. The selection of eight platforms does not span the entire market. Each prompt-platform combination was run once, so the study does not capture the variation that could occur across successive runs. Category results, based on five prompts each, and deep research results, based on six prompts per platform, should be interpreted only with respect to the tested set.
  • Scoring of the answers. Scoring was done by a single expert, with no independent second scorer or inter-rater agreement measure. Platform identities were masked, but elements such as style, formatting, and native file formats may have allowed indirect recognition.
  • Configuration, interaction, and timing. The results reflect the models, features, and interfaces available in June 2026, used through each platform’s specific flows. The protocol adopted a single run from the original prompt, with no successive rounds of clarification or refinement; it therefore measures the initial answer produced under standardized conditions, not necessarily the best result an experienced user could reach through iterative interaction. In Inspira’s case, the verbatim-prompt protocol also interacted with the platform’s keyword-based search format. Later updates to models, features, or interfaces may change the observed performance.
  • Dimensions not evaluated. The study includes no human baseline and does not measure execution or review time. Its results therefore do not directly support estimates of productivity gains or of how far tasks can be delegated. Security, privacy, and confidentiality were likewise neither tested nor audited; the references in section 4.1 merely summarize vendors' public statements and do not replace an analysis of the applicable plan, contract, and controls. Integration with workflows, ease of use, total cost of ownership, and tasks from other practices — including litigation — were also outside the evaluation.

Within these limits, the study offers a useful comparative baseline for identifying trends, shaping selection criteria, and guiding further checks. The results should be used as evidence about the specific scope evaluated — not as a definitive ranking of the platforms or a guarantee of performance in other contexts.

The prompt bank, the anonymized outputs, the scoring sheets, and the full scoring spreadsheet can be made available in full for auditing or methodological discussion, upon request to the author.

7References

Almeida, T. S., Abonizio, H., Nogueira, R., & Pires, R. (2024). Sabiá-2: A new generation of Portuguese large language models [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2403.09887

Carvalho Neto, P. B. de. (2026). LegalBench-BR: A benchmark for evaluating large language models on Brazilian legal decision classification [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2604.18878

Delfino, P., Cuconato, B., Haeusler, E. H., & Rademaker, A. (2017). Passing the Brazilian OAB exam: Data preparation and some experiments [Preprint]. arXiv. https://doi.org/10.48550/arXiv.1712.05128

Guha, N., Nyarko, J., Ho, D. E., Ré, C., Chilton, A., Narayana, A., Chohlas-Wood, A., Peters, A., Waldon, B., Rockmore, D. N., Zambrano, D., Talisman, D., Hoque, E., Surani, F., Fagan, F., Sarfaty, G., Dickinson, G. M., Porat, H., Hegland, J., … Li, Z. (2023). LegalBench: A collaboratively built benchmark for measuring legal reasoning in large language models [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2308.11462

Guo, A., & Rodrigues, A. (2025). Putting AI to the Test in Real-World Legal Work: An AI evaluation report for in-house counsel. Retrieved from https://www.legalbenchmarks.ai/research/phase-1-research

HazyResearch. (n.d.). LegalBench [Benchmark website]. Stanford University. Retrieved August 17, 2026, from https://hazyresearch.stanford.edu/legalbench/

HazyResearch. (n.d.). LegalBench [Source code]. GitHub. Retrieved August 17, 2026, from https://github.com/HazyResearch/legalbench

Laitz, T., Almeida, T. S., Abonizio, H., Malaquias Junior, R., Bonás, G. K., Piau, M., Larcher, C., Pires, R., & Nogueira, R. (2026). Sabiá-4 technical report [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2603.10213

Malaquias Junior, R., Pires, R., Romero, R., & Nogueira, R. (2024). Juru: Legal Brazilian large language model from reputable sources [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2403.18140

Pacheco, E. C. B., Suriani, F. M., & Ribeiro, R. (2025). Rabula: A benchmark for evaluating LLMs in Brazilian legal tasks. In Proceedings of the First Argument Mining and Empirical Legal Research Workshop (AMELR 2025) (CEUR Workshop Proceedings, Vol. 4089, Paper 6). https://ceur-ws.org/Vol-4089/paper6.pdf

Pires, R., Malaquias Junior, R., & Nogueira, R. (2025). Automatic legal writing evaluation of LLMs [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2504.21202

Pires, R., Almeida, T. S., Larcher Junior, C., Bonás, G., Abonizio, H., Piau, M., Malaquias Junior, R., Laitz, T., & Nogueira, R. (2026). Magis-Bench: Evaluating LLMs on magistrate-level legal tasks [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2605.08437

Vals AI. (2025, February 27). Vals Legal AI Report. https://www.vals.ai/industry-reports/vlair-2-27-25

8How to cite this report

When citing this report, use the format required by the publication or institution. The models below refer to this English edition; when citing the Portuguese edition (https://legalaibench-brazil.netlify.app/), use that edition’s title and address.

ABNT (NBR 6023 — Brazilian standard)

MINOTTO, Natalia. LegalAI Bench Brazil: a comparative evaluation of legal AI on Brazilian law. [S. l.], 2026. Disponível em: https://legalaibench-brazil.netlify.app/en/. Acesso em: [data de acesso].

APA (7th edition)

Minotto, N. (2026). LegalAI Bench Brazil: A comparative evaluation of legal AI on Brazilian law [Independent report]. https://legalaibench-brazil.netlify.app/en/

Bluebook (21st edition)

Natalia Minotto, LegalAI Bench Brazil: A Comparative Evaluation of Legal AI on Brazilian Law (2026), https://legalaibench-brazil.netlify.app/en/.

BibTeX

@misc{minotto2026legalaibench,
author = {Minotto, Natalia},
title = {LegalAI Bench Brazil: A comparative evaluation of legal AI on Brazilian law},
year = {2026},
url = {https://legalaibench-brazil.netlify.app/en/},
note = {Bilingual report (PT/EN)}
}

Notes

  1. The public Brazilian benchmarks identified as of the cutoff date focus on tasks derived from legal exams or on the classification of judicial decisions. No independent public study was identified comparing Brazilian and non-Brazilian legal platforms on prompts drawn from the professional practice of a lawyer practicing Brazilian law. The international benchmarks identified are predominantly in English and do not jointly evaluate Brazilian law and Brazilian legal platforms.
  2. Harvey Team. (2025, May 13). Expanding Harvey’s model offerings. https://www.harvey.ai/blog/expanding-harveys-model-offerings; Grupen, N. (2026, March 10). Why Harvey is multi-model by design. Harvey. https://www.harvey.ai/blog/why-harvey-is-multi-model-by-design.
  3. Harvey Team. (2024, August 29). Introducing BigLaw Bench. https://www.harvey.ai/blog/introducing-biglaw-bench. This is a benchmark produced by the evaluated vendor itself.
  4. A 95% confidence interval (CI) summarizes the uncertainty surrounding the mean difference estimated by the paired bootstrap procedure applied to the fifty prompts. When the interval includes both negative and positive values, the results are compatible, under that procedure, with an advantage for either platform or with no difference. This does not establish equivalence or support generalization beyond the tested sample.
  5. Conselho Nacional de Justiça. (2026). Justiça em números 2026 (ano-base 2025). https://www.cnj.jus.br/wp-content/uploads/2026/06/justica-em-numeros-2026.pdf. The CNJ’s release does not detail how Brazilian legal proceedings’ categories were matched to those used by the European Commission for the Efficiency of Justice (CEPEJ), whose evaluation cycles do not cover Brazil. For the international comparison, the CNJ added up all levels of jurisdiction and all types of proceedings in the CEPEJ data. The report itself cautions that the 40.9 million new cases may count the same proceeding at different stages or instances within the same year; counting only original actions, merits proceedings, and enforcement of extrajudicial instruments, the total would be 24.7 million.
  6. Comissão de Valores Mobiliários. (n.d.). Pesquisa avançada: Jurisprudência CVM. Retrieved August 12, 2026, from https://www.gov.br/cvm/pt-br/assuntos/jurisprudencia; Comissão de Valores Mobiliários. (2026). Relatório de atividade sancionadora CVM 2025: 4º trimestre — versão resumida (pp. 15–16). https://www.gov.br/cvm/pt-br/centrais-de-conteudo/publicacoes/relatorios/relatorio-de-atividade-sancionadora/relatorio-de-atividade-sancionadora-cvm-2025-4o-trimestre-versao-resumida.pdf/view. The report records 49 administrative sanctioning proceedings decided by the Board of Commissioners in 2025 — 43 under the ordinary procedure and six under the simplified procedure.
  7. Sources consulted in August 2026: OpenAI. (n.d.). ChatGPT pricing. https://chatgpt.com/pricing; Anthropic. (n.d.). Plans & pricing. https://claude.com/pricing; Google. (n.d.). Google AI subscriptions. https://gemini.google/br/subscriptions; Microsoft. (n.d.). Microsoft 365 Copilot — pricing. https://www.microsoft.com/pt-br/microsoft-365-copilot/pricing; Maritaca AI. (n.d.). Planos. https://www.maritaca.ai/planos; Jusbrasil. (n.d.). Jus IA — Planos e preços. https://ia.jusbrasil.com.br/planos; Inspira. (n.d.). Planos. https://www.inspire-se.co/; Harvey. (n.d.). Harvey. https://www.harvey.ai/
  8. Harvey AI Corporation. (n.d.). Secure legal AI for the most sensitive matters. Retrieved August 16, 2026, from https://www.harvey.ai/security; Harvey AI Corporation. (n.d.). Platform Agreement. Retrieved August 16, 2026, from https://www.harvey.ai/legal/platform-agreement
  9. OpenAI. (n.d.). ChatGPT Work admin FAQ. Retrieved August 16, 2026, from https://learn.chatgpt.com/docs/enterprise/work-admin-faq; OpenAI. (n.d.). Pricing. Retrieved August 16, 2026, from https://learn.chatgpt.com/docs/pricing; Anthropic. (n.d.). Is my data used for model training? — Commercial products. Retrieved August 16, 2026, from https://privacy.claude.com/en/articles/7996868-is-my-data-used-for-model-training. OpenAI states that ChatGPT Enterprise does not use business data for training by default and offers access, retention, and data-residency controls; Anthropic states that, by default, it does not use inputs and outputs from commercial products, such as Claude for Work, to train its models.
  10. Maritaca AI. (n.d.). Inteligência artificial para o Brasil. Retrieved August 16, 2026, from https://www.maritaca.ai/. The company states that chatbot conversations are stored for later access by the user but are not used for training, whether the plan is paid or free.