APIs de busca e captura web: como funcionam e o que $0.01 compra
Conteúdo
- Por que os modelos precisam de busca e captura web?
- Como a busca web no servidor realmente funciona?
- Quanto custa de fato uma busca?
- Quais são os três controles do custo de tokens?
- O que acontece com os resultados da busca no turno seguinte?
- Quanto Anthropic e OpenAI cobram, e onde suas ferramentas funcionam?
- Perguntas frequentes
Hoje, todas as principais ferramentas de busca web no servidor cobram a mesma taxa: $0.01 por busca. Esse é o item menos relevante da conta. Nas buscas que medimos, cada requisição recebeu de 1,500 a 3,100 tokens de resultados, cobrados pela tarifa do modelo escolhido. O comportamento no turno seguinte depende de uma diferença de protocolo que poucas equipes analisam: o endpoint mantém as evidências da busca no contexto ou as descarta silenciosamente, levando o modelo a pesquisar novamente por sua conta. Medimos o synthorai:web_search e o synthorai:web_fetch da Synthorai em quatro famílias de modelos e comparamos os resultados com os preços publicados pela Anthropic e pela OpenAI para suas próprias buscas hospedadas.
TL;DR
- A taxa por busca é de $0.01 na Synthorai, Anthropic e OpenAI; os registros de cobrança discriminam o valor como $0.0100.
- Uma busca injeta 1,500-3,100 tokens de resultados, cobrados pela tarifa de entrada do modelo. Em modelos baratos, a taxa domina o custo; nos premium, os tokens podem representar metade da conta.
max_usesé um limite, não uma meta: mesmo com 10 usos permitidos, o modelo parou em 3; as taxas crescem conforme o número de buscas executadas.- O segundo turno varia por endpoint:
/v1/messagesreapresenta os resultados (≈3,900 tokens, sem nova taxa);/v1/chat/completionsos descarta, portanto um follow-up que precise das evidências faz outra busca.
Por que os modelos precisam de busca e captura web?
Porque o conhecimento de um modelo termina na data de corte do treinamento, mas a maioria das perguntas em produção não. Preços, notas de versão, taxas de câmbio, resultados esportivos e o conteúdo de uma URL que o usuário acabou de enviar não estão nos pesos. Responder mesmo assim, com confiança, é como fatos “atuais” inventados chegam aos usuários. A busca web resolve a descoberta, quando o modelo não sabe onde está a resposta. A captura web resolve a leitura, quando ele conhece a página exata e precisa do conteúdo. É possível implementar as duas com uma API de busca, um scraper e um loop de tool calling, e muitas equipes fazem isso. As versões executadas no servidor existem porque esse loop é apenas infraestrutura indiferenciada. Ao executá-lo dentro do provedor, eliminam-se round-trips, código de parsing e carga operacional, por uma taxa que acabou se tornando igual em todos os serviços.
Como a busca web no servidor realmente funciona?
O loop inteiro acontece dentro de uma única requisição à API. Esse é o ponto central. Com ferramentas executadas pelo cliente, o modelo pede ao seu código que faça uma busca, o código devolve os resultados, e cada etapa reenvia a conversa. Uma ferramenta de servidor elimina essa intermediação: você declara {"type": "synthorai:web_search"} em tools, o modelo produz uma consulta, o gateway a encaminha a um provedor de busca dedicado, injeta os resultados no contexto e o modelo os lê para responder. Ele também pode pesquisar novamente, até o limite de max_uses. Entra uma requisição e sai uma resposta, já com citações e cobrança.
Basta uma linha em uma requisição comum, sem código de loop nem callbacks:
curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer $SYNTHORAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash-0731",
"messages": [{"role": "user", "content": "What is one AI news headline from this week? Name the source."}],
"tools": [{"type": "synthorai:web_search", "max_uses": 1}]
}'
A captura web usa a mesma declaração, mas com outro tipo. Coloque a URL na mensagem e o gateway recuperará a página:
"messages": [{"role": "user", "content": "Fetch https://example.com/pricing and summarize the tiers."}],
"tools": [{"type": "synthorai:web_fetch", "max_uses": 1}]

O diagrama reproduz exatamente a requisição de busca acima, medida no deepseek-v4-flash-0731. O medidor registrou 2,059 tokens de entrada, sendo uma pergunta de 30 tokens mais cerca de 2,000 tokens de resultados injetados, 169 tokens de saída e custo total de $0.0104: $0.01 pela busca e aproximadamente $0.0004 pelos tokens. Foram apenas dois eventos de cobrança: a taxa quando a busca é executada e os tokens de resultados pela tarifa normal de entrada do modelo. A captura é cobrada da mesma forma, substituindo os snippets pelo conteúdo da página.
A declaração não custa nada: uma requisição que disponibiliza a ferramenta, mas não executa uma busca, não paga taxa. A ferramenta também funciona com qualquer modelo do catálogo. Essa é a diferença estrutural em relação às alternativas dos próprios fornecedores: a busca hospedada da Anthropic atende modelos Claude, a da OpenAI atende modelos OpenAI, enquanto uma ferramenta no nível do gateway atende qualquer modelo para o qual o tráfego seja roteado.
Quanto custa de fato uma busca?
A taxa é de $0.01, somada aos tokens. Conforme o modelo fica mais caro, muda o componente dominante da conta. Executamos três vezes a mesma pergunta de notícias com uma busca em quatro famílias de modelos. Calculamos as tarifas exatas de tokens de cada modelo usando baselines sem ferramentas e tratamos a taxa como o valor residual:
| Modelo | Tokens de resultados injetados | Custo dos tokens | Taxa residual | Participação da taxa no total |
|---|---|---|---|---|
| deepseek-v4-flash-0731 | ≈2,020 | $0.0003 | $0.0101 | 97% |
| gpt-5.6-luna | ≈1,500 | $0.002 | $0.0104 | 83% |
| qwen3.8-max | ≈1,780-2,060 | $0.005-0.012 | $0.0112-0.0116 | 49-68% |
| claude-sonnet-5 | ≈2,700-3,090 | $0.008-0.010 | $0.0118-0.0121 | 54-59% |
No modelo mais barato, a taxa de busca representa 97% da chamada. Nos modelos premium, os tokens injetados consomem metade da conta. A taxa não foi apenas inferida: nossos registros de cobrança discriminam a ferramenta em uma linha própria, com exatamente $0.0100 por chamada, além da contagem separada dos tokens injetados pela ferramenta. Em uma chamada real de captura, por exemplo, eles foram 3,454 dos 3,836 tokens de entrada. O custo total medido de uma busca ficou entre $0.010 e $0.012, dependendo do modelo. Use o topo dessa faixa no orçamento para evitar surpresas. Na prática, combinar busca no servidor com um modelo barato transforma a busca no produto e deixa o custo do modelo quase irrelevante.
Quais são os três controles do custo de tokens?
Quantidade de buscas, tamanho dos resultados e peso da página. O restante é arredondamento. Os três são mensuráveis, e dois estão diretamente sob seu controle.
Primeiro controle: quantas buscas são executadas. max_uses define um teto, não uma meta. Em uma pergunta sobre preços de cinco fornecedores, permitir 1, 2 e 3 buscas gerou cobranças de $0.0106, $0.0216 e $0.0319. As taxas cresceram linearmente, a $0.01 por busca realmente executada. Permitir 5 ou até 10 não mudou nada, pois o modelo parou sozinho após três buscas. A capacidade não utilizada é gratuita, assim como nos orçamentos de thinking que medimos em modelos de raciocínio. O padrão é 3, com limite máximo de 10. Portanto, sem configuração, o pior caso para uma pergunta que provoque muitas buscas é pagar três taxas e três cargas de resultados. Use max_uses: 1 em rotas que buscam um único fato.
Segundo controle: o tamanho dos resultados. O volume injetado acompanha a amplitude da pergunta, não o acaso. Em doze execuções com uma única busca no deepseek-v4-flash-0731:
| Tipo de consulta | Tokens de resultados injetados (3 execuções) |
|---|---|
| Fato isolado | 1,650 (variação máxima de um token) |
| Consulta em documentação técnica | 1,920-1,950 |
| Notícias atuais | 1,790-1,990 |
| Comparação entre várias entidades | 2,060-2,410 |
Perguntas específicas retornam conjuntos compactos; perguntas comparativas trazem resultados mais amplos, cerca de 45% maiores que os de um fato isolado. Para orçamento, 2,000 tokens por busca com uma margem de 20% cobre tudo o que observamos. Nas tarifas comuns de modelos, o custo dos tokens de uma busca fica entre um vigésimo e metade da taxa de $0.01.
Terceiro controle: o peso da página capturada. A taxa de captura não muda; o restante depende da página. Nossa escala, sempre com o mesmo modelo:
| Página | Tokens injetados | Custo total (DeepSeek) | Mesma captura em um modelo de $2/1M |
|---|---|---|---|
| Página mínima de teste | 209 | $0.0101 | $0.0104 |
| Homepage enxuta | 1,421 | $0.0103 | $0.0128 |
| Guia longo | 3,460 | $0.0106 | $0.0169 |
| Post com muitos dados | 5,196 | $0.0108 | $0.0204 |
| Artigo longo da Wikipedia | 27,380 | $0.0139 | $0.0648 |
Em um modelo barato, até o artigo da Wikipedia custa cerca de um centavo e meio. Ao fazer a mesma captura com um modelo de $2 por milhão, essa única página custa seis centavos e meio, cinco vezes a taxa. Outro dado útil para o orçamento: a mesma página produz contagens diferentes em cada família de modelos. O post com muitos dados consumiu 5,196 tokens no DeepSeek e 5,508 no qwen3.8-max, um acréscimo de 6% causado pelo tokenizer, em linha com nossas medições de densidade.
O que acontece com os resultados da busca no turno seguinte?
A diferença está no design dos dois protocolos de API e determina o custo do follow-up. No protocolo /v1/messages, um turno do assistente é uma lista de blocos de conteúdo. Por isso, a atividade da ferramenta de servidor faz parte do registro oficial do turno: a resposta contém server_tool_use, depois web_search_tool_result e, por fim, texto. O protocolo espera que esses blocos sejam reenviados no turno seguinte. As evidências seguem no contexto e são cobradas como tokens de entrada. Já o protocolo /v1/chat/completions representa a mensagem do assistente como uma única string de conteúdo, sem espaço para resultados de ferramentas de servidor. Os resultados injetados são absorvidos internamente; apenas a resposta visível entra no histórico, e as evidências desaparecem.
Executamos o mesmo par de busca e follow-up no claude-sonnet-5 pelas duas interfaces. Com /v1/messages, o follow-up consumiu 3,911 tokens de entrada e custou $0.0109, tudo em tokens. Não houve nova busca, pois o modelo ainda tinha os resultados. Com /v1/chat/completions, o follow-up custou $0.0204, mais que o replay, porque o modelo só tinha seu próprio resumo de uma linha e fez outra busca: uma nova taxa de $0.01 mais outra carga de resultados. Refazer a busca é uma escolha, não uma regra. Em uma execução anterior do mesmo tipo de follow-up com resultados absorvidos no deepseek-v4-flash-0731, o modelo respondeu usando apenas o resumo, com 460 tokens de entrada e custo de $0.00009. Quando os resultados são absorvidos, o custo do follow-up tem dois extremos: quase zero se o resumo bastar, ou taxa mais carga de resultados se o modelo decidir consultar a web novamente.
Nenhum endpoint é simplesmente mais barato; eles distribuem o custo de formas diferentes. O formato em blocos paga um custo previsível de tokens a cada turno e nunca compra novamente uma evidência que já possui. O formato absorvido aposta que os follow-ups não precisarão das evidências e paga outra taxa sempre que essa aposta falha. Conversas longas com follow-ups simples combinam com /v1/chat/completions. Agentes de pesquisa que examinam fontes combinam com /v1/messages, onde a disciplina de camadas do prompt cache também se aplica aos resultados mantidos no contexto, como a qualquer outro conteúdo volumoso.
Quanto Anthropic e OpenAI cobram, e onde suas ferramentas funcionam?
A comparação é simples: todos cobram $0.01 por busca; o restante depende da tarifa de tokens do modelo. A Anthropic cobra $10 por 1,000 buscas, com os resultados tratados como tokens de entrada. A captura web não tem taxa, apenas custo de tokens. A OpenAI também cobra $10 por 1,000 chamadas, mas o tratamento dos tokens varia conforme a categoria do modelo. A taxa já está padronizada; a variável é a tarifa de entrada do modelo aplicada aos 1,500-3,100 tokens injetados.
| Synthorai | Anthropic | OpenAI | |
|---|---|---|---|
| Taxa por busca | $0.01 | $0.01 | $0.01 |
| Tokens de resultados | tarifa de entrada do modelo | tarifa de entrada do modelo | tarifa de entrada do modelo (varia por categoria) |
| Taxa de captura web | $0.01 | nenhuma | - |
| Modelos atendidos | qualquer um do catálogo | apenas Claude | apenas OpenAI |
A principal diferença entre os três não aparece na tabela de preços, mas no local de execução das ferramentas. As ferramentas de servidor dos próprios fornecedores foram criadas para suas respectivas stacks de agentes e permanecem nas interfaces proprietárias. A documentação da Anthropic informa que a busca web não está disponível no Amazon Bedrock; apenas a busca básica chega ao Google Cloud, e o Microsoft Foundry exige uma implantação hospedada na Anthropic. A captura web não está disponível nem no Bedrock nem no Google Cloud. A busca da OpenAI está vinculada à Responses API. Ao mover a carga entre clouds ou famílias de modelos, a ferramenta proprietária fica para trás. É também por isso que um gateway não repassa essas ferramentas: elas não conseguem acompanhar o tráfego. Uma ferramenta implementada no gateway faz a escolha oposta: a mesma declaração continua funcionando após trocar de modelo ou plataforma.
Perguntas frequentes
Quanto custa a API de busca web por requisição?
$0.01 por busca executada, discriminado em uma linha própria nos registros de cobrança, mais os resultados injetados como tokens de entrada pela tarifa do modelo, entre 1,500-3,100 tokens por busca em nossos testes. Uma requisição que declara a ferramenta, mas não faz nenhuma busca, não paga taxa. Considere $0.010-0.012 por busca no custo total com modelos comuns. Em modelos muito baratos, a taxa representa 97% do total.
Os resultados da busca são cobrados novamente nos turnos seguintes?
Depende do endpoint. Em /v1/messages, os blocos de resultados são reenviados com o histórico, cerca de 3,900 tokens de entrada por turno em nossos testes, sem nova taxa. Em /v1/chat/completions, os resultados são absorvidos após o turno. O follow-up custa quase nada se o modelo responder com base no resumo, $0.00009 em uma execução, mas gera uma nova taxa e outra carga de resultados se ele pesquisar novamente, $0.0204 em outra. A documentação da busca proprietária da Anthropic define o replay como comportamento padrão; nesse caso, os resultados são cobrados novamente em todos os turnos.
Como limitar o gasto com busca web em uma requisição?
Use max_uses. É um limite rígido que o modelo não pode ultrapassar, com padrão 3 e máximo 10. As taxas crescem apenas com as buscas realmente executadas, e a capacidade não utilizada é gratuita. Em rotas que consultam um único fato, max_uses: 1 limita o pior caso a uma taxa e uma carga de resultados.
Quando usar captura web em vez de busca web?
Use captura quando já souber a URL e quiser a página inteira; use busca quando precisar descobrir a fonte. Pelo gateway, ambas custam $0.01 por uso, mas a captura injeta a página completa, de 209 tokens para uma página mínima até 27,380 para um artigo longo em nossa escala. A busca injeta snippets de várias fontes. Especificamente para pipelines de leitura e resumo com modelos Claude, a ferramenta de captura da própria Anthropic não tem taxa e sai mais barata.
Medições feitas em 2026-08-10 pelo gateway da Synthorai, usando synthorai:web_search e synthorai:web_fetch nos modelos deepseek-v4-flash-0731, gpt-5.6-luna, qwen3.8-max e claude-sonnet-5: as tarifas de tokens de cada modelo foram calculadas com baselines de dois pontos sem ferramentas; as taxas de busca foram obtidas como o resíduo entre o custo cobrado e o valor dos tokens (n=3 por modelo); também executamos uma escala de max_uses, uma varredura da carga de resultados por tipo de consulta (4 tipos x 3 execuções), testes de follow-up nos dois endpoints com perguntas idênticas e uma escala de captura com cinco páginas (três páginas próprias, uma página externa mínima e um artigo longo). As taxas foram confirmadas nos registros detalhados de cobrança, com linhas por chamada para a ferramenta e para os tokens injetados, não apenas inferidas a partir dos totais. Os valores da Anthropic e da OpenAI são os publicados na documentação de cada empresa na data da publicação. Os números do diagrama vêm de uma única chamada medida, sem edição. Taxas e comportamento podem mudar; confirme nos seus próprios registros de uso.