🎁 新用戶 免費註冊,送 10 次呼叫,最高 $1,免綁卡。
Web 搜尋與網頁擷取 API:運作方式與 $0.01 的實際成本

Web 搜尋與網頁擷取 API:運作方式與 $0.01 的實際成本

目錄
  1. 模型為什麼需要 Web 搜尋與網頁擷取?
  2. 伺服器端 Web 搜尋實際如何運作?
  3. 一次搜尋實際要花多少錢?
  4. 哪三個因素會決定 token 帳單?
  5. 下一輪對話會如何處理搜尋結果?
  6. Anthropic 與 OpenAI 如何收費?工具又在哪裡執行?
  7. 常見問題

目前主流的伺服器端 Web 搜尋工具,每次搜尋都收 $0.01,但這反而是帳單裡最不值得關注的數字。我們實測時,每次請求會附帶 1,500 到 3,100 個結果 token,並依路由模型的輸入費率計費。至於後續輪次會發生什麼事,取決於多數團隊很少檢查的協定設計:端點會把搜尋證據帶到下一輪,還是悄悄丟棄,讓模型再次搜尋並由你買單。我們在四個模型家族上測量 Synthorai 的 synthorai:web_searchsynthorai:web_fetch,再將結果與 Anthropic、OpenAI 公布的託管搜尋價格比較。

TL;DR

  • Synthorai、Anthropic 與 OpenAI 每次搜尋都收 $0.01;帳務紀錄會逐項列出 $0.0100。
  • 一次搜尋會注入 1,500-3,100 個結果 token,並依模型的輸入費率計費:便宜模型由搜尋費主導,高階模型則有多達一半成本來自 token。
  • max_uses 是上限,不是配額:即使允許 10 次,模型仍在 3 次後停止;費用只隨實際執行的搜尋次數增加。
  • 第二輪因端點而異:/v1/messages 會重播結果(約 3,900 個 token,不收新費用);/v1/chat/completions 會丟棄結果,因此需要證據的後續問題會重新搜尋。

模型為什麼需要 Web 搜尋與網頁擷取?

因為模型的知識停在訓練資料截止時間,但多數正式環境的問題不會。價格、版本資訊、匯率、賽事比分,以及使用者剛貼上的 URL 內容,都不在模型權重裡。模型若仍自信地作答,就會把捏造的「最新」資訊送到使用者面前。Web 搜尋用來找資料,適合模型不知道答案在哪裡的情況;網頁擷取則用來讀資料,適合模型已知道確切頁面、只需要取得內容的情況。你可以用搜尋 API、爬蟲和工具呼叫迴圈自行實作,許多團隊也確實這麼做。伺服器端版本之所以存在,是因為這套迴圈只是通用的基礎管線。放在供應商內部執行,可以省掉往返請求、解析程式碼和維運負擔,而且各家收費最後都一樣。

伺服器端 Web 搜尋實際如何運作?

整個迴圈都在單一 API 請求內執行,關鍵就在這裡。使用用戶端工具時,模型會要求你的程式搜尋,程式再把結果送回模型,每個步驟都要重新傳送對話內容。伺服器端工具則省去這層程式碼:你在 tools 中宣告 {"type": "synthorai:web_search"},模型產生查詢,閘道將查詢交給專用搜尋供應商,再把傳回的結果注入模型 context。模型讀取後作答,或在 max_uses 範圍內繼續搜尋。送入一個請求,取回一個回應,其中已包含引用資料與費用。

一般請求只要加一行即可使用,不需要迴圈程式碼,也不需要 callback:

curl https://synthorai.io/v1/chat/completions \
  -H "Authorization: Bearer $SYNTHORAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash-0731",
    "messages": [{"role": "user", "content": "What is one AI news headline from this week? Name the source."}],
    "tools": [{"type": "synthorai:web_search", "max_uses": 1}]
  }'

網頁擷取的宣告方式相同,只需改用另一個類型。把 URL 放入訊息,閘道就會擷取該頁面:

"messages": [{"role": "user", "content": "Fetch https://example.com/pricing and summarize the tiers."}],
"tools": [{"type": "synthorai:web_fetch", "max_uses": 1}]

三階段流程:請求免費宣告工具;伺服器端迴圈執行搜尋並注入結果,每次搜尋收 $0.01,結果則以輸入 token 計費;回應傳回答案與計量資料,顯示 2,059 個輸入 token、169 個輸出 token、一次搜尋、總費用 $0.0104

這張圖完整呈現我們在 deepseek-v4-flash-0731 上實測上述搜尋請求的流程。計量結果為 2,059 個輸入 token(30 個 token 的問題,加上約 2,000 個注入的結果 token)、169 個輸出 token,總費用 $0.0104:搜尋費 $0.01,token 約 $0.0004。帳單只有兩個項目:執行搜尋時收取的費用,以及依模型一般輸入費率計價的結果 token。網頁擷取的計費方式相同,只是以擷取的頁面取代搜尋摘要。

宣告工具本身不收費。若請求宣告工具但未執行搜尋,工具費為零。這項工具也適用於目錄中的所有模型,這是它與第一方方案在架構上的差別:Anthropic 的託管搜尋只服務 Claude 模型,OpenAI 的搜尋只服務 OpenAI 模型,而閘道層工具可服務任何路由目標。

一次搜尋實際要花多少錢?

固定費用是 $0.01,另加 token 費用。模型越貴,兩者的成本占比就越可能反轉。我們在四個模型家族上,各自執行三次相同的單次搜尋新聞問題。先從不使用工具的基準請求算出各模型的精確 token 費率,再將剩餘費用視為搜尋費:

模型注入的結果 tokenToken 成本剩餘費用費用占總成本比例
deepseek-v4-flash-0731約 2,020$0.0003$0.010197%
gpt-5.6-luna約 1,500$0.002$0.010483%
qwen3.8-max約 1,780-2,060$0.005-0.012$0.0112-0.011649-68%
claude-sonnet-5約 2,700-3,090$0.008-0.010$0.0118-0.012154-59%

在最便宜的模型上,搜尋費占整次呼叫的 97%;在高階模型上,注入的 token 會吃掉一半帳單。這筆費用並非推算值:我們的帳務紀錄會將工具費獨立列為每次正好 $0.0100,並另外列出工具注入的 token 數量。以一筆實際的擷取紀錄為例,3,836 個輸入 token 中有 3,454 個來自工具。實測單次搜尋的總費用會隨承載模型而落在 $0.010 到 $0.012 之間。預算若按區間上緣估算,就不會超出預期。實務上的結論是:伺服器端搜尋若搭配便宜模型,主要成本幾乎都在搜尋本身,模型費用接近於零。

哪三個因素會決定 token 帳單?

搜尋次數、結果長度與頁面大小。其他因素只影響尾數。這三項都能直接測量,其中兩項可由你直接設定。

第一項:實際執行幾次搜尋。 max_uses 是上限,不是目標。針對一個比較五家供應商價格的問題,允許 1、2、3 次搜尋時,費用分別為 $0.0106、$0.0216、$0.0319;實際每執行一次搜尋,就線性增加 $0.01。允許 5 次甚至 10 次也不會改變結果,因為模型自行在三次搜尋後停止。未使用的額度不收費,這與我們在推理模型上測量的思考預算完全相同。預設值為 3,硬上限為 10。因此在未設定的情況下,遇到偏好搜尋的問題,最差會產生三筆費用與三批結果載入。單一事實查詢應固定使用 max_uses: 1

第二項:結果有多長。 注入量取決於問題的廣度,不是隨機波動。我們在 deepseek-v4-flash-0731 上執行了十二次單次搜尋:

查詢類型注入的結果 token(3 次執行)
單一事實1,650(誤差不超過一個 token)
技術文件查詢1,920-1,950
最新新聞1,790-1,990
多項目比較2,060-2,410

範圍窄的問題會取得較精簡的結果集;比較型問題的結果更廣,約比單一事實查詢多 45%。編列預算時,可按每次搜尋 2,000 個 token,再加減 20% 估算,足以涵蓋我們觀察到的所有結果。以常見模型費率計算,單次搜尋的 token 成本約為 $0.01 固定費用的二十分之一到一半。

第三項:擷取頁面有多大。 擷取費固定不變,其餘成本由頁面決定。以下測試均使用同一個模型:

頁面注入的 token總費用(DeepSeek)使用 $2/1M 模型時的相同擷取
最小測試頁面209$0.0101$0.0104
精簡首頁1,421$0.0103$0.0128
長篇指南3,460$0.0106$0.0169
資料密集文章5,196$0.0108$0.0204
長篇 Wikipedia 條目27,380$0.0139$0.0648

使用便宜模型時,即使是 Wikipedia 長篇條目也只要約一分半美元;若將相同擷取路由到每百萬 token 收費 $2 的模型,單頁成本會升到六分半美元,是固定費用的五倍。預算還要考慮同一頁面在不同模型家族上的 token 數量並不相同。這篇資料密集文章在 DeepSeek 上為 5,196 個 token,在 qwen3.8-max 上則為 5,508 個,相差 6%,與我們測量的密度結果一致。

下一輪對話會如何處理搜尋結果?

兩種 API 協定本身的設計不同,會直接決定後續問題的費用。/v1/messages 協定將助理輪次定義為 content block 清單,因此伺服器工具活動屬於該輪的正式紀錄:回應會依序包含 server_tool_useweb_search_tool_result 和文字,而協定要求下一輪將這些 block 一併送回。搜尋證據因此會依設計成為後續輪次的輸入 token。/v1/chat/completions 協定則將助理訊息定義為單一內容字串,沒有存放伺服器工具結果的位置。因此注入的結果只在伺服器端使用,歷史紀錄只保留可見答案,證據不會留下。

我們透過兩種介面,在 claude-sonnet-5 上執行相同的「先搜尋、再追問」測試。使用 /v1/messages 時,後續問題計入 3,911 個輸入 token,費用為 $0.0109,而且全數都是 token 成本。模型仍可使用先前結果,因此沒有再次搜尋。使用 /v1/chat/completions 時,後續問題費用為 $0.0204,比重播結果更高。模型手上只剩自己產生的一行摘要,於是再次搜尋,產生新的 $0.01 費用與一批新結果。重新搜尋是模型的選擇,不是必然行為。先前在 deepseek-v4-flash-0731 上執行相同類型的後續問題時,模型直接根據摘要作答,只用了 460 個輸入 token,費用為 $0.00009。吸收結果的設計會讓後續費用呈現兩種情況:摘要足夠時幾乎免費;模型認為需要再次查詢時,則必須支付固定費用與結果載入成本。

因此,不能簡單說哪個端點比較便宜;兩者只是把成本放在不同位置。Block 形式會在每一輪支付可預測的 token 成本,但不會重複購買已有的證據;吸收形式則假設後續問題不需要原始證據,一旦假設錯誤,就要重新支付搜尋費。後續問題較簡單的多輪聊天適合 /v1/chat/completions;需要持續查核來源的研究型代理程式則適合 /v1/messages。對帶到後續輪次的大量結果,也可套用與其他大型 context 相同的 prompt cache 分層原則

Anthropic 與 OpenAI 如何收費?工具又在哪裡執行?

比較結果很簡單:所有供應商每次搜尋都收 $0.01,其他費用只取決於模型的 token 價格。Anthropic 每 1,000 次搜尋收 $10,結果則計為輸入 token;其網頁擷取不收固定費,只收 token 費。OpenAI 同樣每 1,000 次呼叫收 $10,但不同模型級別的 token 計價方式有所差異。搜尋固定費已經沒有差別,真正的變數是 1,500-3,100 個注入 token 所套用的模型輸入費率。

SynthoraiAnthropicOpenAI
每次搜尋費用$0.01$0.01$0.01
結果 token模型輸入費率模型輸入費率模型輸入費率(依級別而異)
網頁擷取費用$0.01-
支援的模型目錄中的所有模型僅限 Claude僅限 OpenAI

真正區分三者的項目不在價格表上,而是工具在哪裡執行。第一方伺服器工具是為各供應商自己的代理程式技術棧打造,只能留在第一方介面。Anthropic 文件指出,Web 搜尋無法在 Amazon Bedrock 使用;Google Cloud 只支援基本搜尋;Microsoft Foundry 則需要使用託管於 Anthropic 的部署。網頁擷取完全不支援 Bedrock 與 Google Cloud。OpenAI 的搜尋則綁定 Responses API。只要工作負載跨越雲端邊界或切換模型家族,第一方工具就無法跟著移動。這也是閘道不會直接轉送這些工具的原因:它們無法隨流量路由。閘道層工具採取相反做法,只需一種宣告方式,無論更換模型或平台都能繼續使用。

常見問題

Web 搜尋 API 每次請求要多少錢?

每次實際執行搜尋收 $0.01,並在帳務紀錄中獨立列項;注入的結果則依模型輸入費率計費。我們的測試中,每次搜尋會注入 1,500-3,100 個 token。若請求只宣告工具但未搜尋,不收固定費。使用一般模型時,每次搜尋的總成本可按 $0.010-0.012 編列預算;使用極便宜的模型時,固定費占總成本的 97%。

搜尋結果會在後續對話輪次再次計費嗎?

取決於端點。使用 /v1/messages 時,結果 block 會隨歷史紀錄重播。我們的測試約為每輪 3,900 個輸入 token,但不會產生新的搜尋費。使用 /v1/chat/completions 時,結果會在該輪結束後被吸收;若模型可根據摘要作答,後續問題幾乎免費(一次測試為 $0.00009);若模型再次搜尋,就會產生新的固定費與結果載入成本(另一次測試為 $0.0204)。Anthropic 的第一方搜尋文件將重播行為列為標準設計,因此每一輪都會重新計算結果 token 費用。

如何限制單次請求的 Web 搜尋支出?

使用 max_uses。這是模型無法超過的硬上限,預設為 3、最高為 10。費用只會隨實際執行的搜尋次數增加,未使用的額度不收費。單一事實查詢可設定 max_uses: 1,將最差成本限制在一次固定費與一批結果載入。

什麼情況該用網頁擷取,而不是 Web 搜尋?

已知 URL 且要讀取完整頁面時使用擷取;需要找出資料所在位置時使用搜尋。透過閘道使用時,兩者每次都收 $0.01,但擷取會注入整個頁面。我們的測試從最小頁面的 209 個 token,到長篇文章的 27,380 個 token;搜尋則會注入多個來源的摘要。若 read-and-summarize 管線使用 Claude 模型,Anthropic 自家的擷取工具不收固定費,成本較低。

測量日期為 2026-08-10。測試透過 Synthorai 閘道,在 deepseek-v4-flash-0731、gpt-5.6-luna、qwen3.8-max 與 claude-sonnet-5 上使用 synthorai:web_searchsynthorai:web_fetch:各模型的 token 費率由兩組不使用工具的基準測試求得;搜尋費則以帳單總額扣除 token 價值後的差額計算(每個模型 n=3)。另執行 max_uses 階梯測試、查詢類型與結果載入量掃描(4 種類型 × 3 次)、兩種端點上的相同後續問題測試,以及五個頁面的擷取階梯測試(三個自有頁面、一個最小外部頁面與一篇長文章)。費用另以逐項帳務紀錄確認,包括每次呼叫的工具費與工具注入 token,不只依總額推算。Anthropic 與 OpenAI 的數字來自發布時的官方文件價格。圖中的數字是一筆未經修改的實測呼叫。費用與行為可能變更,請以自己的使用紀錄確認。

← 返回部落格