🎁 新用戶 免費註冊,送 10 次呼叫,最高 $1,免綁卡。
圖片生成 API 成本:5 個模型實測比較($0.006–$0.039)

圖片生成 API 成本:5 個模型實測比較($0.006–$0.039)

目錄
  1. 圖片模型有哪些差異
  2. 實測結果
  3. 選擇方式
  4. 為什麼這些數字可信
  5. 結論
  6. 常見問題
  7. 資料來源

我們在原本用於文字 LLM 的閘道加入圖片生成功能,並針對模型、解析度、圖片數量與品質這 4 個變因實測成本。影響最大的是品質。多數圖片 API 都提供這項參數,但大部分呼叫端都直接沿用預設值。解析度、prompt 快取與批次處理的影響,遠低於一般預期。

TL;DR

  • gpt-image 的 quality 設定在相同解析度下,可讓費用相差約 36 倍:1024x1024 的 low/medium/high 分別計費 196/1,756/7,024 個輸出 token($0.0060/$0.053/$0.211)。
  • 選擇不同模型可讓成本相差 6.4 倍:gpt-image-2 的 low 品質每張 $0.0060,gemini-2.5-flash-image 則是 $0.0387。
  • 解析度影響很小:gpt-image-2 從 1024x1024 提升到 2048x2048,每張成本僅增加為 2 倍。
  • 圖片生成不支援 prompt 快取,而且 n=4 會對 prompt 重複計費 4 次。輸出低於約 1,000 個 token 時,按 token 計費較便宜;超過後則是每張固定計費較有利。

圖片模型有哪些差異

圖片模型不能直接互換。它們在多個面向上都有差異,其中只有計費方式直接涉及價格。目前可用的模型概況如下:

系列計費方式quality 設定批次 n>1解析度
gpt-image (OpenAI)按 tokenlow/med/high最高約 2K
gemini-image (Google)按 token✗ 每次呼叫 1 張1K(gemini-3:最高 4K)
qwen-image / wan2.7 (Alibaba)每張固定計費512²–2048²
seedream (BytePlus)每張固定計費✗ 每次呼叫 1 張≥1920²(4.5/5.0)

如果假設所有模型的行為都相同,以下幾個差異很容易造成問題:

  • 計費方式。 可分為按 token 計費(gpt-imagegemini)與每張固定計費(qwenwanseedream)。這項差異直接決定帳單,下一節會詳細說明。
  • quality 設定。 只有 gpt-image 提供這項設定(lowmediumhigh)。Gemini 透過模型層級(flashpro)或 image_size 調整品質;固定計費模型則沒有類似選項。單是這個設定就能讓費用相差約 36×,因此它是最主要的成本變因,後文會進一步分析。
  • 並非所有模型都支援批次(n>1)。 gpt-imageqwenwan 一次呼叫可回傳多張圖片。所有 Gemini 與 Seedream 圖片模型每次呼叫只能產生 1 張圖片:設定 n=2 會回傳 400,因此需要送出 N 個請求,並自行協調批次流程。
  • 解析度限制不只設上限,也可能設下限。 gemini-2.5-flash-image 上限為 1K(1 MP),gemini-3 則可達 2K/4K(帳單從 1K 到 4K 約增加為 2 倍)。Seedream 4.5/5.0 的最低解析度約為 1920²,更小的尺寸會被拒絕。qwen-image 支援 512²–2048²。較高的解析度不一定可用,也不一定能靠降低解析度省錢。
  • 控制參數與以圖生圖能力不同。 只有部分模型支援 seednegative_promptguidance_scale。圖片編輯可接受的參考圖片上限,則從 3 張(gemini-2.5)到 16 張(gpt-image)不等。

quality 有一個不容易看出的特性。對 gpt-image 而言,輸出 token 是計費單位,不代表實際取得的檔案大小。OpenAI 根據公開的(quality × size)費率表指定 token 數量。例如 gpt-image-1 在 1024² 下,low/medium/high 分別是 272/1,056/4,160 個 token。因此,token 數量由 quality 決定,而不是根據回傳的位元組數計算。我們已實際驗證:同一個 prompt 在 1024² 下使用 3 種品質,產生的都是相同 1024×1024、檔案大小相近(約 0.9 MB)的 PNG,但分別計費 196、1,756 與 7,024 個 token。解析度與位元組大小相同,成本卻相差 36×。你付的是渲染所需的運算成本,不是像素數量。因此應查看 usage,不能只憑輸出結果判斷。

這些模型全都不支援 prompt 快取,而這通常是大家最先想到的省錢方式。圖片生成是無狀態的:沒有對話或 KV 狀態可以重用,usage 物件也不包含快取欄位。根據後面的實測,批次處理同樣不會共用 prompt。快取是聊天功能,不適用於圖片生成,因此無法用這種常見做法降低圖片成本。


實測結果

我們透過閘道執行實際生成,使用同一個電商風格的商品 prompt,並依各模型的公開費率與回傳的 usage 計算成本。以下 5 項結論分別來自不同的測試。

1. 成本來自圖片,不是 prompt。 在文字生成圖片的流程中(輸入 prompt、輸出圖片),帳單有 97–100% 來自輸出 token:gpt-image-2 生成一張 1024² 圖片時,輸入為 21 個 token、輸出為 196 個 token(約 $0.0001 加 $0.0059);gemini-2.5-flash-image 的輸入則是 10 個 token。文字 prompt 的成本幾乎可以忽略,但這只因為輸入是文字。若改為輸入圖片,例如以圖生圖的「把這個馬克杯改成藍色」,輸入 token 就會大幅增加:

模型文字生圖輸入以圖生圖輸入(1 張參考圖)輸出
gpt-image-2 (low)21 tok1,043 tok196 tok
gemini-2.5-flash-image10 tok1,297 tok1,290 tok

輸入量會增加 50–130×,而且呈線性成長:gpt-image-2 每增加一張參考圖,約多出 1,025 個 token。實測 1、2、3 張參考圖時,分別為 1,043、2,068 與 3,093 個 token。在 low 品質下,這些輸入 token 是生成輸出的 5 倍。不論是哪種流程,成本都來自圖片,無論圖片是由模型生成還是由你提供;prompt 本身從來不是主要成本。本文其餘內容聚焦於文字生成圖片;以圖生圖的完整成本分析會另文說明。

2. 選擇模型可讓成本相差 6×。 使用相同的 1024² 請求與預設品質:

模型計費方式每張成本
gpt-image-2token · quality 設定$0.0060
gpt-image-1-minitoken · quality 設定$0.0085
seedream-4-0每次請求固定計費$0.030
qwen-image-2.0每次請求固定計費$0.035
gemini-2.5-flash-imagetoken · 無 quality 設定$0.0387

最便宜與最昂貴的方案相差 6.4×,差異完全來自各模型產生的輸出 token 數量。

3. 解析度對成本影響很小。gpt-image-2 從 1024² 調到 2048²,每張成本大致維持在同一個量級($0.0060 到 $0.0121);輸出 token 不會與像素數量成正比。無論要求哪種尺寸,gemini-2.5-flash-image 都回傳相同的 1,290 個 token,因為它只支援 1K,size 只會改變長寬比。(gemini-3 圖片模型確實會依 image_size 調整,成本從 1K 到 4K 約增加為 2 倍;但本文測試的 2.5-flash-image 不會。)每張固定計費的模型,成本本來就與解析度無關。到這裡為止,按 token 計費的模式看來很難被超越。

4. 品質會讓成本優勢反轉。 以下是 gpt-image-2 在各品質層級的測試結果:

quality1024²2048²
low$0.0060 (196 tok)$0.0121 (397 tok)
medium$0.053 (1,756 tok)$0.107 (3,568 tok)
high$0.211 (7,024 tok)$0.428 (14,272 tok)

輸出 token 從 low 到 medium 約增加 9×,從 low 到 high 則約增加 36×。在 low 品質下,按 token 計費最便宜;到了 medium 或 high,就會超過每張固定價格($0.03–0.035)。依計算結果,交叉點約在 1,000 個輸出 token($0.03 ÷ $30/M):low 低於這個門檻,medium 則高於門檻。這也修正了我們先前的結論。「按 token 計費永遠最便宜」只是因為當時測試的是預設 low 品質。

相同的 prompt 分別由 gpt-image-2 以 low、medium 與 high 品質生成:3 張同樣清晰的 1024² 商品照,標示的輸出 token 分別為 196/1,756/7,024,成本則為 $0.006/$0.053/$0.215。

相同的 prompt、gpt-image-2、1024²。lowmediumhigh 分別計費 196/1,756/7,024 個輸出 token,即 $0.006/$0.053/$0.215:解析度相同,成本卻相差 36×。像這種背景乾淨的商品照,3 種品質很難看出差別,因此最便宜的層級通常已經足夠。應依工作需求設定 quality,不要一律預設使用 high

5. 多張圖片不能共用 prompt。 單次呼叫生成 n 張圖片,不會分攤 prompt 成本。gpt-image-2 會將 prompt 計費 N 次:n=4 時,輸入 token 從 28 增加到 112;使用較長的品牌 prompt 時,則從 499 增加到 1,996。n=1n=4 的每張成本完全相同。圖片生成既沒有快取,也沒有任何可共用 prompt 成本的機制。每張輸出圖片都要付費,prompt 也會逐張重新計費。


選擇方式

對文字生成圖片而言,真正的決定因素是品質,而不是一般人直覺想到的項目:

  • Low/草稿/縮圖品質: 選擇依品質按 token 計費的模型(gpt-image,約 $0.006–0.012)。解析度在約 2K 以下時都最便宜。
  • Medium/high 品質: 選擇每次請求固定計費(seedreamqwen,$0.03–0.035)。按 token 計費會快速攀升(本次測試為 $0.05–0.43),固定計費不只更便宜,也不受品質影響。
  • gemini(預設 1K 約 $0.039)很少是成本最優的選擇。 Low 品質有更便宜的 gpt-image,medium 與 high 則有每次請求固定計費的模型。它沒有 quality 設定;若要提升輸出品質,應選 Pro 層級或更高的 image_size,而不是期待價格優勢。
  • 同一品質層級內,解析度最多讓成本增加約 2×, 不足以改變模型選擇。品質才會。
  • n>1、快取與批次處理都不會降低每張成本。 沒有任何成本可以共用。
  • 以圖生圖:預設選擇每張固定計費。 參考圖片屬於輸入,只有按 token 計費的模型會加收費用(每張約 1,025 個 token);固定計費模型則免費包含。因此圖片編輯通常由 seedreamqwen 勝出。只有在 low 品質且參考圖不多時,gpt-image 仍較便宜(約 5 張時會超過固定價格);品質或參考圖數量增加後就不再划算。

電商是最明顯的例子。假設你為商品目錄中的每個品項生成商品照,每次都傳送相同且很長的品牌 prompt,並認為快取這段重複 prompt 可以省錢。這個假設有兩個問題:prompt 原本就不是主要成本,圖片才是;而且圖片生成根本沒有快取。實際商品圖片通常需要 medium 以上的品質,因此應選擇每張固定計費的模型。無論 prompt 重複程度多高,這種方式都更便宜,成本也更容易預估。

不過,前面提到的能力限制仍可能推翻成本選擇,包括模型是否每次只能生成 1 張圖片、解析度上下限、資料駐留限制,以及模型提供哪些參數(seednegative_promptguidance_scale)。先按成本挑選,再確認功能是否符合需求。


為什麼這些數字可信

這些數字來自實際回傳的 usage,並按各供應商的公開牌價計算,不是估算值。我們閘道的圖片計費不依賴 session:只有收到 2xx 才會結算(生成失敗不收費);在產生任何費用前,會先檢查最壞情況下的成本;若回應缺少 usage,則按上限計費,而不是默默記為 $0。我們一直遵循同一個原則:相信實際成本,不直接採信供應商提供的數字。這也是我們用來稽核閘道是否虛報快取資料的方法。


結論

圖片生成看起來只是另一個 endpoint,但計費單位已經不同。對文字生成圖片而言,真正影響成本的不是 prompt(沒有快取,也不能透過批次共用),也不是解析度,而是品質。Low 品質時 gpt-image 最便宜;到了 medium 與 high,每張固定計費的 seedreamqwen 更有優勢,交叉點約在 1,000 個輸出 token。應明確設定品質,依品質選擇模型,並檢查實際成本。從生成改為編輯、開始輸入參考圖片時,必須重新計算,因為輸入圖片會成為主要成本。


常見問題

Prompt 快取能降低圖片生成成本嗎? 不能。圖片生成是無狀態的:usage 物件沒有快取欄位,批次處理也會對每張圖片重新計費 prompt。成本來自輸出圖片,不是文字。

按 token 還是按圖片計費比較便宜? 取決於品質。Low 或草稿品質可選擇有 quality 設定的模型,例如 gpt-image(約 $0.006–0.012)。Medium 或 high 則適合每張固定計費的 seedreamqwen($0.03–0.035),因為按 token 計費會快速攀升。以圖生圖更偏向固定計費:這類模型免費包含參考圖片,按 token 計費則會對每張加收約 1,025 個 token。


資料來源

所有資料均於 2026-06-19 查核。本文不構成財務建議;採用前請確認最新價格。

← 返回部落格