圖片生成 API 成本:5 個模型實測比較($0.006–$0.039)
我們在原本用於文字 LLM 的閘道加入圖片生成功能,並針對模型、解析度、圖片數量與品質這 4 個變因實測成本。影響最大的是品質。多數圖片 API 都提供這項參數,但大部分呼叫端都直接沿用預設值。解析度、prompt 快取與批次處理的影響,遠低於一般預期。
TL;DR
- gpt-image 的
quality設定在相同解析度下,可讓費用相差約 36 倍:1024x1024 的 low/medium/high 分別計費 196/1,756/7,024 個輸出 token($0.0060/$0.053/$0.211)。 - 選擇不同模型可讓成本相差 6.4 倍:gpt-image-2 的 low 品質每張 $0.0060,gemini-2.5-flash-image 則是 $0.0387。
- 解析度影響很小:gpt-image-2 從 1024x1024 提升到 2048x2048,每張成本僅增加為 2 倍。
- 圖片生成不支援 prompt 快取,而且
n=4會對 prompt 重複計費 4 次。輸出低於約 1,000 個 token 時,按 token 計費較便宜;超過後則是每張固定計費較有利。
圖片模型有哪些差異
圖片模型不能直接互換。它們在多個面向上都有差異,其中只有計費方式直接涉及價格。目前可用的模型概況如下:
| 系列 | 計費方式 | quality 設定 | 批次 n>1 | 解析度 |
|---|---|---|---|---|
gpt-image (OpenAI) | 按 token | ✓ low/med/high | ✓ | 最高約 2K |
gemini-image (Google) | 按 token | ✗ | ✗ 每次呼叫 1 張 | 1K(gemini-3:最高 4K) |
qwen-image / wan2.7 (Alibaba) | 每張固定計費 | ✗ | ✓ | 512²–2048² |
seedream (BytePlus) | 每張固定計費 | ✗ | ✗ 每次呼叫 1 張 | ≥1920²(4.5/5.0) |
如果假設所有模型的行為都相同,以下幾個差異很容易造成問題:
- 計費方式。 可分為按 token 計費(
gpt-image、gemini)與每張固定計費(qwen、wan、seedream)。這項差異直接決定帳單,下一節會詳細說明。 quality設定。 只有gpt-image提供這項設定(low/medium/high)。Gemini 透過模型層級(flash到pro)或image_size調整品質;固定計費模型則沒有類似選項。單是這個設定就能讓費用相差約 36×,因此它是最主要的成本變因,後文會進一步分析。- 並非所有模型都支援批次(
n>1)。gpt-image、qwen與wan一次呼叫可回傳多張圖片。所有 Gemini 與 Seedream 圖片模型每次呼叫只能產生 1 張圖片:設定n=2會回傳400,因此需要送出 N 個請求,並自行協調批次流程。 - 解析度限制不只設上限,也可能設下限。
gemini-2.5-flash-image上限為 1K(1 MP),gemini-3則可達 2K/4K(帳單從 1K 到 4K 約增加為 2 倍)。Seedream 4.5/5.0 的最低解析度約為 1920²,更小的尺寸會被拒絕。qwen-image支援 512²–2048²。較高的解析度不一定可用,也不一定能靠降低解析度省錢。 - 控制參數與以圖生圖能力不同。 只有部分模型支援
seed、negative_prompt或guidance_scale。圖片編輯可接受的參考圖片上限,則從 3 張(gemini-2.5)到 16 張(gpt-image)不等。
quality 有一個不容易看出的特性。對 gpt-image 而言,輸出 token 是計費單位,不代表實際取得的檔案大小。OpenAI 根據公開的(quality × size)費率表指定 token 數量。例如 gpt-image-1 在 1024² 下,low/medium/high 分別是 272/1,056/4,160 個 token。因此,token 數量由 quality 決定,而不是根據回傳的位元組數計算。我們已實際驗證:同一個 prompt 在 1024² 下使用 3 種品質,產生的都是相同 1024×1024、檔案大小相近(約 0.9 MB)的 PNG,但分別計費 196、1,756 與 7,024 個 token。解析度與位元組大小相同,成本卻相差 36×。你付的是渲染所需的運算成本,不是像素數量。因此應查看 usage,不能只憑輸出結果判斷。
這些模型全都不支援 prompt 快取,而這通常是大家最先想到的省錢方式。圖片生成是無狀態的:沒有對話或 KV 狀態可以重用,usage 物件也不包含快取欄位。根據後面的實測,批次處理同樣不會共用 prompt。快取是聊天功能,不適用於圖片生成,因此無法用這種常見做法降低圖片成本。
實測結果
我們透過閘道執行實際生成,使用同一個電商風格的商品 prompt,並依各模型的公開費率與回傳的 usage 計算成本。以下 5 項結論分別來自不同的測試。
1. 成本來自圖片,不是 prompt。 在文字生成圖片的流程中(輸入 prompt、輸出圖片),帳單有 97–100% 來自輸出 token:gpt-image-2 生成一張 1024² 圖片時,輸入為 21 個 token、輸出為 196 個 token(約 $0.0001 加 $0.0059);gemini-2.5-flash-image 的輸入則是 10 個 token。文字 prompt 的成本幾乎可以忽略,但這只因為輸入是文字。若改為輸入圖片,例如以圖生圖的「把這個馬克杯改成藍色」,輸入 token 就會大幅增加:
| 模型 | 文字生圖輸入 | 以圖生圖輸入(1 張參考圖) | 輸出 |
|---|---|---|---|
gpt-image-2 (low) | 21 tok | 1,043 tok | 196 tok |
gemini-2.5-flash-image | 10 tok | 1,297 tok | 1,290 tok |
輸入量會增加 50–130×,而且呈線性成長:gpt-image-2 每增加一張參考圖,約多出 1,025 個 token。實測 1、2、3 張參考圖時,分別為 1,043、2,068 與 3,093 個 token。在 low 品質下,這些輸入 token 是生成輸出的 5 倍。不論是哪種流程,成本都來自圖片,無論圖片是由模型生成還是由你提供;prompt 本身從來不是主要成本。本文其餘內容聚焦於文字生成圖片;以圖生圖的完整成本分析會另文說明。
2. 選擇模型可讓成本相差 6×。 使用相同的 1024² 請求與預設品質:
| 模型 | 計費方式 | 每張成本 |
|---|---|---|
gpt-image-2 | token · quality 設定 | $0.0060 |
gpt-image-1-mini | token · quality 設定 | $0.0085 |
seedream-4-0 | 每次請求固定計費 | $0.030 |
qwen-image-2.0 | 每次請求固定計費 | $0.035 |
gemini-2.5-flash-image | token · 無 quality 設定 | $0.0387 |
最便宜與最昂貴的方案相差 6.4×,差異完全來自各模型產生的輸出 token 數量。
3. 解析度對成本影響很小。 將 gpt-image-2 從 1024² 調到 2048²,每張成本大致維持在同一個量級($0.0060 到 $0.0121);輸出 token 不會與像素數量成正比。無論要求哪種尺寸,gemini-2.5-flash-image 都回傳相同的 1,290 個 token,因為它只支援 1K,size 只會改變長寬比。(gemini-3 圖片模型確實會依 image_size 調整,成本從 1K 到 4K 約增加為 2 倍;但本文測試的 2.5-flash-image 不會。)每張固定計費的模型,成本本來就與解析度無關。到這裡為止,按 token 計費的模式看來很難被超越。
4. 品質會讓成本優勢反轉。 以下是 gpt-image-2 在各品質層級的測試結果:
| quality | 1024² | 2048² |
|---|---|---|
| low | $0.0060 (196 tok) | $0.0121 (397 tok) |
| medium | $0.053 (1,756 tok) | $0.107 (3,568 tok) |
| high | $0.211 (7,024 tok) | $0.428 (14,272 tok) |
輸出 token 從 low 到 medium 約增加 9×,從 low 到 high 則約增加 36×。在 low 品質下,按 token 計費最便宜;到了 medium 或 high,就會超過每張固定價格($0.03–0.035)。依計算結果,交叉點約在 1,000 個輸出 token($0.03 ÷ $30/M):low 低於這個門檻,medium 則高於門檻。這也修正了我們先前的結論。「按 token 計費永遠最便宜」只是因為當時測試的是預設 low 品質。

相同的 prompt、gpt-image-2、1024²。low/medium/high 分別計費 196/1,756/7,024 個輸出 token,即 $0.006/$0.053/$0.215:解析度相同,成本卻相差 36×。像這種背景乾淨的商品照,3 種品質很難看出差別,因此最便宜的層級通常已經足夠。應依工作需求設定 quality,不要一律預設使用 high。
5. 多張圖片不能共用 prompt。 單次呼叫生成 n 張圖片,不會分攤 prompt 成本。gpt-image-2 會將 prompt 計費 N 次:n=4 時,輸入 token 從 28 增加到 112;使用較長的品牌 prompt 時,則從 499 增加到 1,996。n=1 與 n=4 的每張成本完全相同。圖片生成既沒有快取,也沒有任何可共用 prompt 成本的機制。每張輸出圖片都要付費,prompt 也會逐張重新計費。
選擇方式
對文字生成圖片而言,真正的決定因素是品質,而不是一般人直覺想到的項目:
- Low/草稿/縮圖品質: 選擇依品質按 token 計費的模型(
gpt-image,約 $0.006–0.012)。解析度在約 2K 以下時都最便宜。 - Medium/high 品質: 選擇每次請求固定計費(
seedream/qwen,$0.03–0.035)。按 token 計費會快速攀升(本次測試為 $0.05–0.43),固定計費不只更便宜,也不受品質影響。 gemini(預設 1K 約 $0.039)很少是成本最優的選擇。 Low 品質有更便宜的gpt-image,medium 與 high 則有每次請求固定計費的模型。它沒有quality設定;若要提升輸出品質,應選 Pro 層級或更高的image_size,而不是期待價格優勢。- 同一品質層級內,解析度最多讓成本增加約 2×, 不足以改變模型選擇。品質才會。
n>1、快取與批次處理都不會降低每張成本。 沒有任何成本可以共用。- 以圖生圖:預設選擇每張固定計費。 參考圖片屬於輸入,只有按 token 計費的模型會加收費用(每張約 1,025 個 token);固定計費模型則免費包含。因此圖片編輯通常由
seedream/qwen勝出。只有在 low 品質且參考圖不多時,gpt-image仍較便宜(約 5 張時會超過固定價格);品質或參考圖數量增加後就不再划算。
電商是最明顯的例子。假設你為商品目錄中的每個品項生成商品照,每次都傳送相同且很長的品牌 prompt,並認為快取這段重複 prompt 可以省錢。這個假設有兩個問題:prompt 原本就不是主要成本,圖片才是;而且圖片生成根本沒有快取。實際商品圖片通常需要 medium 以上的品質,因此應選擇每張固定計費的模型。無論 prompt 重複程度多高,這種方式都更便宜,成本也更容易預估。
不過,前面提到的能力限制仍可能推翻成本選擇,包括模型是否每次只能生成 1 張圖片、解析度上下限、資料駐留限制,以及模型提供哪些參數(seed、negative_prompt、guidance_scale)。先按成本挑選,再確認功能是否符合需求。
為什麼這些數字可信
這些數字來自實際回傳的 usage,並按各供應商的公開牌價計算,不是估算值。我們閘道的圖片計費不依賴 session:只有收到 2xx 才會結算(生成失敗不收費);在產生任何費用前,會先檢查最壞情況下的成本;若回應缺少 usage,則按上限計費,而不是默默記為 $0。我們一直遵循同一個原則:相信實際成本,不直接採信供應商提供的數字。這也是我們用來稽核閘道是否虛報快取資料的方法。
結論
圖片生成看起來只是另一個 endpoint,但計費單位已經不同。對文字生成圖片而言,真正影響成本的不是 prompt(沒有快取,也不能透過批次共用),也不是解析度,而是品質。Low 品質時 gpt-image 最便宜;到了 medium 與 high,每張固定計費的 seedream/qwen 更有優勢,交叉點約在 1,000 個輸出 token。應明確設定品質,依品質選擇模型,並檢查實際成本。從生成改為編輯、開始輸入參考圖片時,必須重新計算,因為輸入圖片會成為主要成本。
常見問題
Prompt 快取能降低圖片生成成本嗎?
不能。圖片生成是無狀態的:usage 物件沒有快取欄位,批次處理也會對每張圖片重新計費 prompt。成本來自輸出圖片,不是文字。
按 token 還是按圖片計費比較便宜?
取決於品質。Low 或草稿品質可選擇有 quality 設定的模型,例如 gpt-image(約 $0.006–0.012)。Medium 或 high 則適合每張固定計費的 seedream/qwen($0.03–0.035),因為按 token 計費會快速攀升。以圖生圖更偏向固定計費:這類模型免費包含參考圖片,按 token 計費則會對每張加收約 1,025 個 token。
資料來源
- OpenAI:圖片生成 API
- OpenAI:gpt-image 按 token 計價
- Google:Gemini API 定價(圖片輸出 token)
- OpenAI:Prompt 快取(為何不適用於圖片生成)
所有資料均於 2026-06-19 查核。本文不構成財務建議;採用前請確認最新價格。