Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

Qwen3.7 Plus

Veröffentlicht 2026-06-01

chatCodeReasoningTool-AufrufeVisionPrompt Caching

Qwen3.7 Plus ist das multimodale Arbeitspferd der Qwen3.7-Generation, die das Qwen-Team „The Agent Frontier“ nennt.

Eingabe
Text Bild Video $0.4/M
Ausgabe
Text $1.6/M
Cache-Read
$0.08/M
Kontext
1M
vs. GPT-4o
~92% günstiger

Benchmarks

Über dem DurchschnittKeins besser7 / 125 / 12
Qwen3.7 Plus weitere gemessene Modelle Durchschnitt der Vergleichsmodelle kein anderes Modell war besser
SWE-Bench Pro
57.6%
ScreenSpot-Pro
kein anderes Modell war besser 79%
Humanity's Last Exam no tools
34.7%
MCP-Mark
58.7%
BabyVision
kein anderes Modell war besser 64.7%

Herstellerangaben: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

Preis im Vergleich

Preisposition unter 60 vergleichbaren Modellen

Eingabe$0.4/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Ausgabe$1.6/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Cache-Lesen$0.08/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.

Spezifikationen & Limits

Tokens

Kontextfenster (Herstellerangabe) 1.000.000
Max. Output (Anbieter-Spezifikation) 65.536

Prompt Caching

Modus automatisch + explizit
Min. Präfix 1.024
Lebensdauer explizit: 5 Min., bei Treffer zurückgesetzt
Schreibkosten 1.25x

Thinking

Anbieter-Parameter enable_thinking + thinking_budget + preserve_thinking
Zulässige Werte enable_thinking true · false; thinking_budget in tokens; preserve_thinking true · false
Standardwert an; die Qwen3.7-Plus-Reihe nutzt hybrides Thinking, das standardmäßig aktiviert ist, und preserve_thinking ist aus gilt, wenn die Anfrage nichts angibt
Abschaltbar Ja
Thinking-Verhalten Die Spur wird in reasoning_content zurückgegeben und in späteren Turns verworfen, sofern preserve_thinking nicht true ist, was sie an den Input anhängt und als Input-Token abrechnet.
Parameter reasoning_effort
Werte minimal · low · medium · high die Parameteroberfläche des Gateways - das Anbieter-Mapping oben gilt

Modell

Modalitäten Text + Bild + Video → Text
  • Multimodales Agent-Modell, das Vision und Sprache vereint
  • offiziell vereinheitlichte GUI- und CLI-Bedienung sowie Coding-Agent-Fähigkeit
  • 1M-Token-Kontext
  • hybrides Thinking standardmäßig aktiv

laut Offizielle Alibaba-Dokumentation ↗

Ein Prompt, gemessen über das Gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. PRÜFEN genau 3 Sätze

Qwen3.7 Plus bestanden · 3 sentences

Enabling reasoning requires the model to generate extensive internal "thinking" tokens to process complex logic before delivering a final answer. Because our vendor charges us per token consumed, this hidden computational overhead effectively doubles our output volume for the exact same number of user requests. Consequently, our costs have doubled because we are now paying for the model's increased processing time to achieve higher-quality, more accurate results.

Ausgabe 1428 tok (+1345 Denken) Latenz 25.2 s

Befolgen der Anweisung (genau drei Sätze - abzählbar), Zuschnitt auf das Publikum (CFO-Register), und die Abrechnungslücke durch verstecktes Denken, die die Token-Zähler unten offenlegen.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. PRÜFEN Fix besteht die Tests

Qwen3.7 Plus bestanden · 8/8 cases

## Fixed Code ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` ## Bug Explanation The function has two related bugs rooted in how it counts run lengths. First, `cur` is initialized to `0` and only incremented on matches, so it counts the number of *transitions* between equal elements rather than the total elements in the run—a run of N identical items only reaches `cur = N − 1`, undercounting by one. This also causes the single-element case to return `0`, since the loop never executes and `cur` never increments. […]

Ausgabe 2317 tok (+2005 Denken) Latenz 40.5 s

Ob der Fix tatsächlich korrekt ist (ausführbar), die Dichte der Erklärung, und die Token-Effizienz bei einer klar begrenzten Aufgabe.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. PRÜFEN gültiges JSON, Schema exakt

Qwen3.7 Plus bestanden · 5/5 fields, guidance null

{ "company": "Meridian Robotics", "quarter": "September", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null }

Ausgabe 1807 tok (+1750 Denken) Latenz 31.6 s

Schema-Treue (keine erfundenen Felder), Halluzinationsdruck (guidance wird ausdrücklich zurückgehalten), und Unterschiede im Pfad für strukturierte Ausgabe.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. PRÜFEN 120 Wörter, 0 verbotene Wörter

Qwen3.7 Plus bestanden · 120 words, 0 banned, 1 question

Introducing PromptCache, our new API gateway feature designed to store and reuse prompts across multiple artificial intelligence providers. Have you ever noticed how repeatedly sending identical queries drains your budget and increases latency? PromptCache solves this by intelligently storing responses at the gateway level. When your application requests the same prompt from a different provider, the system instantly returns the cached result. This drastically reduces API costs and accelerates response times for your users. You can configure custom expiration times and set specific fallback rules for each vendor. You must stop paying twice for the exact same computation. Please upgrade your entire infrastructure today and experience much faster and cheaper integrations without changing a single line of your application code.

Ausgabe 4453 tok (+4312 Denken) Latenz 76.8 s

Einhaltung der Vorgaben (Wortbudget, Liste verbotener Wörter, die eine Frage), Stil-Fingerabdruck, und Längensteuerung.

Qwen3.7 Plus in 30 Sekunden nutzen

OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3.7-plus",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Über Qwen3.7 Plus

  • Es erweitert das agentische Rückgrat der Generation um Bild- und Videoverständnis und behält dabei tiefes Reasoning, Coding-Stärke und Tool-Aufrufe, und es trägt ein Kontextfenster von 1M Token für langfristige Sitzungen.
  • Positioniert als das ausgewogene, günstigere Geschwistermodell zu Qwen3.7 Max, nimmt es Text- und visuelle Eingaben und gibt Text aus, was es für bildschirmbewusste Agenten und Dokumenten-Workflows geeignet macht.
  • Alibaba beschreibt, wie es reale Szenen wahrnimmt, einen Bildschirm liest und die GUI bedient, Code aus einer visuellen Vorlage erzeugt und eine mobile App durchgängig navigiert.
  • Es ist zudem die Stufe, die Alibaba in seiner Produktreihe standardmäßig empfiehlt, für ausgewogene Leistung und Kosten mit vollem Tool Calling und genug Kontext für eine große Codebasis.
  • Die dokumentierten Eingabelimits sind ungewöhnlich konkret: bis zu 2.048 Bilder oder 64 Videos pro Anfrage, mit Video bis zu zwei Stunden und 2 GB, und Ausgabe bis 65.536 Token.
  • Thinking ist hybrid und standardmäßig aktiv, wird pro Anfrage mit enable_thinking deaktiviert, mit thinking_budget begrenzt und separat in reasoning_content zurückgegeben, wo es als Output abgerechnet wird; wie das Flaggschiff gehört es zu den Modellen, für die Alibaba preserve_thinking dokumentiert, das Reasoning über Turns hinweg mitführt, damit mehrstufige Agent-Läufe konsistent bleiben, ohne frühere Entscheidungen neu herzuleiten.
  • Strukturierte Ausgaben, Function Calling, eingebaute Tools, Batch-Inferenz und beide Caching-Modi sind dafür gelistet.
  • Synthorai stellt es über den OpenAI-kompatiblen Endpoint bereit.

FAQ

Lässt sich die Qwen3.7 Plus API kostenlos testen?

Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $0.4/M Input-Tokens deckt allein dieses Guthaben rund 312 Requests mit je ~8K Tokens gegen Qwen3.7 Plus ab.

Worin ist Qwen3.7 Plus am besten?

Ergänzt Bild- und Videoverständnis; ausgewogenes, kostengünstigeres Geschwistermodell des Flaggschiffs; geeignet für bildschirmbewusste Agenten und Dokumente. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet Qwen3.7 Plus?

Qwen3.7 Plus kostet auf Synthorai $0.4 pro Million Input-Tokens und $1.6 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.08/M abgerechnet.

Unterstützt Qwen3.7 Plus Prompt-Caching?

Ja, automatisches Caching ist standardmäßig aktiv, dazu ein expliziter Modus für garantierte Einsparungen. Gecachte Input-Tokens werden mit $0.08/M statt $0.4/M (ungecacht) abgerechnet; Prompts brauchen ein stabiles Präfix von 1,024 Tokens, um gecacht zu werden (TTL explizit: 5 Min., bei Treffer zurückgesetzt). Prompt-Caching-Guide →

Wie erhalte ich Zugang zu Qwen3.7 Plus?

Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="qwen3.7-plus", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.

Verwandte Modelle

Vergleichen

Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.

API-Schlüssel abrufen Ihre Kosten vergleichen →