엔지니어링 블로그
멀티모달 AI 게이트웨이를 구축하며 마주친 실제 엔지니어링 문제들.
여기서 시작
GLM 5.2 Reasoning Effort: 비용을 20배 줄이는 설정, 직접 측정해 봤다
같은 코딩 답변도 reasoning effort를 제대로 설정하면 $0.0031, GLM 5.2의 무제한 기본값에서는 $0.062가 든다. 비용은 20배 낮고 속도는 30배 빠르다. 작업별 설정 방법을 알아본다.
Claude Fable 5는 ZDR에서 사용할 수 없다: 30일 보관 의무
ZDR 조직에서 claude-fable-5를 호출하면 400 오류가 발생한다. Claude API, Bedrock, Vertex, Foundry 모두 예외가 없다. HIPAA/COPPA에 미치는 영향과 라우팅 해결책을 정리했다.
LLM 프롬프트 캐싱 완벽 가이드 2026: 입력 비용 50-90% 절감
Claude, GPT, Gemini, DeepSeek의 프롬프트 캐싱 동작 원리와 입력 비용 50-90%, TTFT 3-10배 개선 방법. 아키텍처, 제공업체 비교, Python 코드까지 다룹니다.
전체 글45
-
GPT-6 Astra 추론 강도: 같은 답인데 max는 low의 2.3배
검증된 11개 작업에서 none은 33회 중 17회 실패했고, disabled는 추론을 끄지 못했다. max는 low보다 2.3배 비싸며, Astra의 정답당 비용은 GPT-5.6 Sol의 1.6배다.
-
LLM API Rate Limit 13곳 비교, 429를 재시도하지 않는 SDK 2개
13개 LLM API와 클라우드에서 RPM·TPM에 포함되는 토큰 범위와 제한 계산법, 반환되는 응답 헤더를 비교하고, HTTP 429가 뜻하는 네 가지 원인과 429 오류를 자동 재시도하지 않는 SDK 두 개를 정리한다.
-
긴 컨텍스트 요금제: 최대 6.7배, gateway에는 표시되지 않는다
한 aggregator에서 9개 구간형 모델이 문서에 없는 한도를 넘자 최대 6.7배 과금됐고, 한 endpoint는 표시 가격의 1.25배를 청구했다. 모델별 구간과 실제 청구액을 비교해 비용 한도를 넘지 않는 방법을 설명한다.
-
AI API 과금 단위 17가지: token부터 PTU-hour까지
같은 API 비용도 token, 문자, 분, GB-day, token-hour, PTU-hour 등 17가지 단위로 측정됩니다. 단위별 계산 방식과 환산 차이, 사용량 집계·반올림 과정에서 과금 코드가 자주 놓치는 함정을 정리한 실무 가이드입니다.
-
번역용 LLM 비교: 9개 모델, 9개 언어, 비용 차이 400배
9개 LLM과 9개 언어를 8,455건의 블라인드 판정으로 비교했다. gpt-5.6-sol은 9개 중 7개 언어에서 앞섰고, gemini-3.7-flash는 한국어에서 동률, 이탈리아어에서 우세했다. 100만 자당 비용은 $0.26-$104였다.
-
LLM 데이터 보존과 ZDR: 프롬프트를 읽을 수 있는 모든 주체
벤더 API 로그는 약 30일 후 삭제되지만 tracing SaaS, vector memory, gateway console은 사용자가 직접 지울 때까지 프롬프트를 보관합니다. ZDR이 API 제공업체의 로그에만 적용되는지와 별도 도구의 보존 범위를 설명합니다.
-
LLM 구조화 출력: 12개 중 4개가 유효하지만 틀린 JSON
12개 LLM API의 구조화 출력을 측정했다. JSON은 100% 스키마에 맞았지만, 4개 모델은 thinking을 켜면 값이 틀렸다. 같은 호출의 prompt token도 30에서 4,959까지 차이 났다.
-
AI 콘텐츠를 표시하는 API는? 16개 API와 10개 법률 비교
생성형 API 16개를 표시 의무 법률 10개와 비교했다. 7개는 C2PA, 4개는 중국식 라벨을 넣었지만 둘 다 넣은 API는 없었다. 오디오와 동영상에는 아무 표시도 없었고, C2PA manifest는 resize 한 번도 버티지 못했다.
-
음성 에이전트 API 비용: 10분 통화에 $0.04~$0.57
STT $0.002-0.006/min, TTS 오디오 분당 $0.004-0.034, LLM 턴, GPT Realtime까지 모두 측정했다. Cascade와 음성 간 직접 변환의 통화당 비용을 비교한다.
-
DeepSeek V4 Pro GA vs Preview 실측: 추론량 18-62% 감소
동일 작업에서 deepseek-v4-pro-0813과 Preview 빌드를 비교했다. 추론 토큰은 18~62% 줄었고, 8,192토큰으로 고정된 폭주 현상이 확인됐으며, 이전의 '모르겠다' 응답은 사라졌다.
-
Gemini 3.7 Flash API 비용 측정: 3.6보다 작업당 2.5-8배 저렴
gemini-3.7-flash 출시 이틀째 측정 결과. 12월 31일까지 반값, 3.6보다 thinking 26-77% 감소, 비활성화 불가, prefill은 400. 작업 비용은 2.5-8배 줄었다.
-
이미지 1장은 몇 token일까? 15개 API에서 6~1,298
같은 64px 아이콘도 GPT-5.6에서는 6 token, ByteDance Seed에서는 1,298 token으로 계산된다. 세 가지 과금 방식과 실제 측정에서 어긋난 문서 규칙 3가지를 비교해, 이미지가 같아도 적용 요율에 따라 비용이 달라지는 구조를 분석했다.
-
LLM 사고 제어: 13개 모델의 수용, 무시, 강제 동작
13개 LLM API에서의 reasoning_effort와 thinking_budget: 세 개 벤더는 예산을 토큰 단위까지 엄격히 적용하고, 나머지는 조용히 무시하며, 16으로 설정한 상한이 97을 소모할 수 있습니다.
-
웹 검색 API와 웹 가져오기 API: 동작 방식과 $0.01의 비용
서버 측 웹 검색과 웹 가져오기의 과금 구조를 분석한다. 검색 1회당 $0.01가 부과되고, 검색 결과 token 1,500~3,100개는 선택한 모델의 입력 요율로 별도 계산된다. 두 번째 턴에서도 필요하면 웹을 다시 검색해 추가 비용이 발생할 수 있다.
-
Qwen-Image 3.0 API 실측: $0.03 한 장에 장면 9개
qwen-image-3.0 출시 당일 테스트 결과, 이미지당 0.03달러이며 5,000토큰 프롬프트도 별도 과금되지 않았다. 한 번에 9개 이미지를 만드는 9-in-1 기능은 실제로 작동했지만, 작은 글씨를 생성할 때는 철자 오류가 나타났다.
-
DeepSeek V4 Flash API 비용: thinking이 strict JSON을 망가뜨린다
출시 첫날 0731 측정 결과: $0.14/$0.28, 1,024-token cache page, 그리고 thinking과 strict json_schema 사용 시 13회 중 8회 정수가 깨지는 결함.
-
Qwen 3.8 Max API 요금: thinking을 끄는 것보다 나은 16 token
$2/$6 가격의 qwen3.8-max 출시 첫날 측정 결과를 정리했다. effort 설정은 실제로 추론 예산 상한으로 작동했으며, thinking을 끄면 정확도가 1/6로 급락했지만 16-token 설정으로 문제를 해결했다.
-
MCP 도구 오버헤드 측정: 26개면 호출당 $0.03
MCP 도구는 호출할 때마다 input token으로 다시 과금된다. Claude에서 소형 도구 하나는 401 token, GitHub 서버는 호출당 $0.03이며 모델군별로 최대 2.7배 차이 난다.
-
Prompt cache 쓰기 비용: 1.25x 할증은 언제 이득일까?
동일한 agent suite에서 premium 적용 시 RAG 비용은 6% 늘었지만 batch 비용은 83% 절감됐다. 실제 비용은 read:write 비율에 따라 달라지며, 청구서가 발행되기 전에 자신의 사용 패턴을 측정해 손익을 비교할 수 있다.
-
Claude Opus 5 vs Opus 4.8 실측 비교: 가격은 같지만 비용은 3배 차이
Opus 5와 Opus 4.8의 요금표는 $5/$25로 같지만, 기본 설정에서 동일한 작업을 처리한 Opus 5의 청구액은 3.1배였다. 추가 비용이 발생하는 지점과 격차를 없애는 설정을 살펴본다.
-
음성-텍스트 변환 API 14종 비교: 분당 $0.002부터 $0.016까지
하나의 게이트웨이에서 제공하는 음성-텍스트 변환 API 14종을 비교합니다. 분당 요금, streaming 지원 여부, token 과금 방식인 gpt-4o의 환산 비용, 다른 비교에서 빠지기 쉬운 중국 ASR 모델군을 다룹니다.
-
Gemini 3.6 Flash: 비용을 30배 바꾸는 Thinking 다이얼 실측
Gemini 3.6 Flash는 사용자에게 보이지 않는 reasoning에도 요금을 부과하며, 요청 설정 하나로 같은 작업의 비용이 최대 30배까지 달라진다. 5가지 작업 유형에서 직접 측정하고 주의점까지 확인했다.
-
Seedance API 가격 실측: 비디오 token 계산식 완전 분석
Seedance는 W×H×(24s+1)/1024로 비디오 token을 과금한다. token 단위까지 계산식을 검증했다. 720p는 1248×704로 과금되며, 4k는 단가가 낮아도 초당 비용은 2.1배 높다.
-
GPT-5.6 프롬프트 가이드: 비용이 1.5배와 10배가 되는 두 가지 기본값
GPT-5.6의 기본값은 비싸다. reasoning_effort를 생략하면 'none'보다 1.5배, 표시하지 않은 prefix는 캐시 읽기보다 10배 비싸다. 측정 결과를 바탕으로 요청 구조를 정리했다.
-
Kimi K3 API 요금 실측: '항상 켜지는' reasoning 끄기
Kimi K3 문서에는 reasoning을 끌 수 없다고 되어 있지만 reasoning_effort:'none'이 동작하며, 단순 질의 비용을 6분의 1로 줄인다. effort 단계, 캐시 하한선, 9개 언어별 요금을 실측했다.
-
GPT Realtime API 요금: 말하기가 듣기보다 4배 비싸다 (실측)
gpt-realtime-2.1은 듣기에 $0.019/min, 말하기에 $0.077/min이 청구된다. 무음은 무료이며, 캐시 재사용 비용은 1/80이다. 분당 실측 요금, 캐시 동작, 시나리오별 비용을 정리했다.
-
LLM 토큰 사용량: 4토큰 답변에 217토큰이 청구되는 이유
GPT-5.6, Claude Fable 5, Qwen3.7-max를 비롯한 8개 제품군을 측정해 보니 출력 비용의 대부분은 reasoning에서 발생했다. 모든 usage 필드를 해석하고 상한을 설정하는 방법을 설명한다.
-
프롬프트 캐시 최소 길이, 문서보다 실제로는 1.4~2.4배 길다
벤더가 공개한 프롬프트 캐시 최소 토큰 수를 여러 LLM 제품군에서 실측한 결과, 자동 캐시는 문서 기준보다 1.4~2.4배 더 긴 입력이 필요했다. 반면 Claude의 명시적 캐시는 공개된 최소 토큰 수와 정확히 일치했다.
-
GPT-5.6 비용 가이드: 프롬프트 캐싱 90% 할인과 Reasoning Effort
프롬프트 작성법이 아니라 비용에 관한 글이다(작성법은 'GPT-5.6 프롬프트 가이드' 참고). GPT-5.6의 두 가지 비용 조절 수단을 측정했다. 명시적 breakpoint를 사용하면 캐시된 입력에 정상 요금의 10%가 부과되며, reasoning_effort를 보내지 않으면 none으로 지정할 때보다 비용이 1.5배 높았다.
-
언어별로 가장 저렴한 LLM은? Tokenizer 비용 실측
유럽 언어는 GPT-5.5, 중국어는 Kimi, 일본어는 DeepSeek가 가장 적은 token을 청구했다. Claude Fable 5, Opus 4.8, Sonnet 5는 1.2-2.3x 더 많았다.
-
에이전트용 Claude Fable 5: Tool call 거부와 GLM 5.2 대비 비용
5가지 에이전트 워크로드에서 Claude Fable 5를 glm-5.2, opus-4-8, sonnet-5와 비교했다. Tool call 도중 발생하는 거부, adaptive thinking, 워크로드 형태에 따라 5-15배 달라지는 비용을 살펴본다.
-
LangChain 프롬프트 캐싱: 실제로 캐시에 적중하는 구성
LangChain에서 가장 편한 문법은 Claude의 프롬프트 캐시를 조용히 비활성화한다. content block의 cache_control, 변수 위치, usage 필드를 측정해 해결책을 확인했다.
-
Claude Sonnet 5의 새 토크나이저: 같은 prompt에서 token 41% 증가
Claude Sonnet 5의 새 토크나이저는 같은 텍스트를 Sonnet 4.6보다 약 41% 많은 token으로 계산하며, 이에 따라 gateway의 비용, 예산, cache 적용 조건이 달라집니다.
-
Agent 루프에서 GLM 5.2 Tool Call 쓰기: 'OpenAI 호환'이 감추는 차이
GLM 5.2는 OpenAI tool-calling API를 사용하지만, tool call과 함께 텍스트를 반환하고 같은 turn에 reasoning도 노출합니다. OpenAI 및 Anthropic과 어떤 차이가 있는지 비교합니다.
-
음성 텍스트 변환 API 비용: 같은 오디오로 7개 모델 비교
동일한 다국어 오디오 세트를 단일 게이트웨이에서 7개 음성 텍스트 변환 모델로 비교했다. 분당 비용은 최저 $0.0020에서 최고 $0.0164로 8배 이상 차이 났지만, 정확도는 모델 선택을 좌우하는 차별점이 아니었다.
-
이미지 생성 API 비용: 5개 모델 비교($0.006-$0.039)
같은 prompt로 5개 이미지 모델을 하나의 gateway에서 비교했다. 기본 설정 기준 이미지당 $0.006에서 $0.039였으며, 한 모델은 quality 설정에 따라 비용이 36배까지 달라졌다. 실측 결과다.
-
오픈 웨이트 LLM 캐싱: 왜 제공업체 선택에 따라 복불복이 되는가
오픈 웨이트 LLM의 프롬프트 캐싱은 추론 엔진에서 해결됐지만 요청 라우팅 과정에서 깨진다. DeepSeek, Qwen, Kimi를 직접 측정해 캐시 동작과 라우팅 영향을 비교하고, 전체 구조를 5개 레이어로 나눠 정리했다.
-
Claude Fable 5 캐싱: 계약은 그대로, 비용은 Opus 4.6의 2.9배
Claude Fable 5를 Synthorai에서 사용할 수 있습니다. prompt caching, TTL, tokenization, 비용을 Opus 4.6/4.8과 비교했습니다. 캐시 계약은 같고, tokenizer는 새로우며, 비용은 약 2.9배입니다.
-
Provider Drift: 기본 라우팅이 LLM 비용을 키우는 방식
멀티 Provider Gateway의 기본 라우팅에서는 동일한 요청이 각각 별도 캐시를 사용하는 여러 upstream으로 분산됩니다. 요청이 여러 캐시에 흩어져 캐시 적중률이 급락하고, 중복 처리와 호출 증가로 전체 비용이 상승합니다.
-
LLM 게이트웨이의 캐시 정보를 믿어도 될까? 5분 감사
게이트웨이는 캐시 적중으로 표시해도 전체 요금을 청구할 수 있습니다. 하나의 감사 스크립트로 DeepSeek의 자동 캐시와 Claude의 마커 기반 캐시를 5분 안에 각각 검증하고, 보고된 적중 여부와 실제 청구 비용의 불일치를 확인합니다.
-
Synthorai의 Claude Opus 4.8: 4.7/4.6과 캐싱 및 TTL 비교
Synthorai에서 Claude Opus 4.8을 사용할 수 있습니다. Opus 4.7/4.6과 prompt caching 및 TTL 동작을 비교 측정하고, 그대로 유지되는 부분과 다시 확인해야 할 tokenizer 변경을 정리했습니다.
-
용도별 최고의 LLM (2026): 채팅, RAG, 에이전트 비용 매트릭스
채팅, RAG, 에이전트별로 요구 성능을 충족하는 가장 저렴한 모델을 선택하세요. 15단계 에이전트 작업과 하루 10만 건 쿼리를 처리하는 RAG의 측정 기반 비용 추정치를 비교하고, 의사결정 매트릭스로 적합한 모델을 판단합니다.
-
Python으로 구현하는 LLM 프롬프트 캐싱: 실행 가능한 코드 튜토리얼
Synthorai의 OpenAI 호환 게이트웨이에서 Claude, GPT-5, Gemini 2.5, DeepSeek-v4, Qwen3의 프롬프트 캐시 절감 효과를 측정했습니다. 실제 usage.cost와 TTFT를 제공합니다.
-
어떤 LLM 프롬프트 캐시가 가장 저렴할까? 5개 제공업체 비교 (2026)
Claude, GPT-5.x, Gemini, DeepSeek, Qwen의 캐시 방식은 명시적 방식과 자동 방식, 5분과 1시간 TTL, 0.1x부터 0.5x까지의 읽기 요금 등 서로 다릅니다. 같은 조건에서 직접 측정해 비교했습니다.
-
LLM 프롬프트 캐싱의 원리: KV Cache와 TTL
LLM 프롬프트 캐싱의 실제 동작 원리를 설명합니다. K/V 재사용을 가능하게 하는 Transformer attention 연산, TTL을 결정하는 메모리와 연산량의 트레이드오프, 비용과 TTFT를 줄이는 이유를 다룹니다.
해당 주제의 글이 아직 없습니다.