엔지니어링 블로그
LLM API 게이트웨이를 구축하며 마주친 실제 엔지니어링 문제들.
GLM 5.2 Reasoning Effort: 비용을 20배 줄이는 설정, 직접 측정해 봤다
같은 코딩 답변도 reasoning effort를 제대로 설정하면 $0.0031, GLM 5.2의 무제한 기본값에서는 $0.062가 든다. 비용은 20배 낮고 속도는 30배 빠르다. 작업별 설정 방법을 알아본다.
Claude Fable 5는 ZDR에서 사용할 수 없다: 30일 보관 의무
ZDR 조직에서 claude-fable-5를 호출하면 400 오류가 발생한다. Claude API, Bedrock, Vertex, Foundry 모두 예외가 없다. HIPAA/COPPA에 미치는 영향과 라우팅 해결책을 정리했다.
LLM 프롬프트 캐싱 완벽 가이드 2026: 입력 비용 50-90% 절감
Claude, GPT, Gemini, DeepSeek의 프롬프트 캐싱 동작 원리와 입력 비용 50-90%, TTFT 3-10배 개선 방법. 아키텍처, 제공업체 비교, Python 코드까지 다룹니다.
-
Claude Opus 5 vs Opus 4.8 실측 비교: 가격은 같지만 비용은 3배 차이
Opus 5와 Opus 4.8의 요금표는 $5/$25로 같지만, 기본 설정에서 동일한 작업을 처리한 Opus 5의 청구액은 3.1배였다. 추가 비용이 발생하는 지점과 격차를 없애는 설정을 살펴본다.
-
음성-텍스트 변환 API 14종 비교: 분당 $0.002부터 $0.016까지
하나의 게이트웨이에서 제공하는 음성-텍스트 변환 API 14종을 비교합니다. 분당 요금, streaming 지원 여부, token 과금 방식인 gpt-4o의 환산 비용, 다른 비교에서 빠지기 쉬운 중국 ASR 모델군을 다룹니다.
-
Gemini 3.6 Flash: 비용을 30배 바꾸는 Thinking 다이얼 실측
Gemini 3.6 Flash는 사용자에게 보이지 않는 reasoning에도 요금을 부과하며, 요청 설정 하나로 같은 작업의 비용이 최대 30배까지 달라진다. 5가지 작업 유형에서 직접 측정하고 주의점까지 확인했다.
-
Seedance API 가격 실측: 비디오 token 계산식 완전 분석
Seedance는 W×H×(24s+1)/1024로 비디오 token을 과금한다. token 단위까지 계산식을 검증했다. 720p는 1248×704로 과금되며, 4k는 단가가 낮아도 초당 비용은 2.1배 높다.
-
GPT-5.6 프롬프팅 가이드: 비용이 1.5배와 10배가 되는 두 가지 기본값
GPT-5.6의 기본값은 비싸다. reasoning_effort를 생략하면 'none'보다 1.5배, 표시하지 않은 prefix는 캐시 읽기보다 10배 비싸다. 측정 결과를 바탕으로 요청 구조를 정리했다.
-
Kimi K3 API 요금 실측: '항상 켜지는' reasoning 끄기
Kimi K3 문서에는 reasoning을 끌 수 없다고 되어 있지만 reasoning_effort:'none'이 동작하며, 단순 질의 비용을 6분의 1로 줄인다. effort 단계, 캐시 하한선, 9개 언어별 요금을 실측했다.
-
GPT Realtime API 요금: 말하기가 듣기보다 4배 비싸다 (실측)
gpt-realtime-2.1은 듣기에 $0.019/min, 말하기에 $0.077/min이 청구된다. 무음은 무료이며, 캐시 재사용 비용은 1/80이다. 분당 실측 요금, 캐시 동작, 시나리오별 비용을 정리했다.
-
LLM 토큰 사용량: 4토큰 답변에 217토큰이 청구되는 이유
GPT-5.6, Claude Fable 5, Qwen3.7-max를 비롯한 8개 제품군을 측정해 보니 출력 비용의 대부분은 reasoning에서 발생했다. 모든 usage 필드를 해석하고 상한을 설정하는 방법을 설명한다.
-
프롬프트 캐시 최소 길이, 문서보다 실제로는 1.4~2.4배 길다
벤더가 공개한 프롬프트 캐시 최소 토큰 수를 여러 LLM 제품군에서 실측한 결과, 자동 캐시는 문서 기준보다 1.4~2.4배 더 긴 입력이 필요했다. 반면 Claude의 명시적 캐시는 공개된 최소 토큰 수와 정확히 일치했다.
-
GPT-5.6 비용 가이드: 프롬프트 캐싱 90% 할인과 Reasoning Effort
GPT-5.6의 두 가지 비용 조절 수단을 측정했다. 명시적 breakpoint를 사용하면 캐시된 입력에 정상 요금의 10%가 부과되며, reasoning_effort를 보내지 않으면 none으로 지정할 때보다 비용이 1.5배 높았다.
-
언어별로 가장 저렴한 LLM은? Tokenizer 비용 실측
유럽 언어는 GPT-5.5, 중국어는 Kimi, 일본어는 DeepSeek가 가장 적은 token을 청구했다. Claude Fable 5, Opus 4.8, Sonnet 5는 1.2-2.3x 더 많았다.
-
에이전트용 Claude Fable 5: Tool call 거부와 GLM 5.2 대비 비용
5가지 에이전트 워크로드에서 Claude Fable 5를 glm-5.2, opus-4-8, sonnet-5와 비교했다. Tool call 도중 발생하는 거부, adaptive thinking, 워크로드 형태에 따라 5-15배 달라지는 비용을 살펴본다.
-
LangChain 프롬프트 캐싱: 실제로 캐시에 적중하는 구성
LangChain에서 가장 편한 문법은 Claude의 프롬프트 캐시를 조용히 비활성화한다. content block의 cache_control, 변수 위치, usage 필드를 측정해 해결책을 확인했다.
-
Claude Sonnet 5의 새 토크나이저: 같은 prompt에서 token 41% 증가
Claude Sonnet 5의 새 토크나이저는 같은 텍스트를 Sonnet 4.6보다 약 41% 많은 token으로 계산하며, 이에 따라 gateway의 비용, 예산, cache 적용 조건이 달라집니다.
-
Agent 루프에서 GLM 5.2 Tool Call 쓰기: 'OpenAI 호환'이 감추는 차이
GLM 5.2는 OpenAI tool-calling API를 사용하지만, tool call과 함께 텍스트를 반환하고 같은 turn에 reasoning도 노출합니다. OpenAI 및 Anthropic과 어떤 차이가 있는지 비교합니다.
-
음성 텍스트 변환 API 비용: 같은 오디오로 7개 모델 비교
동일한 다국어 오디오 세트를 단일 게이트웨이에서 7개 음성 텍스트 변환 모델로 비교했다. 분당 비용은 최저 $0.0020에서 최고 $0.0164로 8배 이상 차이 났지만, 정확도는 모델 선택을 좌우하는 차별점이 아니었다.
-
이미지 생성 API 비용: 5개 모델 비교($0.006–$0.039)
같은 prompt로 5개 이미지 모델을 하나의 gateway에서 비교했다. 기본 설정 기준 이미지당 $0.006에서 $0.039였으며, 한 모델은 quality 설정에 따라 비용이 36배까지 달라졌다. 실측 결과다.
-
오픈 웨이트 LLM 캐싱: 왜 제공업체 선택에 따라 복불복이 되는가
오픈 웨이트 LLM의 프롬프트 캐싱은 추론 엔진에서 해결됐지만 요청 라우팅 과정에서 깨진다. DeepSeek, Qwen, Kimi를 직접 측정해 캐시 동작과 라우팅 영향을 비교하고, 전체 구조를 5개 레이어로 나눠 정리했다.
-
Claude Fable 5 캐싱: 계약은 그대로, 비용은 Opus 4.6의 2.9배
Claude Fable 5를 Synthorai에서 사용할 수 있습니다. prompt caching, TTL, tokenization, 비용을 Opus 4.6/4.8과 비교했습니다. 캐시 계약은 같고, tokenizer는 새로우며, 비용은 약 2.9배입니다.
-
Provider Drift: 기본 라우팅이 LLM 비용을 키우는 방식
멀티 Provider Gateway의 기본 라우팅에서는 동일한 요청이 각각 별도 캐시를 사용하는 여러 upstream으로 분산됩니다. 요청이 여러 캐시에 흩어져 캐시 적중률이 급락하고, 중복 처리와 호출 증가로 전체 비용이 상승합니다.
-
LLM 게이트웨이의 캐시 정보를 믿어도 될까? 5분 감사
게이트웨이는 캐시 적중으로 표시해도 전체 요금을 청구할 수 있습니다. 하나의 감사 스크립트로 DeepSeek의 자동 캐시와 Claude의 마커 기반 캐시를 5분 안에 각각 검증하고, 보고된 적중 여부와 실제 청구 비용의 불일치를 확인합니다.
-
Synthorai의 Claude Opus 4.8: 4.7/4.6과 캐싱 및 TTL 비교
Synthorai에서 Claude Opus 4.8을 사용할 수 있습니다. Opus 4.7/4.6과 prompt caching 및 TTL 동작을 비교 측정하고, 그대로 유지되는 부분과 다시 확인해야 할 tokenizer 변경을 정리했습니다.
-
용도별 최고의 LLM (2026): 채팅, RAG, 에이전트 비용 매트릭스
채팅, RAG, 에이전트별로 요구 성능을 충족하는 가장 저렴한 모델을 선택하세요. 15단계 에이전트 작업과 하루 10만 건 쿼리를 처리하는 RAG의 측정 기반 비용 추정치를 비교하고, 의사결정 매트릭스로 적합한 모델을 판단합니다.
-
Python으로 구현하는 LLM 프롬프트 캐싱: 실행 가능한 코드 튜토리얼
Synthorai의 OpenAI 호환 게이트웨이에서 Claude, GPT-5, Gemini 2.5, DeepSeek-v4, Qwen3의 프롬프트 캐시 절감 효과를 측정했습니다. 실제 usage.cost와 TTFT를 제공합니다.
-
어떤 LLM 프롬프트 캐시가 가장 저렴할까? 5개 제공업체 비교 (2026)
Claude, GPT-5.x, Gemini, DeepSeek, Qwen의 캐시 방식은 명시적 방식과 자동 방식, 5분과 1시간 TTL, 0.1x부터 0.5x까지의 읽기 요금 등 서로 다릅니다. 같은 조건에서 직접 측정해 비교했습니다.
-
LLM 프롬프트 캐싱의 원리: KV Cache와 TTL
LLM 프롬프트 캐싱의 실제 동작 원리를 설명합니다. K/V 재사용을 가능하게 하는 Transformer attention 연산, TTL을 결정하는 메모리와 연산량의 트레이드오프, 비용과 TTFT를 줄이는 이유를 다룹니다.