← 블로그 · AI
Claude Haiku 5.5 — 토큰 가격, API 크레딧, 실무에서 맡길 일
#AI #Claude #Haiku 5.5 #Anthropic #API #Agent
유주환 · Founder, Full Stack Developer
토리스(Toris) · 발행
Anthropic이 2026년 10월 7일 Claude Haiku 5.5를 발표했다. 아카라이브에 올라온 소개 글을 계기로 공식 발표를 확인했다. 발표의 핵심은 처리량이 많고 비용에 민감한 작업을 더 빠르고 저렴하게 돌리는 것이다.
요약, 문맥 압축, 분류처럼 요청 하나는 작아도 반복 횟수가 많은 작업이 있다. 이런 작업에서는 모델의 최고 성능만큼 요청을 끝내는 시간과 누적 비용이 중요하다. Anthropic은 Haiku 5.5를 이 영역에 맞춘 모델로 소개하면서, 코딩 작업에서는 Opus 5.5와 Sonnet 5.5를 돕는 서브에이전트 역할을 강조했다.
이 글은 공식 발표의 가격과 성능 수치를 정리하고, 제품 개발에 어떻게 적용해 볼지 살펴본다. 아래 벤치마크는 Anthropic이 공개한 평가 결과이며, 토리스가 직접 모델을 실행해 측정한 결과는 아니다. 가격과 구독 혜택은 2026년 10월 8일 확인한 공식 발표 기준이다.
Haiku 5.5가 겨냥한 작업
공식 소개에 나오는 주요 용도는 다음과 같다.
- 긴 문서나 대화의 요약과 컴팩션: 이후 작업에 필요한 핵심 문맥을 남기는 일.
- 데이터베이스 쿼리와 분류 요청: 범위가 정해진 질문을 반복해서 처리하는 일.
- 코딩 보조 에이전트: 큰 모델이 맡은 작업에서 작은 하위 과제를 처리하는 일.
- 실시간 고객 지원과 브라우저 사용: 빠른 응답이 중요한 상호작용.
모델 ID는 claude-haiku-5-5다. 공식 발표는 Claude Platform과 AWS, Google Cloud, Microsoft Azure를 포함한 플랫폼에서 이용할 수 있다고 안내한다. 제공 환경을 옮길 때의 상세 변경 사항은 공식 마이그레이션 가이드에서 확인하면 된다.
Haiku 계열로는 처음으로 조절 가능한 effort 설정도 제공한다. 작업마다 비용과 추론 역량 사이의 균형을 선택할 수 있다는 뜻이다. 단순 분류와 여러 단계의 추론을 같은 설정으로 처리할 필요가 줄어든다. 다만 적절한 설정은 실제 입력과 품질 평가를 통해 정해야 한다.
속도에 관한 표현도 조건을 함께 읽어야 한다. Anthropic은 각 모델의 표준 속도 기준으로 Haiku 5.5를 자사의 가장 빠른 모델이라고 설명한다. 각주에서는 Fast Mode로 실행하는 Opus 모델보다는 느리다고 덧붙인다.
토큰 단가: 프롬프트 10만 토큰을 기준으로 두 구간
공식 발표의 가격표는 Haiku 5.5를 프롬프트 100,000토큰 이하와 초과로 나눈다. 아래 금액은 모두 100만 토큰당 미국 달러(USD) 기준이다.
| 항목 | Haiku 5.5 · 10만 이하 | Haiku 5.5 · 10만 초과 | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|---|
| 캐시 읽기 | $0.01 | $0.05 | $0.10 | $0.10 |
| 캐시 쓰기 | $0.125 | $0.625 | $1.25 | $2.50 |
| 입력 토큰 | $0.10 | $0.50 | $1.00 | $2.00 |
| 출력 토큰 | $0.50 | $2.50 | $5.00 | $10.00 |
표의 10만 토큰은 프롬프트 길이에 따른 가격 구간이다. 호출 비용을 계산할 때는 입력과 출력뿐 아니라 캐시 읽기·쓰기 사용량도 나눠 봐야 한다.
예를 들어 캐시를 사용하지 않는 요청에서 입력 20,000토큰, 출력 2,000토큰을 사용했다고 가정해 보자. 프롬프트가 10만 토큰 이하인 Haiku 5.5의 순수 입출력 토큰 비용은 다음과 같다.
입력: 20,000 / 1,000,000 × $0.10 = $0.002
출력: 2,000 / 1,000,000 × $0.50 = $0.001
합계: $0.003
같은 토큰 수를 Haiku 4.5 단가에 대입하면 $0.03이다. 이 가정에서는 토큰 비용이 90% 줄어든다. 도구 사용 등 별도 비용은 제외한 예시이며, 같은 글이나 작업을 두 모델에 맡겼을 때 실제 토큰 수가 같다는 뜻은 아니다.
평균 비용 75% 감소와 토큰 단가 90% 인하는 어떻게 다른가
Anthropic은 Haiku 5.5의 평균 운용 비용이 Haiku 4.5보다 약 75% 낮다고 설명한다. 이 수치를 모든 요청의 할인율로 적용하면 안 된다.
발표 각주에 따르면 단가는 프롬프트 10만 토큰 이하에서 90%, 초과에서는 50% 낮아졌다. 이전 Haiku 모델 요청의 약 90%가 10만 토큰 이하였으며, 평균 운용 비용 계산에는 토크나이저 변경에 따른 작업당 토큰 사용량 변화도 반영했다. Haiku 5.5는 같은 작업에 토큰을 조금 더 사용할 수 있다는 설명이다.
실제 예산을 잡을 때는 평균 절감률을 기존 청구액에 곱하기보다, 대표 작업에서 입력·출력·캐시 사용량과 재시도 횟수를 함께 측정하는 편이 정확하다.
벤치마크: 작은 작업의 후보가 넓어졌다
공식 발표에서 공개한 주요 지표를 옮기면 다음과 같다. 지식 업무 점수와 정답률은 서로 다른 척도이므로 같은 기준으로 비교하면 안 된다.
| 평가 | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 · 참고 |
|---|---|---|---|---|
| GDPval-AA v2.1 · 지식 업무 | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 · 지식 업무 | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1 · 오프라인 부분집합 | 72.4% | 15.7% | 48.9% | 83.9% |
| Humanity’s Last Exam · 도구 없음 | 45.9% | 10.2% | — | 56.9% |
| Humanity’s Last Exam · 도구 사용 | 57.4% | 18.7% | — | 64.5% |
| Terminal-Bench 4.0 · 에이전트 코딩 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 Main · 에이전트 코딩 | 46.4% | — | 42.4% | 52.1% · Xhigh |
| Chartography · 도구 없는 시각 추론 | 46.4% | 6.4% | 29.1% | 61.6% |
—는 공식 표에 값이 표시되지 않은 항목이다. OSWorld 결과는 오프라인 부분집합이며, FrontierCode의 Sonnet 5.5에는 Xhigh 조건이 표시되어 있다. 각 평가의 도구와 설정을 확인해야 하고, 특정 벤치마크의 우위를 모든 업무의 우위로 일반화할 수는 없다. 평가 방법의 상세 출처는 Haiku 5.5 시스템 카드다.
토리스 관점에서 먼저 눈에 들어오는 것은 지식 업무와 컴퓨터 사용 지표다. 문서를 읽고 필요한 정보를 골라내거나, 정해진 화면 흐름을 처리하는 작업의 후보가 넓어질 수 있기 때문이다.
코딩 지표도 함께 봐야 한다. Terminal-Bench 4.0에서 Haiku 5.5는 39.2%, Sonnet 5.5는 70.6%다. 공식 발표 역시 복잡하고 여러 단계로 이어지는 에이전트 코딩에는 Sonnet 5.5와 Opus 5.5가 더 나은 선택이라고 설명한다. 전체 기능 구현을 맡길 모델과, 파일 탐색·요약 같은 하위 과제를 맡길 모델을 나눠 평가할 이유가 있다.
Max·Team 구독자의 월간 API 크레딧
이번 발표에는 Claude Platform에서 사용할 월간 API 크레딧도 포함되어 있다.
| 구독 | 공식 발표의 월간 API 크레딧 |
|---|---|
| Claude Max 5x | $100 |
| Claude Max 20x | $200 |
| Claude Team | 최대 $500 · 소속 사용자 간 공유 |
Anthropic은 출시 주에 순차 적용한다고 밝혔다. Team의 최대 $500는 사용자마다 받는 금액이 아니라, 소속 사용자 전체가 공유하는 크레딧이다. 또한 이 혜택은 Haiku 전용이 아니라 Claude Platform의 어떤 모델에도 사용할 수 있다고 설명한다.
이 크레딧의 목적은 API를 호출하는 도구·앱·에이전트를 실험할 수 있게 하는 것이다. 구독 앱의 사용 한도와 API 크레딧은 구분해서 봐야 한다. 실제 계정의 적용 여부와 세부 이용 조건은 발표에 연결된 공식 Help Center 안내에서 확인해야 한다. 위 표는 발표 본문에 명시된 금액이며, 이월·유효기간 같은 별도 조건을 가정해 계산하지 않았다.
Sonnet 5.5의 캐시 읽기도 절반 가격으로
Sonnet 5.5의 캐시 읽기 가격은 100만 토큰당 $0.20에서 $0.10으로 인하됐다. Anthropic은 캐시 읽기가 토큰 소비에서 큰 비중을 차지해, 대부분의 에이전트 작업에서 Sonnet 5.5의 비용이 약 20% 줄어든다고 설명한다.
캐시 읽기 단가의 50% 인하와 전체 작업 비용의 약 20% 감소는 서로 다른 수치다. 캐시를 얼마나 활용하는지에 따라 실제 절감 폭도 달라진다. 같은 시스템 지침과 저장소 문맥을 반복해서 사용하는 코딩 흐름이라면, Haiku 도입과 함께 기존 Sonnet 호출의 캐시 사용량도 점검할 만하다.
제품 개발에서는 어디부터 시험해 볼까
1인 스튜디오에서 먼저 검토할 일은 모델을 한꺼번에 교체하는 것보다, 반복량이 많고 완료 조건이 분명한 작업을 고르는 것이다. 아래는 공식 발표를 바탕으로 한 도입 제안이며, 이미 적용해 측정한 운영 사례는 아니다.
| 맡길 작업 | 작은 모델이 반환할 결과 | 확인할 기준 |
|---|---|---|
| 저장소 탐색 | 관련 파일 경로와 근거가 되는 코드 위치 | 실제 파일·코드와 일치하는가 |
| 고객 문의 분류 | 분류값, 요약, 담당자에게 전달할 쟁점 | 중요한 문의를 잘못 분류하지 않는가 |
| 문서·대화 요약 | 결정, 미해결 사항, 다음 행동 | 날짜·수치·출처가 보존되는가 |
| 코딩 보조 조사 | 수정 후보와 예상 영향 | 큰 모델이나 사람이 검토할 근거가 충분한가 |
예를 들어 큰 모델이 기능 구현을 진행하는 동안 Haiku가 관련 파일이나 문서에서 근거를 수집하게 할 수 있다. 이때 하위 작업의 결과 형식과 완료 조건을 미리 정하면, 빠른 응답이 실제 작업 시간 절감으로 이어지는지 평가하기 쉽다.
평가에는 정답률, 완료 시간, 호출 비용, 재시도 비용을 함께 넣는 것이 좋다. 토큰 단가가 낮아도 잘못된 결과를 수정하느라 큰 모델을 더 자주 호출하면 이점이 줄어든다. 데이터베이스나 브라우저를 다루는 작업에서는 모델 선택과 함께 접근 범위와 결과 검증도 설계해야 한다.
이 관점은 앞서 정리한 하네스 엔지니어링과 이어진다. 모델에 적합한 일을 배정하고, 필요한 문맥과 도구를 제공하며, 결과를 확인하는 구조가 있어야 가격 변화가 제품의 운영 비용 변화로 연결된다.
이번 발표를 보고 남긴 판단
Haiku 5.5에서 주목할 변화는 반복 작업에 작은 모델을 배치할 경제적 여유가 커졌다는 것이다. 10만 토큰 이하 구간의 낮은 단가, 조절 가능한 effort, 서브에이전트 용도가 함께 제시됐다. Sonnet 캐시 읽기 인하와 구독자의 API 크레딧까지 더해져, 작은 실험을 시작할 근거도 늘었다.
도입을 검토한다면 대표 작업 몇 개를 고르고 기존 모델과 같은 입력·완료 기준으로 비교하는 것부터 시작할 수 있다. 품질이 유지되는 범위에서 완료 시간과 전체 비용이 얼마나 달라지는지 확인하는 것이 첫 단계다. 복잡한 코딩 작업에서는 큰 모델의 강점을 유지하면서, 반복되는 하위 과제를 Haiku에 맡길 수 있는지부터 살펴볼 만하다.
참고 자료
- Anthropic — Introducing Claude Haiku 5.5: 발표일, 용도, 성능표, 토큰 가격, API 크레딧과 비용 계산 각주의 기준 자료.
- 아카라이브 — Claude Haiku 5.5를 소개합니다: 이 글을 쓰게 된 계기인 한국어 소개·번역 글. 가격과 수치는 Anthropic 원문을 기준으로 대조했다.
관련 글: Claude Code 동향 · AI 코딩 에이전트 2026 개요
READERS / LIVE