요약
앤트로픽이 Haiku 4.5보다 평균 75% 싸고 더 똑똑한 소형 모델 Claude Haiku 5.5를 내놓았습니다.
앤트로픽은 요약·분류처럼 양이 많고 비용에 민감한 작업과, 고객 상담·브라우저 사용처럼 속도가 중요한 작업을 겨냥했다고 밝혔습니다. Haiku급 모델로는 처음으로 추론 강도(답하기 전에 얼마나 깊이 생각할지 정하는 값)를 조절할 수 있습니다.
왜 중요한가
- 큰 일은 Opus 5.5나 Sonnet 5.5가 맡고 잔일은 Haiku 5.5 서브에이전트(하위 작업을 넘겨받는 보조 에이전트)에 넘기는 구성을 앤트로픽이 직접 권합니다.
- 작은 모델의 약점이던 컴퓨터 조작 능력이 크게 올라, 브라우저 자동화를 싼 모델로 돌릴 길이 열렸습니다.
핵심 내용
- 10만 토큰 이하 요청은 Haiku 4.5보다 90%, 그보다 긴 요청은 50% 싸게 값을 매겼습니다.
- 이 기준에서 입력 토큰은 100만 개당 0.10달러, 출력 토큰은 0.50달러입니다.
- 컴퓨터 사용 평가 OSWorld 2.1에서 72.4%를 기록해 Haiku 4.5(15.7%)와 GPT-6 Luna(48.9%)를 크게 앞섰습니다.
- 복잡한 에이전트 코딩에는 여전히 Sonnet 5.5나 Opus 5.5가 낫다고 앤트로픽 스스로 밝혔습니다.
- Sonnet 5.5의 캐시 읽기 가격도 절반으로 내렸습니다.
HN 반응
- 사이먼 윌리슨의 펠리컨 그림 테스트에서 low를 뺀 모든 추론 강도가 자전거를 제대로 그려, 1년 전 Haiku 4.5보다 크게 나아졌다는 평가가 나왔습니다.
- 모델이 이미 이 테스트를 알고 있으니 새 시험이 필요하다는 지적과, 안다고 그림이 나아지지는 않는다는 반론이 맞섰습니다.
가격 책정이... 좀 이상하네요.
10만 토큰은 기준선치고 말도 안 되게 낮은 데다, Sonnet이나 Opus가 아니라 Haiku에만 적용됩니다. 에이전트로 뭔가를 하면 금세 넘어가 버릴 만큼 낮은 기준이에요. 일반적인 생성 작업이나 Jev 같은 분류기라면 가성비가 좋고, 기사에서 말하듯 Haiku 사용의 대다수가 그런 용도인 모양이긴 합니다.
어느 쪽이든 Haiku 4.5의 입력 $1 / 출력 $5보다는 훨씬 싸고, 이 가격이면 GPT-6 Luna와 제대로 경쟁이 됩니다. (입력 $0.10 / 출력 $0.50이면서 토큰 기준선이 없습니다 [수정: Luna의 기준선은 27만 2천 토큰이라고 합니다])
Haiku 5.5는 GPT-6 Luna보다 눈에 띄게 똑똑합니다. 그러니 이런 가격 전략이 이해가 가요.
앤트로픽에는 한동안 요약, 컴팩팅, RAG 보조 같은 작업에 쓸 가성비 좋은 "저렴한" LLM이 없었습니다.
이런 '일회성' 작업은 대개 10만 토큰 미만이거나, 10만 토큰 아래로 맞추도록 구조를 짤 수 있습니다.
일부 코딩 벤치마크에서는 Haiku 5.5가 Sonnet 5를 이깁니다! (특히 구현 쪽에서요. 잘 정의된 Jira 티켓 처리 같은 일입니다.) 불과 몇 달 사이에 달러당 지능이 이만큼 늘었다는 게 정말 인상적입니다.
다른 댓글에도 썼는데, Artificial Analysis 자료를 보면 Haiku를 max로 돌릴 때 작업당 비용이 Sol을 medium으로 돌릴 때와 거의 같고, 후자가 훨씬 더 똑똑합니다. (Haiku 추론이 더 빠르다고 해도 Sol이 작업을 더 빨리 끝낼 거라고 봅니다.) 그러니 Haiku는 낮은 추론 수준에서만 의미가 있고, 그것도 비용 효율보다 지능과 속도를 더 중시할 때만입니다. 비용 효율은 지금 Luna가 압도하고 있고요. 중국 모델은 끼워 넣지도 않은 얘기입니다.
눈에 띄게 똑똑한지는 실제로 써 봐야 알 수 있죠. 지금은 10만 토큰 미만 구간에서 Haiku가 Luna보다 조금 더 비쌉니다. 그런데 저는 10만 토큰 아래로 끝나는 에이전트 작업이 하나도 없어서, 이 차트에 나온 것보다 5배는 더 비싸질 겁니다. 경쟁력이 있다고 보기 어렵네요...
아닌데요? 이런 하위 모델은 작고 명확한 작업에 쓰고, 최상위 모델이 지휘하는 식으로 쓰면 되잖아요? 저는 이 방식이 아주 잘 맞고 10만 토큰 아래로 유지하는 데도 문제가 없습니다. 더 싼지는 모르겠지만 QA 같은 작업은 확실히 훨씬 빠릅니다.
오픈 웨이트 모델들이 저 멀리서 가볍게 경례를 보내고 있네요.
네, 기사의 비교 대상에 MiMo와 DeepSeek이 빠져 있는 게 이상했어요...
GLM 5.3 Flash도요.
저는 그건 아직 많이 써 보지 못했습니다. GLM 5.3은 자주 쓰는데, 특히 Coralbricks와 함께 씁니다. 캐시 읽기가 무료라서 이어지는 턴에서 비용 걱정 없이 마음껏 생각하게 둘 수 있습니다. 버그 사냥, 기획, 보안 작업에 정말 좋습니다.
Flash를 한번 써 봐야겠네요...
Mimo는 좋은가요? 써 본 적은 없는데, 이 서브스레드에서만 벌써 세 번이나 언급된 걸 봤어요. 저는 DSv4.1을 주력으로 쓰고 있습니다.
저는 탐색과 리서치에는 Mimo 2.6 flash를, 구현에는 glm 5.3 flash를 쓰는 쪽으로 정리하고 있습니다. 지금까지는 결과에 꽤 만족하지만 mimo는 상당히 느릴 수 있습니다. 속도가 문제일 때는 그냥 glm 5.3 flash로 바꿉니다.
컨텍스트가 길어질수록 느려지고, 그것도 엄청나게 느려집니다. 그것만 빼면 꽤 좋습니다.
그렇게 이상한 일은 아니에요. 앤트로픽에 돈을 낼 생각을 하는 회사 대부분은 중국 모델을 대안으로 고려하지 않을 겁니다. 존재 자체를 모르는 회사도 많고요.
문제는 이겁니다. SOTA에 근접한 값싼 중국 모델이 나와 있으니 OAI와 앤트로픽이 초고가 SOTA LLM에만 매달리지 못하고 가격을 내리고 더 효율적인 모델을 내놓을 수밖에 없다는 거죠.
그럴까요? 저는 중국 모델보다는 두 회사 모두 IPO를 앞두고 고객을 끌어모으려는 경쟁 때문이라고 봅니다.
저희는 개발자들을 폐쇄형 모델에서 오픈 모델로 옮길 준비를 적극적으로 하고 있습니다. 일화 하나로 참고하세요.
그래도 업계의 흐름은 이미 분명하죠.
맞아요. 저희도 몇 주 전에 그렇게 했습니다. 제가 이야기를 나눠 본 EU 스타트업 생태계 사람들은 다들 같은 일을 하고 있거나 고민하고 있어요.
OpenRouter나 OpenCode 같은 제공자들만 봐도 올여름 이후 쏠림이 얼마나 컸는지 알 수 있어요... 아니면 그 뒤로 빅 AI가 오픈 웨이트를 두고 퍼뜨린 공포 마케팅을 보든가요.
여기 '미국'이 나머지 세계를 대하는 꼴을 보면 EU가 그쪽으로 가는 것도 놀랍지 않습니다.
지금은 일상 업무에서 의미 있는 차이가 없어요.
"회사"는 의미 없는 기준입니다.
현실 세계 회사의 99%를 기준으로 말하자면, 다들 어차피 Gemini나 Copilot을 씁니다. 바이브 코딩으로 GTA 6를 만들 때 벤치마크에서 소수점 몇 자리 이득이 난다는 이유로, 마이크로소프트나 구글, 아마존과 오랜 거래 관계가 있는 회사가 법무와 구매 절차를 거쳐 수상한 실리콘밸리 스타트업의 모델을 들여오지는 않아요.
저는 "앤트로픽에 돈을 낼 생각을 하는 회사 대부분"이라고 했지, "회사 대부분"이라고 하지 않았습니다. 그리고 "아무도" 안 한다는 말에도 동의하지 않아요. 반대되는 일화가 저한테는 많습니다. 말씀하신 대로 과반의 회사가 손쉬운 Copilot이나 Gemini를 쓰고 있을지는 몰라도, 99%에는 한참 못 미칩니다.
아니요, 99%예요. 이 얘기로 제가 말해 본 회사는 말 그대로 전부 MS Teams의 Copilot만 쓰고 있었어요 ㅋㅋ 다들 가장 기본적인 형태의 AI만 쓰고 있다고요.
앤트로픽이 뭔지도 모르고 그냥 "AI"라고만 생각해요. 참고로 이 중에는 세계 최대급 전력 시스템 설계 회사도 있는데, 데이터센터를 많이 짓는 걸 도와주는 곳이에요... 거기도 MS Copilot만 씁니다.
회사가 얼마나 많은지 아세요? 그런 일화는 전혀 쓸모가 없습니다.
그럼 그 일화에 두 건 더 보태 드리죠. 제가 아는 회사 두 곳은 평직원들이 접하는 게 Copilot뿐입니다.
네, 놀랍지 않네요.
음, 전 세계 소프트웨어 매출 전체를 찾아보고 OpenAI와 비교해 보세요. 아주 작습니다. 컨설팅 같은 몇몇 예외 분야를 빼면, 소프트웨어 엔지니어링과 그 주변 분야 밖에서 SOTA 모델에 돈을 내는 곳은 없어요. 모든 분야에 쓰는 기술자들이 있긴 하지만, 회사 차원은 아닙니다.
회사 전체로 보면 기술 회사를 빼고는 이 기술에 관심이 없고, 도입 정도도 CRM과는 비교조차 안 됩니다. AI가 들어간 SaaS 제품을 사는 회사는 있겠지만 대부분은 앤트로픽 구독을 사지 않아요 ㅋㅋ
GTA 6를 바이브 코딩한다니 ㅋㅋ
토크나이저 효율 차이도 있습니다. 최신 Claude의 10만 토큰은 최신 GPT 토큰으로 대략 6만~6만 5천 개 정도라서, 실제로는 Luna의 기준선이 Haiku보다 훨씬 더 멀리 있습니다.
Anthropic의 count_tokens 엔드포인트나 https://crates.io/crates/tokwc 로 테스트해 볼 수 있어요.
(> ...이 토크나이저에서는 같은 입력 텍스트가 Claude Haiku 4.5보다 Claude Haiku 5.5에서 약 30% 더 많은 토큰을 만듭니다.)
그러면 오히려 더 나쁠 수도 있겠네요.
아니에요, Haiku 4.5가 워낙 오래돼서 Claude 4.7부터 바뀐 새 Claude 토크나이저 이전 모델이라 그런 것뿐입니다.
사실 지금의 토큰당 정액 가격이 오히려 이상한 겁니다.
인코딩도 디코딩도 연산량이 선형이 아니라서, 제공자는 평균적으로 예상되는 길이를 기준으로 가격을 매겨야 합니다.
이건 토큰 생성의 실제 비용에 더 가까워지는 것일 뿐입니다.