요약:
Anthropic은 Claude 5.5 시리즈의 세 번째 모델인 Claude Haiku 5.5를 공식 출시했으며, Claude Haiku 4.5 이후 거의 1년 만에 출시된 차세대 Haiku 모델입니다. Anthropic은 이를 높은 동시성, 낮은 대기 시간 및 비용에 민감한 작업을 위한 경량 모델로 포지셔닝하고 API 가격을 크게 낮춤으로써 Haiku 5.5는 현재 저비용 AI 모델의 경쟁 순위에 직접 진입합니다.

Anthropic이 발표한 가격에 따르면 100,000개 토큰 이내의 요청에 대해 Claude Haiku 5.5의 입력 가격은 백만 토큰당 US$0.10이고 출력 가격은 백만 토큰당 US$0.50입니다. 이전 세대 하이쿠 4.5 가격이 각각 1달러, 5달러였던 것에 비해 책 가격은 90% 직접적으로 인하됐다.
요청이 토큰 100,000개를 초과하면 Haiku 5.5의 가격이 크게 인상되어 입력 및 출력 가격이 각각 토큰 100만 개당 미화 0.50달러 및 미화 2.50달러로 인상됩니다. 즉, 100,000개의 토큰이라는 임계값을 초과하면 입력 및 출력 가격이 기본 가격의 5배가 됩니다.
Anthropic은 실제 작업 부하 계산을 기준으로 Haiku 5.5의 평균 운영 비용이 Haiku 4.5보다 약 75% 낮다고 밝혔습니다. 평균 하락폭이 광고 가격의 90%에 도달하지 못한 중요한 이유 중 하나는 Haiku 5.5가 새로운 단어 분할기를 사용하기 때문입니다.
새로운 토크나이저는 Claude Sonnet 5.5 및 Opus 5.5에서 사용하는 토큰화 방법과 유사합니다. Haiku 5.5에서는 동일한 텍스트 조각이 더 많은 토큰으로 계산될 수 있습니다. Anthropic의 자체 지침에 따르면 새로운 단어 분할 방법은 동일한 작업을 완료할 때 생성되는 토큰의 수를 약간 증가시킵니다. 일부 실제 테스트에서는 동일한 긴 텍스트가 Haiku 4.5보다 Haiku 5.5에서 약 25%~30% 더 많은 토큰을 소비할 수 있는 것으로 나타났습니다.
이는 Haiku 5.5에 쉽게 간과될 수 있는 '숨겨진 비용'이 있다는 것을 의미합니다. 백만 개의 토큰당 가격이 크게 떨어졌지만 사용자가 지불하는 실제 수수료는 모델이 작업을 완료하기 위해 소비하는 토큰 수에 따라 달라집니다. 따라서 단순히 백만 개의 토큰당 가격을 비교하는 것만으로는 두 세대 모델의 실제 운영 비용을 완전히 반영할 수 없습니다.
Haiku 5.5는 여전히 최대 100만 개의 토큰을 지원하는 매우 큰 컨텍스트 창을 갖고 있으며 최대 출력 길이는 128,000개 토큰에 이릅니다. 또한 작업의 복잡성에 따라 얼마나 많은 추론 자원을 투자해야 하는지 동적으로 결정할 수 있는 적응적 사고 기능을 지원합니다.
Anthropic은 Haiku 5.5의 초점이 모든 복잡한 작업에 대해 Opus 5.5 또는 Sonnet 5.5와 경쟁하는 것이 아니라 다수의 고주파수, 반복적, 응답 속도에 민감한 작업을 수행하는 것임을 강조했습니다. 예를 들어 텍스트 요약, 데이터 분류, 정보 추출, 데이터베이스 쿼리, 요청 라우팅, 컨텍스트 압축 등은 모두 Haiku 5.5에 적합한 애플리케이션 시나리오입니다.
AI 에이전트 분야에서는 하이쿠 5.5도 대형 모델의 보조 모델로 설계됐다. Anthropic은 개발자가 Sonnet 5.5 또는 Opus 5.5가 복잡한 주요 작업을 담당하도록 하고 Haiku 5.5가 다수의 단순 반복 작업을 처리하는 하위 에이전트 역할을 하여 전체 에이전트 시스템의 운영 비용을 절감할 수 있도록 권장합니다.

코드 개발 역시 Haiku 5.5의 중요한 적용 방향 중 하나입니다. Anthropic은 이 모델을 대규모 Claude 모델의 코딩 하위 에이전트로 사용하여 코드 검색, 간단한 수정 및 분할될 수 있는 기타 반복 작업을 처리할 수 있다고 말했습니다. 그러나 복잡한 다단계 에이전트 프로그래밍 작업에서 Sonnet 5.5 및 Opus 5.5는 여전히 더 확실한 이점을 가지고 있습니다.
속도는 Haiku 5.5의 또 다른 큰 장점입니다. Anthropic은 이것이 회사에서 가장 반응이 빠른 모델이므로 실시간 고객 서비스, 브라우저 운영 및 빠른 피드백이 필요한 애플리케이션에 특히 적합하다고 말합니다.
Anthropic은 Haiku 5.5 자체의 가격을 낮추는 것 외에도 Claude Sonnet 5.5의 캐시 읽기 가격도 동시에 조정했습니다. 캐시 읽기 수수료는 백만 토큰당 US$0.20에서 US$0.10으로 50% 감소합니다. Anthropic은 에이전트 작업이 캐시 콘텐츠를 반복적으로 읽는 경우가 많기 때문에 이러한 변경으로 대부분의 에이전트 작업 부하에서 Sonnet 5.5의 실제 비용을 약 20% 줄일 수 있다고 믿습니다.
하지만 Haiku 5.5의 가장 흥미로운 점은 저가 모델과의 경쟁입니다. 100,000개 미만의 토큰 표준 가격을 기준으로 Haiku 5.5는 이미 OpenAI의 최신 저가 모델과 동일한 가격대에 있습니다. 이는 개발자가 이제 수백만 개의 토큰으로 구성된 컨텍스트 창, 적응형 추론 지원 및 강력한 코딩 기능을 매우 저렴한 토큰 가격으로 갖춘 모델을 얻을 수 있음을 의미합니다.
한편, 토큰 100,000개의 가격 구분선은 개발자가 특별한 주의를 기울여야 할 문제가 될 수도 있습니다. 일반적인 짧은 텍스트 요청의 경우 이 임계값은 일반적으로 영향을 미치지 않습니다. 그러나 긴 문서 처리, 복잡한 에이전트, 여러 라운드의 코드 작업 및 동시에 많은 양의 컨텍스트 입력이 관련된 시나리오의 경우 모델은 쉽게 토큰 100,000개에 접근하거나 초과할 수도 있습니다. 이 한도를 초과하면 입력 및 출력 가격이 모두 5배로 직접 증가합니다.
이로 인해 토큰 효율성 자체가 점점 더 중요해지고 있습니다. AI 모델의 가격이 계속 하락함에 따라, 이전에는 "백만 개 토큰당 비용이 얼마나 되는지"에만 집중해야 했던 개발자들은 이제 동일한 작업을 완료하기 위해 모델이 소비하는 토큰 수도 고려해야 합니다. 단가는 낮지만 작업을 완료하기 위해 더 많은 토큰을 생성해야 하는 모델의 경우 실제 최종 비용이 항상 낮을 수는 없습니다.
Anthropic은 현재 Claude 플랫폼과 Amazon Web Services, Google Cloud, Microsoft Foundry 등의 채널에서 Haiku 5.5를 제공하고 있으며 Claude Code에도 추가했습니다. 일반 사용자는 Claude의 웹페이지, iOS 및 Android 앱에서 Haiku 5.5를 사용할 수 있습니다.
Claude 5.5 제품 라인 전체를 살펴보면 Anthropic은 상대적으로 명확한 업무 구분을 형성했습니다. Opus 5.5는 가장 복잡한 추론 및 에이전트 작업을 담당하고 Sonnet 5.5는 성능과 비용 간의 균형을 담당하며 Haiku 5.5는 높은 동시성, 낮은 대기 시간 및 저비용 시나리오에 더욱 중점을 둡니다.
따라서 하이쿠 5.5의 진정한 경쟁력은 단순한 '저렴함'이 아니라, 더 낮은 단가를 활용해 강력한 추론력과 에이전트 역량을 갖춘 모델을 대규모 통화 시나리오에 밀어넣으려는 앤트로픽의 시도다. 그러나 새로운 토큰 측정 방법과 100,000개 토큰 이후의 가격 급등은 기업이 단지 백만 개의 토큰당 광고된 가격을 보는 것이 아니라 배포 전 실제 워크로드를 기준으로 총 비용을 계산해야 함을 의미합니다.
향후 AI 에이전트가 더욱 대중화된다면 오늘날의 수많은 모델 호출은 하나의 질문과 답변에서 수십, 심지어 수백 건의 연속 호출로 바뀔 것입니다. 이 경우 단일 호출 가격, 응답 속도 및 토큰 소비 효율성은 전체 AI 시스템의 운영 비용에 직접적인 영향을 미칩니다. 이러한 배경에서 Haiku 5.5가 출시되었습니다. 실제 목표는 아마도 가장 강력한 Claude 모델이 되는 것이 아니라 Anthropic의 전체 AI 생태계에서 가장 큰 호출량을 담당하는 "저비용 엔진"이 되는 것입니다.
댓글