확인 중…

Haiku로 내려도 되는 작업 / 내리면 안 되는 작업

Claude Haiku 4.5는 Sonnet 5의 3분의 1 가격입니다. 다만 전부 내리면 품질이 무너지고, 안 내리면 돈이 샙니다. 기준을 정리했습니다.

결론부터
정답이 정해져 있고 짧게 답하는 작업은 내리세요 — 분류, 태깅, 추출, 형식 변환, 라우팅.
스스로 판단해야 하거나 길게 써야 하는 작업은 두세요 — 코드 작성·리뷰, 다단계 추론, 긴 문서 종합.

가격 차이

항목Haiku 4.5Sonnet 5 (9/1~)차이
입력 ($/1M)$1.00$3.003배
출력 ($/1M)$5.00$15.003배
배치 입력$0.50$1.503배
배치 출력$2.50$7.503배
캐시 읽기$0.10$0.303배

표시가는 정확히 3배입니다. 그런데 실제 청구액 차이는 3배보다 더 벌어집니다. 토크나이저가 다르기 때문입니다.

Anthropic 공식 문서에 따르면 Claude 4.7 이후 모델은 새 토크나이저를 쓰며, 같은 텍스트에 약 30% 더 많은 토큰을 생성합니다. Sonnet 5는 여기 해당하고, Haiku 4.5는 구형 토크나이저를 씁니다. 같은 문서를 넣어도 Haiku 쪽이 토큰을 덜 먹습니다.

단, 한국어라면 이 이점은 없습니다 — 직접 재봤습니다
2026년 8월 3일 count_tokens API로 측정한 결과, 한국어는 신형 토크나이저에서도 토큰이 늘지 않았습니다 (한국어 +1.2%, 영문 대조군 +47.6%). 한글 샘플 3개는 구형·신형 토큰 수가 완전히 같았습니다.
즉 한국어 작업에서 Haiku의 이점은 표시가 3배 차이 그대로이고, 토크나이저로 격차가 더 벌어지지는 않습니다. 영문 문서나 코드가 많이 섞인다면 그때는 Haiku(구형)가 추가로 유리해집니다.

아래 계산기는 토크나이저 차이를 반영하지 않습니다. 한국어 기준으로는 그게 정확한 계산이고, 영문·코드 비중이 높다면 실제 절감폭이 이보다 큽니다. 측정 근거는 9월 실질 순위 페이지에 정리해 두었습니다.

얼마나 줄어드나

  
전부 현재 모델로 처리—
단순 작업만 Haiku로—
월 절감액—

내려도 되는 작업

공통점은 출력이 짧고, 정답 범위가 좁고, 판단이 아니라 인식에 가깝다는 것입니다.

내리면 안 되는 작업

판단 기준 한 줄
틀렸을 때 사람이 바로 알아챌 수 있으면 내려도 됩니다. 분류가 틀리면 다음 단계에서 걸립니다. 코드에 숨은 버그는 안 걸립니다.

내리기 전에 확인할 제약 3가지

가격만 보고 옮겼다가 막히는 지점들입니다.

1. 컨텍스트가 200K로 5분의 1

모델컨텍스트최대 출력
Claude Sonnet 51,000,000 토큰128,000 토큰
Claude Sonnet 4.61,000,000 토큰128,000 토큰
Claude Haiku 4.5200,000 토큰64,000 토큰

긴 문서를 통째로 넣는 작업은 Haiku에서 아예 안 들어갈 수 있습니다. 출력 한도도 절반이라 장문 생성에는 부적합합니다.

2. 캐시 최소 토큰이 4,096으로 가장 높은 축입니다

이게 실무에서 가장 많이 당하는 함정입니다. 프롬프트 캐시는 일정 길이 이상이어야 걸립니다. 그 기준이 모델마다 다른데, Haiku 4.5는 4,096 토큰으로 가장 높은 쪽입니다 (Opus 4.6·4.5도 같은 4,096입니다).

모델캐시 최소 토큰
Claude Opus 5 / Fable 5512
Claude Sonnet 5 / Sonnet 4.6 / Opus 4.81,024
Claude Opus 4.72,048
Claude Haiku 4.5 / Opus 4.6 / Opus 4.54,096

세대가 올라간다고 기준이 낮아지지 않는다는 점을 보세요. Opus 4.6은 4,096인데 다음 세대인 4.7은 2,048, 그다음 4.8은 1,024입니다. 모델을 바꿀 때마다 확인해야 하는 값입니다.

Sonnet 5에서 잘 걸리던 2,000 토큰짜리 시스템 프롬프트가 Haiku로 옮기는 순간 캐시가 안 걸립니다. 더 나쁜 건 에러가 나지 않는다는 점입니다. 그냥 조용히 캐시 없이 처리되고, 청구서를 보고 나서야 알게 됩니다.

확인 방법
API 응답의 usage.cache_read_input_tokens를 보세요. 같은 프롬프트로 두 번 이상 호출했는데 이 값이 계속 0이면 캐시가 안 걸리고 있는 것입니다. 프롬프트를 4,096 토큰 이상으로 늘리거나, 캐시를 포기하고 계산을 다시 하세요.

3. 지식 시점이 오래됐습니다

Haiku 4.5의 신뢰할 수 있는 지식 시점은 2025년 2월입니다. Sonnet 5는 2026년 1월입니다. 최신 정보를 전제로 하는 작업이라면 검색 도구를 붙이거나 필요한 자료를 직접 넣어줘야 합니다.

실무에서는 라우팅으로 씁니다

전부 내리거나 전부 두는 게 아니라, 들어온 요청을 먼저 분류해서 갈라 보내는 구조가 일반적입니다.

  1. Haiku가 먼저 받습니다 — "이건 단순 문의인가, 복잡한 건인가"
  2. 단순하면 Haiku가 그대로 답합니다
  3. 복잡하면 Sonnet으로 넘깁니다

분류 자체가 짧은 작업이라 Haiku에 딱 맞고, 비용도 거의 안 듭니다. 실제로 트래픽의 절반 이상이 1단계에서 끝나는 경우가 많습니다. 위 계산기의 "단순 작업 비율"을 50%로 잡아둔 이유입니다.

주의: 라우팅을 넣으면 요청이 한 번 더 늘어납니다. 분류 요청이 워낙 짧아서 대개 무시할 수준이지만, 요청 수 기준 과금이나 레이트 리밋을 쓰신다면 계산에 넣으세요.