안녕하세요. 오늘은 Anthropic이 새로 공개한 Claude Opus 5.5 소식을 정리해 드리겠습니다. 이번 모델은 성능과 비용 두 가지를 동시에 개선했다는 점에서 업계의 주목을 받고 있습니다. 어떤 점이 달라졌고 실무에서는 어떤 의미가 있는지 차근차근 살펴보겠습니다.

1. Opus 5.5는 어떤 모델인가요?
Anthropic은 2026년 9월 22일 Claude Opus 5.5를 출시했으며, 이 모델은 새로운 5.5 제품군의 첫 번째 모델입니다. 이전 Opus 업그레이드 이후 약 두 달 만의 출시로, Anthropic의 기존 업그레이드 주기와 맞아떨어집니다.
Claude 라인업을 잠시 정리해 드리면, Opus는 Anthropic의 3단계 Claude 라인업 중 가장 성능이 높고 비싼 등급이며, Sonnet이 중간, Haiku가 가장 빠르고 저렴한 등급입니다. 그 위에 더 강력하고 비싼 Fable/Mythos가 최상위 등급으로 존재합니다.
Anthropic이 내세운 핵심 메시지는 간단합니다. Opus 5.5는 대부분의 작업에서 Claude Fable 5.1 수준의 성능을 내면서도, 운영 비용은 Opus 5보다 40% 낮다는 것입니다. 한 단계 위 등급의 성능을 한 단계 아래 등급의 가격으로 쓸 수 있게 되었다는 뜻입니다.
2. 가격: 얼마나 저렴해졌나요?
이번 발표에서 가장 눈에 띄는 부분은 가격입니다. 공식 발표 기준으로 정리하면 다음과 같습니다.
| 100만 토큰당 가격 | Opus 5.5 | Opus 5 |
| 입력 토큰 | $4 | $5 |
| 출력 토큰 | $20 | $25 |
| 캐시 쓰기 | $5 | $6.25 |
| 캐시 읽기 | $0.20 | $0.50 |
입력·출력 토큰 가격은 Opus 5 대비 20% 낮아졌고, 에이전트 작업과 코딩 비용의 대부분을 차지하는 캐시 읽기 가격은 60%나 인하되었습니다. 여기에 더해 모델이 작업을 끝내는 데 필요한 토큰 수 자체도 줄었기 때문에, 일반적인 워크로드 기준 전체 비용은 약 40% 절감된다고 Anthropic은 설명합니다.
속도도 개선되었습니다. Opus 5.5는 Opus 5보다 출력 생성 속도가 30% 이상 빠르며, Claude Code와 Claude Platform에서는 최대 2.5배 빠른 Fast 모드도 제공됩니다(입력 $8, 출력 $40).
구독 사용자에게도 반가운 소식이 있습니다. Pro, Max, Team, 좌석 기반 Enterprise 요금제의 5시간 사용 한도가 늘어나며, 원하는 시점에 쓸 수 있는 사용량 한도 초기화 기능도 제공됩니다.
3. 성능: 벤치마크와 실제 사례
Anthropic에 따르면 Opus 5.5는 에이전트 코딩, 컴퓨터 사용, 지식 업무 분야의 벤치마크에서 선두를 기록했습니다. 예를 들어 Terminal-Bench 4.0에서는 66.4%를 기록해 Fable 5.1(55.8%)과 Opus 5(52.3%)를 앞섰고, 44개 직업군의 실무를 평가하는 GDPval-AA v2.1에서는 1846 Elo로 Fable 5.1과 Opus 5를 모두 넘어섰습니다.
다만 Anthropic 스스로도 균형 잡힌 시각을 제시했습니다. 이 정도 성능 수준에서는 벤치마크 격차가 실제 차이를 보여주는 지표로서 신뢰도가 떨어지며, 자체 사용 경험상 Opus 5.5와 Fable 5.1의 격차는 점수보다 좁다고 밝혔습니다. 벤치마크 수치만 보고 과도하게 기대하기보다는, 실제 업무에 적용해 보며 판단하시는 것이 좋겠습니다.
실제 사례도 인상적입니다.
- 대규모 코드 마이그레이션: 한 테스터는 68만 줄 규모의 코드 마이그레이션을 하루도 안 되어 끝냈는데, 이는 엔지니어링 팀이 몇 주를 들여야 했을 작업이었습니다.
- 코드 감사: 20만 줄 코드베이스의 감사와 수정을 3시간 이내에 마쳤으며, Opus 5는 같은 작업에 20시간 이상과 2.5배의 토큰을 썼습니다.
- C → Rust 변환: HAProxy를 C에서 Rust로 옮기는 내부 테스트에서 Opus 5.5는 9.5시간 만에 끝내 Fable 5.1(12시간)보다 빨랐고, 비용도 51% 적게 들었습니다.
- 리서치 정확도: 기업 분기 실적 보고서 작성 테스트에서 Opus 5.5는 18건 중 16건이 품질 기준을 통과했는데, 지어낸 수치나 인용이 하나라도 있으면 탈락하는 기준이었으며 Fable 5.1과 Opus 5는 한 번도 통과하지 못했습니다.
고객사 반응 중에는 컨설팅 분야 사례가 눈길을 끕니다. Deloitte Consulting은 가장 낮은 추론 수준에서도 Opus 5.5가 코드 리뷰에서 알려진 버그의 72%를 찾아냈으며, 이는 높은 추론 수준의 Opus 5(56%)보다 나은 결과였다고 밝혔습니다.
4. 글쓰기와 소통 방식의 개선
Opus 5에 대한 가장 흔한 불만 중 하나는 결과물이 장황하고 읽기 어렵다는 점이었습니다. Opus 5.5는 중요한 정보를 앞에 배치하고, 전문 용어나 특이한 표현을 덜 쓰며, 사용자가 제시한 글쓰기 규칙을 더 잘 따르도록 개선되었습니다. 긴 작업 세션에서 AI의 보고를 빠르게 이해하고 검토할 수 있다는 것은 실무 효율에 직접적인 영향을 줍니다. Anthropic은 결과물을 따라가고 검증하기 쉬워진 것이 실용적 이점이자 안전상의 이점이기도 하다고 설명했습니다.
5. 안전성과 규제 대응
이번 출시는 안전 측면에서도 의미가 있습니다. Opus 5.5는 Anthropic이 '프론티어 속도 조절(pacing the frontier)'을 주장한 이후 처음 내놓은 모델이며, 출시 전 Frontier Design과 METR 같은 외부 평가 기관의 테스트를 거쳤습니다. 약 2,000개 시나리오로 구성된 자동화 행동 감사에서 거의 모든 오정렬 행동 지표가 최근 Claude 모델 중 가장 좋았고, 격리 경계를 우회하려는 시도는 Opus 5나 Mythos 5.1보다 약 85% 적었습니다.
한계도 솔직하게 공개했습니다. Opus 5.5가 자신이 평가받고 있다고 의심하는 징후가 자주 관찰되어, 실제 환경에서 어떻게 행동할지 평가하기 어렵다는 점을 Anthropic은 인정했습니다.
사용자 입장에서 알아두셔야 할 변경 사항도 있습니다.
- 사이버보안·생물학 분야 성능이 매우 높아 Fable 5.1과 유사한 안전장치가 적용되며, 일반적인 버그 수정은 가능하지만 대부분의 사이버보안 작업은 Opus 4.8로 우회 처리됩니다.
- EU AI Act 준수를 위한 워터마크가 적용되며, '생각(thinking)' 모드를 끈 상태로는 더 이상 사용할 수 없습니다. GitHub에 따르면 이 워터마크는 결과물의 의미·품질·가독성을 바꾸지 않고, 토큰이나 비용도 추가하지 않습니다.
- 기존 Opus 모델처럼 데이터 무보존(zero data retention) 옵션으로도 이용할 수 있습니다.
6. 경쟁 구도: '성능'에서 '달러당 작업량'으로
같은 날 OpenAI도 저가형 모델인 GPT-6 Sol과 GPT-6 Luna를 공개했는데, Sol의 가격은 Opus 5.5 기본 요금의 정확히 절반 수준입니다. VentureBeat는 기업이 던지는 질문이 '누가 가장 뛰어난 모델을 가졌는가'에서 '주어진 비용으로 얼마나 많은 자율 작업을 완료할 수 있는가'로 바뀌고 있다고 분석했습니다. 토큰 단가만 비교하기보다는, 작업 하나를 끝내는 데 드는 총비용과 재작업 빈도까지 함께 따져보셔야 하는 시대가 된 셈입니다.
7. 어디서 쓸 수 있나요?
Opus 5.5는 AWS, Google Cloud, Microsoft Azure를 포함한 모든 플랫폼에서 바로 사용할 수 있으며, API에서는 claude-opus-5-5로 호출하면 됩니다. GitHub Copilot에서도 Pro+, Max, Business, Enterprise 사용자에게 제공됩니다. 또한 Claude Sonnet 5.5와 Haiku 5.5도 향후 몇 주 안에 출시될 예정입니다.
8. 그러면 opus 5.5 가 fable 5.1 보다 더 나은 것인가?
대부분의 경우엔 "그렇다"고 볼 수 있지만, 단순히 "Opus 5.5가 무조건 더 낫다"고 말하기는 어렵습니다.
수치상으로는 Opus 5.5가 앞섭니다. Anthropic이 공개한 벤치마크 표에서 Opus 5.5는 Terminal-Bench 4.0(66.4% vs 55.8%), CursorBench 4.0(57.8% vs 51.8%), GDPval-AA v2.1(1846 vs 1735), OSWorld 2.0(81.8% vs 80.7%) 등 비교된 항목 전부에서 Fable 5.1보다 높은 점수를 기록했습니다. TechCrunch도 더 큰 모델인 Fable을 여러 벤치마크에서 앞섰고, Fable이 실패한 비공식 과제 몇 가지를 성공했다고 보도했습니다.
하지만 Anthropic 스스로 표현을 신중하게 했습니다. 공식 설명은 "Fable을 이긴다"가 아니라 대부분의 작업에서 Fable 5.1 수준의 성능을 낸다는 것입니다. 또 이 정도 성능대에서는 벤치마크 격차가 실제 차이를 잘 보여주지 못하며, 자체 사용 경험상 두 모델의 차이는 점수보다 좁다고 덧붙였습니다. 즉, 점수는 Opus 5.5가 높지만 실제 체감 성능은 "비슷하다"에 가깝다는 것입니다. Fable은 여전히 Anthropic의 최상위 등급(Mythos급)에 속하기 때문에, 일부 어려운 작업에서는 Fable이 더 나을 가능성도 열려 있습니다.
확실히 앞서는 건 효율입니다. Anthropic도 이 부분이 가장 분명한 장점이라고 강조합니다. 앞서 말씀드린 HAProxy C→Rust 변환 테스트에서 두 모델 모두 회귀 테스트를 거의 다 통과했지만, Opus 5.5는 9.5시간(Fable 12시간) 만에 끝냈고 비용은 51% 적게 들었습니다. 결과 품질은 비슷한데 더 빠르고 저렴했다는 뜻입니다.
정리하면, 실무 관점에서는 대부분의 작업에 Opus 5.5를 기본으로 쓰는 것이 합리적이고, Opus 5.5로 잘 풀리지 않는 매우 어려운 문제에서만 Fable 5.1을 시도해 보시는 방식을 권해 드립니다. 비용 대비 성능만 보면 현재로서는 Opus 5.5가 확실히 유리합니다.
슬기롭게 AI를 잘 활용하시길 바라겠습니다. ^-^
'IT공부' 카테고리의 다른 글
| KISA, 최근 사이버공격 대비 기업 보안강화 권고 (0) | 2026.10.05 |
|---|---|
| 성공적인 바이브코더 가 되는 방법 5가지 (0) | 2026.08.17 |
| GitHub Actions가 7시간 가까이 멈췄다 — AI 코딩 에이전트 시대, CI/CD 인프라가 먼저 한계에 도달하고 있다 (1) | 2026.08.07 |
| 클로드 코드 자동 백그라운드 작업 막는 방법 (0) | 2026.05.13 |
| AI, 머신러닝, 딥러닝, llm 등 AI 개념 총정리 (0) | 2026.02.19 |