본문 바로가기

업무 자동화 · 도구 검증 · 서비스 운영

반복 업무를 줄이는 방법,
직접 시험하고 기록합니다.

예약 명단 정리부터 알림 자동화, 앱 운영까지.
원본 예제와 확인표, 실험 결과를 함께 나눕니다.

첫 번째 실험 · 예약 명단

이름이 같으면
같은 예약일까요?

B102 · 방문자B9월 10일
B103 · 방문자B9월 11일

다른 예약입니다. 둘 다 남겨야 합니다.

가상 명단 12행으로 확인한 결과 →
AI 뉴스·업데이트

Claude Opus 5.5 출시 정리: 가격 20% 인하, 성능·안전·제공 범위까지 한 번에

by 코딩히어로 2026. 9. 25.
300x250
반응형

Claude Opus 5.5는 Anthropic이 2026년 9월 22일(미국 시간) 공개한 새 최상위 모델입니다. 가격은 Opus 5보다 20% 낮아졌고, 출력 속도는 30% 이상 빨라졌으며, 에이전트형 코딩과 문서 업무 점수가 크게 올랐다고 발표됐습니다. 이 글은 공식 발표와 개발자 문서에서 확인한 내용을 가격, 성능, 안전, 제공 범위 순서로 정리하고, 지금 쓰는 업무에 옮길지 판단할 때 쓸 수 있는 확인 절차까지 담았습니다.

Claude Opus 5.5가 Opus 5에서 달라진 가격, 속도와 비용, 발표된 평가 점수, 안전 평가 네 가지를 네 칸으로 정리한 도식

발표 한눈에 보기: 무엇이 새로 나왔나

Opus 5.5는 Anthropic이 새로 여는 5.5 세대의 첫 모델입니다. 발표문은 오래 걸리는 에이전트형 코딩과 지식 업무를 주 용도로 꼽았습니다. API에서 쓰는 모델 이름은 claude-opus-5-5입니다. 같은 세대의 Sonnet 5.5와 Haiku 5.5는 몇 주 안에 나온다고 예고됐고, 정확한 날짜는 아직 발표되지 않았습니다.

발표에서 눈에 띄는 변화는 세 가지입니다. 첫째, 같은 작업을 더 적은 토큰과 단계로 끝낸다는 효율 개선입니다. Anthropic은 일반적인 작업량 기준으로 Opus 5보다 약 40% 적은 비용이 든다고 설명했습니다. 둘째, 코딩과 업무 자동화 평가에서 이전 모델보다 높은 점수를 냈습니다. 셋째, 주어진 경계를 벗어나려는 행동이 크게 줄었다는 안전 평가 결과입니다. 원문은 Anthropic의 Claude Opus 5.5 발표에서 볼 수 있습니다.

대화 방식도 조금 달라졌습니다. 발표문은 중요한 내용을 먼저 말하고 사용자의 문체에 가깝게 쓰도록 다듬었다고 밝혔습니다. 버그 설명, 스레드 요약, 설계 변경 설명이 Opus 5보다 명확해졌다는 사례가 함께 실렸습니다.

가격: Opus 5와 무엇이 달라졌나

가격은 모두 백만 토큰당 달러 기준입니다. 아래 표는 Anthropic 개발자 문서의 Opus 5.5 안내와 발표문을 옮긴 것입니다.

항목 Opus 5 Opus 5.5 확인 출처
입력 $5 $4 개발자 문서
출력 $25 $20 개발자 문서
캐시 읽기 $0.50 $0.20 (60% 인하) 발표문·개발자 문서
캐시 쓰기 5분 $6.25 5분 $5, 1시간 $8 발표문·개발자 문서
배치 처리 정가의 절반 입력 $2, 출력 $10 개발자 문서
빠른 모드 해당 없음 입력 $8, 출력 $40 (Claude API 한정 연구 미리보기) 발표문·개발자 문서

가장 크게 내려간 항목은 캐시 읽기입니다. 긴 지침서나 같은 문서를 반복해서 넣는 작업이라면 단가 인하 폭보다 실제 청구액 감소 폭이 더 클 수 있습니다. 반대로 매번 새 자료를 넣는 짧은 요청은 입력·출력 단가 20% 인하가 주된 차이입니다. 캐시가 어떤 방식으로 요금에 반영되는지는 이전 글 Claude Fable 5.1과 Mythos 5.1에서 바뀐 캐시 가격에서 함께 볼 수 있습니다.

보도 기준으로 기본 컨텍스트 창은 100만 토큰, 최대 출력은 12만 8천 토큰입니다. 생각(thinking) 기능은 항상 켜져 있고, 깊이는 effort 설정으로 조절합니다. 요청에 effort를 적지 않으면 Opus 5.5는 medium으로 동작합니다. Opus 5의 기본값은 high였으므로 같은 코드라도 응답 성향이 달라질 수 있습니다.

성능: 발표된 평가 점수 읽는 법

아래 수치는 Anthropic이 발표한 값이며, 이 블로그가 직접 측정한 결과가 아닙니다. 발표 직후 SiliconANGLE 보도에서도 같은 수치를 확인했습니다.

평가 무엇을 보나 Opus 5 Opus 5.5
Terminal-Bench 4.0 터미널에서 하는 코딩 작업 52.3% 66.4%
AutomationBench 업무 자동화 과제 완료율 26.9% 40.0%
Terminal-Bench-Science 0.1 과학 계산형 터미널 작업 29.0% 58.7%
GDPval-AA v2.1 전문 직무 산출물 비교(Elo) 1708 1846
Humanity's Last Exam(도구 사용) 고난도 지식 추론 63.6% 67.7%

같은 표에서 상위 모델인 Fable 5.1의 Terminal-Bench 4.0 점수는 55.8%로 발표됐습니다. 가격이 낮은 모델이 일부 평가에서 상위 모델보다 높은 점수를 낸 셈입니다. 다만 평가 점수는 정해진 과제 묶음의 결과입니다. 내 업무의 문서 형식, 도구 연결, 검토 기준이 다르면 결과도 달라질 수 있으니 아래의 비교 절차로 직접 확인하는 편이 안전합니다.

발표문에는 사전 체험 사례도 여러 건 실렸습니다. 한 테스터는 68만 줄 규모의 코드 이전을 하루 안에 마쳤고, 웹 앱 전체 페이지의 로딩 시간을 줄이는 과제는 40번 중 39번 성공했다고 합니다. GitHub와 Box는 같은 작업에 드는 단계와 토큰이 줄었다는 의견을 냈고, Stripe는 한 세션에서 풀 리퀘스트 40건의 리베이스를 이끈 사례를 공유했습니다.

안전: 경계를 지키는 행동이 달라졌다

Anthropic은 약 2,000개 시나리오로 구성된 자동 행동 감사에서 Opus 5.5가 지금까지 공개한 모델 중 가장 좋은 점수를 받았다고 밝혔습니다. 주어진 권한 밖으로 나가려는 시도는 Opus 5보다 약 85% 줄었고, 관찰된 시도도 낮은 심각도였으며 모델이 스스로 보고했다고 설명했습니다.

문서나 웹 페이지 속에 숨긴 지시로 모델을 조종하려는 프롬프트 인젝션에 대해서도 Opus 5보다 잘 버틴다고 발표됐습니다. 사이버 보안과 생물학 분야에는 안전 분류기가 적용됩니다. 분류기가 요청을 거절하면 API는 stop_reason: "refusal"을 돌려주므로, 서비스에 붙일 때는 이 경우를 처리하는 코드를 미리 넣어 두는 것이 좋습니다.

어디서 쓸 수 있나: 제공 범위와 조건

경로 모델 이름·조건
Claude API 모든 고객, claude-opus-5-5
Amazon Bedrock anthropic.claude-opus-5-5
Claude Platform on AWS · Google Cloud · Microsoft Foundry claude-opus-5-5
GitHub Copilot Pro+, Max, Business, Enterprise 요금제(단계적 배포)
빠른 모드 Claude API에서만, 연구 미리보기

국내 개발자도 API 키가 있으면 같은 모델 이름으로 호출할 수 있습니다. Claude 앱의 요금제별 제공 조건은 이 글에서 따로 확인하지 않았으므로, 앱에서는 모델 선택 메뉴에 Opus 5.5가 보이는지 먼저 확인하세요. 코드에서 모델 이름만 바꾸면 오류가 나는 설정이 있는데, 이 부분은 개발자 전환 가이드 글에서 자세히 다룹니다.

내 업무에 옮기기 전 비교하는 방법

새 모델로 바꿀지 판단할 때는 평소 작업 몇 건을 두 모델에 똑같이 맡겨 보는 것이 가장 확실합니다. 아래 요청문은 비교 기록을 남기기 위한 예시입니다. 괄호 안만 바꿔 쓰면 됩니다.

아래 자료로 [주간 업무 보고서 초안]을 작성해 주세요.
조건 1. 첫 문단에 이번 주 결론을 두 문장으로 씁니다.
조건 2. 수치는 자료에 있는 값만 쓰고, 없는 값은 "자료 없음"으로 표시합니다.
조건 3. 마지막에 확인이 필요한 항목을 목록으로 따로 적습니다.
자료: [붙여 넣을 원문]

같은 요청을 이전 모델과 새 모델에 넣고, 결과를 아래 항목으로 기록합니다. 비용은 API 사용 기록의 입력·출력 토큰으로 계산합니다.

비교 기록
작업 이름: 주간 보고서 초안
모델 A 결과: 수치 오류 0건 / 빠진 항목 1건 / 출력 토큰 1,200
모델 B 결과: 수치 오류 0건 / 빠진 항목 0건 / 출력 토큰 900
판단: 3건 이상 같은 결과가 나오면 전환 후보로 기록

위 숫자는 기록 형식을 보여 주기 위해 직접 구성한 예시입니다. 모델의 실제 성능을 뜻하지 않습니다. 비교할 때는 effort 설정도 같이 적어 두세요. Opus 5.5는 기본값이 medium이라서 이전 모델을 high로 쓰고 있었다면 설정을 맞춘 뒤 비교해야 공정합니다.

  • 같은 자료와 같은 요청문을 쓴다
  • effort와 최대 출력 길이 설정을 기록한다
  • 수치 오류, 빠진 항목, 형식 준수를 따로 센다
  • 토큰 사용량으로 한 건당 비용을 계산한다
  • 최소 3건 이상 비교한 뒤 판단한다

AI 답변의 확인 습관이 궁금하다면 Fable 5.1 적용 전 확인할 세 가지도 같은 방식으로 정리해 두었습니다.

자주 묻는 질문

Claude Opus 5.5는 Opus 5보다 얼마나 저렴한가요?

정가 기준으로 입력은 $5에서 $4로, 출력은 $25에서 $20으로 20% 내려갔습니다. 캐시 읽기는 $0.50에서 $0.20으로 60% 내려갔습니다. Anthropic은 일반 작업량 기준 실행 비용이 약 40% 줄어든다고 설명했지만, 실제 절감 폭은 캐시 사용 비율과 출력 길이에 따라 달라집니다.

Opus 5.5와 Fable 5.1 중 무엇을 써야 하나요?

발표된 코딩 평가 일부에서는 Opus 5.5가 Fable 5.1보다 높은 점수를 냈습니다. 하지만 평가는 과제 묶음마다 결과가 다르므로 한 가지 답은 없습니다. 자주 하는 작업 3건 이상을 두 모델에 맡겨 비용과 결과를 함께 비교해 보세요.

Sonnet 5.5와 Haiku 5.5는 언제 나오나요?

Anthropic은 몇 주 안에 공개한다고만 밝혔고, 정확한 날짜와 동시 출시 여부는 발표하지 않았습니다. 공개되면 Opus 5.5와 같은 성능, 효율, 안전 개선이 상당 부분 반영될 예정이라고 안내했습니다.

300x250
반응형

댓글