AI에게 오래 걸리는 일을 맡길 때 답답한 순간은 비슷합니다. 코드를 많이 고쳤지만 원인은 그대로이거나, 정상적인 보안 점검이 중간에 멈추거나, 같은 문서를 반복해서 읽느라 비용이 쌓입니다. Claude Fable 5.1은 성능 향상과 함께 이런 운영상의 마찰을 줄이는 데 초점을 맞춘 업데이트입니다.
Anthropic은 2026년 9월 1일 Fable 5.1과 Mythos 5.1을 발표했습니다. 두 이름을 이해하려면 모델의 기본 능력, 접근 가능한 사용자, 적용되는 보호 장치를 나누어 봐야 합니다. 이 글에서는 그 차이와 캐시 요금의 의미를 짚고, 개발팀이 실제로 비교해 볼 작업까지 연결합니다.

Fable과 Mythos, 같은 기반 모델인데 왜 이름이 다를까
공식 발표에 따르면 두 제품은 같은 기반 모델을 사용하지만 보호 장치의 적용 수준과 접근 대상이 다릅니다. Fable 5.1은 일반 제공 모델이고, Mythos 5.1은 사이버보안·생명과학 분야의 검증된 개인과 조직을 위한 신뢰 접근 프로그램으로 제공됩니다. 따라서 Mythos를 단순히 더 비싼 일반 사용자용 상위 요금제로 이해하면 제품 구분을 놓치게 됩니다. 공식 발표
개발자 입장에서는 ‘어느 모델이 더 똑똑한가’에 앞서 ‘내 작업이 어떤 경로에서 실제로 처리되는가’를 확인할 필요가 있습니다. 같은 코드 분석 요청이라도 소스의 결함을 찾는 일과 공격 가능성을 실증하는 일은 처리 범위가 다를 수 있기 때문입니다. 도구에 표시되는 모델 이름 하나만으로 모든 요청의 동작을 예상하기는 어렵습니다.

가격 변화의 핵심은 입력·출력 정가보다 캐시 읽기
Fable 5.1의 API 기본 가격은 입력 100만 토큰당 10달러, 출력 50달러입니다. 이번에 눈여겨볼 값은 캐시 읽기 100만 토큰당 0.25달러입니다. Fable 5의 캐시 읽기보다 75% 낮아졌습니다. Anthropic이 제시한 일반 작업 약 25%, 에이전트 작업 최대 약 45%의 비용 절감은 이 구조를 반영한 추정치이며, 모든 요청에 일괄 적용되는 할인율은 아닙니다. 제품·가격 안내
캐시는 이미 처리한 입력을 다시 사용할 때 영향을 줍니다. 예를 들어 저장소의 공통 규칙과 설계 문서를 바탕으로 여러 파일을 차례로 리뷰한다면, 반복되는 입력 부분에서 절감 여지가 생깁니다. 반대로 매번 전혀 다른 짧은 질문을 하거나 긴 답변을 생성하는 업무라면, 캐시 읽기 가격 인하가 전체 비용에 미치는 영향은 작을 수 있습니다.
가정 계산: 캐시 읽기로 청구되는 입력이 100만 토큰이고 새 출력이 1만 토큰이라면, 두 항목의 비용은 0.25달러 + 0.50달러 = 0.75달러입니다. 캐시를 만들 때의 비용, 새 입력, 도구 사용료 등은 제외한 예시입니다. 이 계산만으로 전체 작업 요금을 예측할 수는 없지만, 출력 비용이 여전히 중요하다는 점은 확인할 수 있습니다.
그래서 비교표에는 전체 입력량 하나보다 새 입력·캐시 쓰기·캐시 읽기·출력을 따로 적는 편이 좋습니다. 모델이 저렴해졌더라도 불필요하게 긴 설명을 반복하거나 같은 실패를 여러 번 되풀이하면 실제 청구액은 기대만큼 내려가지 않을 수 있습니다.
벤치마크는 개선된 영역과 남은 거리를 함께 보여준다
아래는 Anthropic 발표의 일부 수치입니다. 같은 발표 안에서 이전 모델과 비교하되, 실제 회사 업무의 성공률로 그대로 옮겨 읽지 않는 것이 핵심입니다.
| 평가 | Fable 5 | Fable 5.1 |
|---|---|---|
| Terminal-Bench-Science 0.1 | 24.7% | 52.6% |
| Terminal-Bench 4.0 | 42.0% | 55.8% |
| CursorBench 3.2.0 | 70.5% | 73.4% |
| AutomationBench | 17.1% | 31.4% |
| OSWorld 2.0 strict | 36.1% | 41.7% |
Fable 5.1은 실제 서비스용 보호 장치를 켠 상태로 평가됐습니다. 일부 평가에서는 개입한 과제를 0점으로 처리했고, 다른 경우에는 해당 분야를 다른 모델이 처리했습니다. 점수에는 기반 모델의 능력뿐 아니라 이런 실행 조건도 반영됩니다. 벤치마크와 평가 주석
예를 들어 AutomationBench의 차이는 14.3%포인트입니다. 큰 개선이지만 이 숫자가 우리 회사 업무의 자동화율 31.4%를 뜻하지는 않습니다. 실제 업무에는 빠진 요구사항, 오래된 문서, 접근 권한, 예외 데이터가 섞입니다. 벤치마크는 후보를 고르는 출발점이고, 도입 판단은 같은 자료와 완료 기준으로 다시 비교해야 합니다.
보안 점검의 오탐 감소, 무엇이 실제로 달라지나
Anthropic은 사이버보안 보호 장치의 불필요한 개입이 이전보다 약 60% 줄었다고 설명합니다. Fable 5.1의 소프트웨어 취약점 식별 범위는 넓어졌지만, 침투 테스트·익스플로잇 생성·바이너리 기반 취약점 스캔 같은 일부 이중 용도 작업은 여전히 Opus 모델로 전환됩니다. ‘모든 보안 작업이 허용됐다’거나 ‘관련 질문은 전부 거부된다’는 설명은 모두 부정확합니다. 보호 장치 변경 안내
가령 팀 소유 서비스의 소스에서 권한 확인이 빠진 경로를 찾아 달라고 할 때는, 정상적인 접근 조건과 잘못된 응답 사례를 함께 제공할 수 있습니다. 원하는 결과물도 ‘위험해 보인다’는 평보다 해당 함수, 호출 경로, 수정 후보, 수정 후 확인할 회귀 항목으로 구체화하는 편이 유용합니다. 이렇게 해야 모델이 제시한 의심과 실제 재현되는 결함을 구분할 수 있습니다.
긴 작업의 품질은 중간 기록과 최종 증거에서 드러난다
모델을 바꾼 뒤 체감 성능을 확인하려면 이전에 어려웠던 작업을 다시 꺼내는 방법이 좋습니다. 서로 다른 서비스에 걸친 오류, 재현 조건이 불분명한 장애, 문서와 구현이 어긋난 기능처럼 단순 코드 생성으로 끝나지 않는 과제입니다. 아래는 실제 측정 결과가 아니라 비교 실험을 설계하기 위한 예시입니다.
| 비교할 업무 | 완료했다고 볼 근거 |
|---|---|
| 간헐적 오류 분석 | 관측한 사실과 가설을 구분하고, 재현 여부와 원인 후보를 제시 |
| 여러 서비스의 코드 수정 | 호출 경로·수정 범위·관련 테스트 결과가 서로 일치 |
| 기술 문서 대조 | 틀린 설명의 위치와 코드 근거, 필요한 최소 수정 제시 |
| 반복 코드 리뷰 | 실제 결함 수, 오탐 수, 사람 검토 시간, 작업당 비용 기록 |
예를 들어 ‘오류를 고쳐줘’ 대신 ‘재현 조건을 확인하고, 원인 후보를 근거와 함께 좁힌 뒤, 관련 테스트를 실행하고 미확인 경로를 남겨줘’라고 요청할 수 있습니다. 중간 보고가 자연스러운지보다 관측 사실과 추정을 섞지 않는지 보는 것이 더 중요합니다. 모델이 자신 있게 완료를 선언해도 실행하지 않은 검증은 남아 있을 수 있습니다.
기본 추론 수준도 비교 조건에 포함해야 합니다. 발표 당시 Claude Code는 High, Cowork와 claude.ai는 Medium이 기본입니다. 설정과 도구가 다른 두 화면의 응답 시간을 비교하면 모델 자체의 차이와 실행 환경의 차이가 섞입니다. 기본 추론 설정 안내
기업 데이터 보존 정책은 별도로 확인해야 한다
Enterprise Frontier Safeguards(EFS)는 고객이 통제하는 클라우드에 데이터를 두고 오용 탐지를 수행하는 방식입니다. Anthropic은 2026년 가을부터 단계적으로 제공할 계획이며, 준비되는 동안 자격을 갖춘 고객에게 Fable 5.1의 제로 데이터 보존을 허용한다고 설명합니다. 모든 개인 계정에 같은 정책이 자동 적용된다는 뜻은 아닙니다. EFS 상세 안내
Fable 5.1을 평가할 때는 모델 성능, 실제 청구 구조, 데이터 처리 조건을 함께 보는 편이 정확합니다. 반복 입력이 많은 코드 리뷰라면 캐시 할인 효과를, 긴 장애 분석이라면 원인 규명과 검증의 완성도를 먼저 확인해 보세요. 이 업데이트의 가치는 발표 점수를 외우는 데서보다, 기존에 사람이 다시 해야 했던 일이 얼마나 줄었는지에서 드러날 것입니다.
자료 확인: 2026년 9월 18일. 성능과 절감률은 개발사 발표이며 독립 실측이 아닙니다. 비용 계산과 업무 비교표는 이해를 돕기 위한 가정·분석입니다.
'AI 뉴스·업데이트' 카테고리의 다른 글
| GPT-6 Sol·Luna 출시 정리: 가격 절반, 용도 구분, Claude Opus 5.5와 같은 날 발표 읽기 (0) | 2026.09.25 |
|---|---|
| Claude Opus 5.5 출시 정리: 가격 20% 인하, 성능·안전·제공 범위까지 한 번에 (0) | 2026.09.25 |
| GPT-6 Astra 발표: 화면 조작·코딩·사이버 능력을 업무에 나누어 읽기 (0) | 2026.09.18 |
| Jev 공개: 글을 쓰지 않고 판단만 돌려주는 모델, 어디에 붙일까 (0) | 2026.09.18 |
| Devin SWE-2 발표, 코딩 AI를 고를 때 벤치마크와 완료 비용을 함께 보는 법 (0) | 2026.09.18 |
댓글