Claude Opus 5's 1M Context Window: What “Default” Really Means

The short answer is yes: short-context and long-context Claude Opus 5 are the same model. Anthropic does not publish a separate “long” model ID. The API model is claude-opus-5, and its 1,000,000-token context window is both the default and the maximum.
But that answer needs four important qualifications:
- A 1M window is a capacity, not an instruction to fill it.
- Product access and subscription usage limits are separate from model capacity.
- Prompt caching can reduce the cost of repeated context, but it does not reduce the number of tokens in the context window.
- Long-context performance is better than before, but irrelevant or stale context can still reduce accuracy.
There is also one material correction to the original claim: the current Anthropic help center says Opus 5 supports a 1M context window in Claude chat on all paid plans. The older “Claude.ai is typically limited to about 200k” distinction is no longer accurate for Opus 5.
Verified Facts at a Glance
| Item | Current Opus 5 specification |
|---|---|
| API model ID | claude-opus-5 |
| Context window | 1M tokens, default and maximum |
| Separate short-context model | No |
| Maximum output | 128k tokens |
| Base API price | $5 / million input tokens, $25 / million output tokens |
| Long-context surcharge | None |
| Extended thinking | Enabled by default |
| API platforms | Claude API, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry |
These figures come from Anthropic’s Opus 5 model documentation and current pricing page. Prices and product policies can change, so check those pages before making a production budget.
What “1M by Default” Actually Means
“Default” does not mean every request automatically sends, processes, or bills one million tokens. It means there is no smaller standard Opus 5 context variant and no beta header required to unlock the larger window.
If a request contains 18,000 input tokens, you pay for roughly 18,000 input tokens, not the model’s full capacity. If the conversation later grows to 300,000 tokens, that larger active context is processed according to the API’s token accounting and caching rules.
The window also contains more than the text you typed. Anthropic’s context window guide says it can include:
- the system prompt;
- every retained user and assistant message;
- tool definitions and tool results;
- attached images and documents;
- extended-thinking tokens; and
- the new output being generated.
That last point matters. Opus 5 can produce up to 128k output tokens, but max_tokens covers both internal thinking and the visible answer when thinking is enabled. Do not pack the input to the final token and assume the model still has unlimited room to reason and answer.
Where the 1M Window Is Available
The model is the same, but the surrounding product decides how you access it and how usage is managed.
| Surface | 1M context status | Practical caveat |
|---|---|---|
| Claude API | Available by default | Pay per processed token; rate and spend limits still apply |
| Amazon Bedrock, Vertex AI, Microsoft Foundry | Available | Provider-specific quotas and configuration still apply |
| Claude paid chat | Available for Opus 5 on all paid plans | Chat may automatically summarize earlier messages near the limit |
| Claude Code on Pro, Max, Team, Enterprise | Available for Opus 5 | Pro users must enable usage credits to use 1M with Opus models |
The current Claude paid-plan context guide explicitly lists 1M for Opus 5 in paid chat and Claude Code. This is why a fixed “API gets 1M, web gets 200k” comparison is misleading today.
A subscription’s usage limit is still a different constraint. You can have access to a 1M-capable model and reach a rolling session or weekly usage cap before filling that context window. Capacity answers “how much can one active request consider?” Usage limits answer “how much service can this account consume over time?”
The Same Model at Two Different Operating Points
A useful way to think about short and long context is not “small Opus versus large Opus.” It is the same engine with a different working set.
| Lean context | Very large context |
|---|---|
| Faster and cheaper requests | More cross-file and cross-document evidence in one request |
| Less irrelevant material competing for attention | Better for relationships spread across a large corpus |
| Easier to debug why the model answered a certain way | Higher latency and input cost |
| Best for focused edits and quick questions | Greater risk of stale, duplicated, or conflicting instructions |
Anthropic says Opus 5 maintains instruction following, tool use, and reasoning more consistently across long contexts than earlier models. That is a real improvement. It is not a promise that one million uncurated tokens are as useful as ten thousand carefully selected ones.
Anthropic’s own context window guidance still warns about “context rot”: as context grows, recall and accuracy can degrade. The practical goal is therefore not to maximize token count. It is to maximize the amount of relevant, current, non-duplicated evidence available to the model.
What 1M Tokens Cost in Practice
At the base Opus 5 input rate of $5 per million tokens, input-only examples are simple:
| Input processed in one request | Base input cost |
|---|---|
| 20,000 tokens | $0.10 |
| 50,000 tokens | $0.25 |
| 200,000 tokens | $1.00 |
| 1,000,000 tokens | $5.00 |
Output is billed separately at $25 per million tokens. A request with 1M uncached input tokens and 4,000 output tokens would therefore cost about $5.10 before any platform-specific charges: $5.00 input plus $0.10 output.
Also note that Opus models from Claude 4.7 onward use a newer tokenizer. Anthropic says the same text can produce roughly 30% more tokens than with earlier models. Recount a real prompt instead of estimating migration cost from an older model’s token total.
For API applications, use Anthropic’s free Token Count API before sending unusually large requests. It can count messages, tools, images, and documents using the target model’s tokenizer.
Prompt Caching: Powerful, but Often Misunderstood
Prompt caching is valuable when many requests reuse the same large prefix: a codebase snapshot, policy library, product catalog, or long system prompt.
For Opus 5, current cache pricing is:
| Cache operation | Cost per million tokens |
|---|---|
| Standard input | $5.00 |
| 5-minute cache write | $6.25 |
| 1-hour cache write | $10.00 |
| Cache read | $0.50 |
A cache hit therefore makes the reused portion cost 10% of standard input—a 90% reduction. However, the first write costs more than ordinary input, so caching pays off only when that prefix is reused.
Most importantly, cached tokens still count toward the 1M context window. Caching changes billing and latency for repeated prefixes; it does not create a 10M context window or remove cached text from the model’s active context. Anthropic’s prompt caching documentation explains the cache hierarchy and lifetime in detail.
A Practical Context-Budget Workflow
Use this process before feeding Opus 5 a very large repository or document stack.
1. Define the decision first
State the output you need: a migration plan, a list of conflicting contract clauses, a dependency map, or an implementation patch. A precise task makes it easier to exclude unrelated material.
2. Count the real request
Count the complete payload, not just source documents. Include tool schemas, conversation history, images, and the system prompt. Leave room for thinking and output.
3. Separate stable context from changing context
Put stable instructions and reference material in a reusable prefix. Put the current task, recent observations, and volatile data near the end. This structure also improves cache reuse.
4. Remove stale and duplicate evidence
Do not include three generated summaries of the same file, obsolete tool output, and the full original file unless the task needs all four. Conflicting copies make the model’s job harder.
5. Retrieve details on demand
For an enormous codebase, start with the repository map, key interfaces, tests, and files directly connected to the task. Let tools fetch additional files when a dependency is discovered. A 1M window is a useful ceiling, not a replacement for retrieval.
6. Compact long-running sessions
For agent workflows that accumulate many turns and tool results, summarize completed work, preserve decisions and unresolved questions, then discard detail that is no longer operationally useful. Anthropic also provides server-side compaction for supported API workflows.
7. Measure quality, cost, and latency together
Test a representative task with lean, medium, and large context. Compare correctness, missed evidence, response time, and token cost. The best context size is the smallest one that reliably contains the evidence the task needs.
When the Full 1M Window Is Worth It
Use very large context when the answer genuinely depends on relationships across a large corpus:
- a cross-cutting refactor across hundreds of files;
- dependency analysis spanning multiple services;
- a legal or compliance review across many related documents;
- a long-horizon agent that must preserve decisions and tool history;
- a research synthesis where omissions are more costly than added latency; or
- a migration in which old and new implementations must be compared together.
Even then, organize the input. Add a manifest, label document boundaries, distinguish authoritative sources from notes, and identify the task’s priority files.
When Lean Context Is Better
Keep context small for:
- a single-file bug fix;
- a focused code review;
- rewriting one section of a document;
- a quick factual or formatting task;
- an interactive experience where latency matters; or
- repeated production requests where every unnecessary token multiplies cost.
If Claude can fetch a missing file in seconds, sending an entire repository on every request is usually wasteful.
Decision Checklist
Before sending a huge prompt, ask:
- Does the answer require evidence from most of this material?
- Can retrieval provide the relevant pieces when needed?
- Are any instructions duplicated, stale, or contradictory?
- Have I reserved room for thinking and output?
- Will the stable prefix be reused enough to justify caching?
- Am I measuring subscription usage limits separately from context capacity?
Final Answer
Claude Opus 5 does not have separate short-context and 1M-context versions. claude-opus-5 natively supports a 1M-token window, with no special long-context model ID or surcharge.
But “supports 1M” is not the same as “should always receive 1M.” Product access, account usage limits, request cost, cache behavior, latency, and context quality remain separate operational decisions. Use the full window when a task truly needs broad cross-document reasoning. For focused work, a smaller, cleaner context is usually faster, cheaper, and easier to trust.
Official Sources

짧게 답하면 그렇다. 짧은 컨텍스트를 쓰는 Claude Opus 5와 긴 컨텍스트를 쓰는 Claude Opus 5는 같은 모델이다. Anthropic은 별도의 ‘장문용’ 모델 ID를 제공하지 않는다. API 모델은 claude-opus-5이며, 1,000,000토큰 컨텍스트 윈도우가 기본이자 최대 용량이다.
다만 이 답에는 네 가지 중요한 조건이 붙는다.
- 1M 윈도우는 수용 가능한 용량이지, 반드시 채워야 하는 목표가 아니다.
- 제품 접근 권한과 구독 사용 한도는 모델의 컨텍스트 용량과 별개다.
- 프롬프트 캐싱은 반복되는 컨텍스트의 비용을 낮추지만, 컨텍스트 윈도우 안의 토큰 수를 줄이지는 않는다.
- 장문 컨텍스트 성능은 이전보다 좋아졌지만, 무관하거나 오래된 정보는 여전히 정확도를 떨어뜨릴 수 있다.
원문에서 반드시 고쳐야 할 부분도 있다. 현재 Anthropic 도움말에 따르면 Opus 5는 모든 유료 플랜의 Claude 채팅에서 1M 컨텍스트를 지원한다. 따라서 “Claude.ai에서는 대체로 약 200k로 제한된다”는 구분은 현재 Opus 5 기준으로 정확하지 않다.
검증된 핵심 사양
| 항목 | 현재 Opus 5 사양 |
|---|---|
| API 모델 ID | claude-opus-5 |
| 컨텍스트 윈도우 | 1M 토큰, 기본이자 최대 |
| 별도 짧은 컨텍스트 모델 | 없음 |
| 최대 출력 | 128k 토큰 |
| 기본 API 요금 | 입력 100만 토큰당 $5, 출력 100만 토큰당 $25 |
| 장문 컨텍스트 추가 요금 | 없음 |
| Extended thinking | 기본 활성화 |
| API 제공 플랫폼 | Claude API, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry |
이 수치는 Anthropic의 Opus 5 모델 문서와 현재 요금 페이지를 기준으로 확인했다. 요금과 제품 정책은 바뀔 수 있으므로 실제 운영 예산을 정하기 전에는 공식 페이지를 다시 확인해야 한다.
‘1M이 기본’이라는 말의 정확한 의미
‘기본’은 모든 요청이 자동으로 100만 토큰을 보내고 처리하며 그만큼 과금된다는 뜻이 아니다. 별도의 작은 Opus 5 컨텍스트 모델이 없고, 더 큰 윈도우를 열기 위한 beta header도 필요하지 않다는 의미다.
요청에 입력 토큰이 18,000개라면 모델의 최대 용량이 아니라 약 18,000개 입력 토큰에 대해 비용을 낸다. 이후 대화의 활성 컨텍스트가 300,000토큰으로 커지면 API의 토큰 계산 및 캐싱 규칙에 따라 그 컨텍스트가 처리된다.
컨텍스트 윈도우에는 사용자가 입력한 글만 들어가는 것도 아니다. Anthropic의 컨텍스트 윈도우 가이드에 따르면 다음 항목이 포함될 수 있다.
- 시스템 프롬프트
- 유지되는 모든 사용자·어시스턴트 메시지
- 도구 정의와 도구 실행 결과
- 첨부 이미지와 문서
- extended thinking 토큰
- 새로 생성되는 출력
마지막 항목이 특히 중요하다. Opus 5의 최대 출력은 128k 토큰이지만, thinking이 켜져 있으면 max_tokens에는 내부 thinking과 화면에 보이는 답변이 함께 포함된다. 입력을 마지막 토큰까지 채워 놓고도 추론과 답변 공간이 무한히 남는다고 생각하면 안 된다.
1M 윈도우는 어디서 쓸 수 있나?
모델은 같지만, 접근 방식과 사용량 관리 방식은 제품에 따라 달라진다.
| 사용 환경 | 1M 컨텍스트 상태 | 실무상 주의점 |
|---|---|---|
| Claude API | 기본 제공 | 처리한 토큰만큼 과금되며 rate·spend limit은 별도로 적용 |
| Amazon Bedrock, Vertex AI, Microsoft Foundry | 제공 | 각 제공자의 quota와 설정이 별도로 적용 |
| Claude 유료 채팅 | 모든 유료 플랜의 Opus 5에서 제공 | 한도에 가까워지면 이전 대화를 자동 요약할 수 있음 |
| Pro, Max, Team, Enterprise의 Claude Code | Opus 5에서 제공 | Pro 사용자는 Opus 모델의 1M 사용을 위해 usage credits 활성화 필요 |
현재 Claude 유료 플랜 컨텍스트 안내는 유료 채팅과 Claude Code 모두에서 Opus 5의 1M을 명시하고 있다. 그래서 지금은 “API는 1M, 웹은 200k”라고 고정해 비교하면 오해가 생긴다.
구독의 사용 한도는 여전히 별개의 제약이다. 1M을 지원하는 모델에 접근할 수 있어도 컨텍스트를 다 채우기 전에 세션 단위 또는 주간 사용 한도에 먼저 도달할 수 있다. 컨텍스트 용량은 “하나의 활성 요청이 얼마나 많은 내용을 참고할 수 있는가?”에 답한다. 사용 한도는 “이 계정이 일정 시간 동안 서비스를 얼마나 소비할 수 있는가?”에 답한다.
같은 모델, 서로 다른 작업 범위
짧은 컨텍스트와 긴 컨텍스트를 ‘작은 Opus와 큰 Opus’로 생각하기보다 같은 엔진에 서로 다른 크기의 작업 자료를 올리는 것으로 이해하는 편이 정확하다.
| 간결한 컨텍스트 | 매우 큰 컨텍스트 |
|---|---|
| 요청이 빠르고 저렴함 | 한 요청 안에 더 많은 파일·문서 간 근거를 포함 |
| 무관한 정보가 주의를 뺏을 가능성이 작음 | 큰 자료 묶음에 흩어진 관계를 찾는 데 유리 |
| 답변 근거를 추적하기 쉬움 | 지연 시간과 입력 비용이 커짐 |
| 집중된 수정과 빠른 질문에 적합 | 오래되거나 중복·충돌하는 지시가 섞일 위험 증가 |
Anthropic은 Opus 5가 이전 모델보다 긴 컨텍스트 전반에서 지시 이행, 도구 사용, 추론을 더 일관되게 유지한다고 설명한다. 분명한 개선이다. 하지만 정리되지 않은 100만 토큰이 잘 고른 1만 토큰만큼 유용하다는 보장은 아니다.
Anthropic의 컨텍스트 윈도우 안내도 컨텍스트가 커질수록 회상과 정확도가 낮아지는 ‘context rot’를 경고한다. 실무 목표는 토큰 수를 최대로 늘리는 것이 아니라 관련성 있고 최신이며 중복되지 않은 근거를 최대한 제공하는 것이다.
1M 토큰의 실제 비용
Opus 5의 기본 입력 요금은 100만 토큰당 $5다. 입력 비용만 계산하면 다음과 같다.
| 한 요청에서 처리한 입력 | 기본 입력 비용 |
|---|---|
| 20,000토큰 | $0.10 |
| 50,000토큰 | $0.25 |
| 200,000토큰 | $1.00 |
| 1,000,000토큰 | $5.00 |
출력은 100만 토큰당 $25로 별도 과금된다. 캐시되지 않은 입력 1M과 출력 4,000토큰을 사용한 요청은 플랫폼별 추가 비용을 제외하면 약 $5.10이다. 입력 $5.00과 출력 $0.10을 합친 값이다.
또한 Claude 4.7 이후 Opus 모델은 새로운 tokenizer를 쓴다. Anthropic은 같은 텍스트도 이전 모델보다 토큰이 약 30% 더 많아질 수 있다고 설명한다. 이전 모델의 토큰 수로 이관 비용을 추정하지 말고 실제 프롬프트를 다시 세어야 한다.
API 애플리케이션이라면 특히 큰 요청을 보내기 전에 Anthropic의 무료 Token Count API를 사용하자. 대상 모델의 tokenizer로 메시지, 도구, 이미지, 문서를 함께 계산할 수 있다.
프롬프트 캐싱: 강력하지만 자주 오해하는 기능
프롬프트 캐싱은 코드베이스 스냅샷, 정책 문서 묶음, 상품 카탈로그, 긴 시스템 프롬프트처럼 여러 요청에서 동일한 큰 prefix를 반복할 때 유용하다.
현재 Opus 5의 캐시 요금은 다음과 같다.
| 캐시 작업 | 100만 토큰당 비용 |
|---|---|
| 일반 입력 | $5.00 |
| 5분 캐시 쓰기 | $6.25 |
| 1시간 캐시 쓰기 | $10.00 |
| 캐시 읽기 | $0.50 |
캐시 hit가 발생하면 재사용 부분은 일반 입력 비용의 10%, 즉 90% 저렴해진다. 반면 최초 캐시 쓰기는 일반 입력보다 비싸므로 같은 prefix를 다시 사용할 때만 이득이다.
가장 중요한 점은 캐시된 토큰도 1M 컨텍스트 윈도우에 그대로 포함된다는 것이다. 캐싱은 반복 prefix의 비용과 지연 시간을 바꾸지만 10M 컨텍스트를 만들거나 캐시된 글을 활성 컨텍스트에서 제거하지 않는다. 캐시 계층과 유효 시간은 Anthropic의 프롬프트 캐싱 문서에서 확인할 수 있다.
실무용 컨텍스트 예산 워크플로우
Opus 5에 매우 큰 저장소나 문서 묶음을 넣기 전에 다음 순서로 점검해 보자.
1. 먼저 결정할 일을 정의한다
마이그레이션 계획, 충돌하는 계약 조항 목록, 의존성 지도, 구현 patch처럼 필요한 결과를 구체적으로 적는다. 과제가 명확할수록 무관한 자료를 제외하기 쉽다.
2. 실제 요청 전체를 센다
원문 문서만 세지 말고 도구 schema, 대화 기록, 이미지, 시스템 프롬프트까지 포함한다. thinking과 출력 공간도 남긴다.
3. 고정 컨텍스트와 변동 컨텍스트를 분리한다
고정 지시와 참고 자료는 재사용할 prefix에 넣는다. 현재 과제, 최근 관찰, 자주 바뀌는 데이터는 뒤쪽에 둔다. 이 구조는 캐시 재사용률도 높인다.
4. 오래되거나 중복된 근거를 없앤다
같은 파일을 설명하는 세 개의 자동 요약, 오래된 도구 결과, 원본 전체가 모두 필요한지 확인한다. 서로 충돌하는 사본은 모델의 판단을 어렵게 만든다.
5. 세부 정보는 필요할 때 가져온다
거대한 코드베이스라면 저장소 지도, 핵심 interface, 테스트, 과제와 직접 연결된 파일부터 제공한다. 의존성을 발견했을 때 도구로 추가 파일을 읽게 한다. 1M 윈도우는 유용한 상한이지 retrieval을 대체하는 기능이 아니다.
6. 장기 세션은 compact한다
여러 turn과 도구 결과가 쌓이는 agent workflow에서는 완료한 작업을 요약하고, 결정 사항과 해결되지 않은 질문을 보존한 뒤 더 이상 필요 없는 세부 내용은 제거한다. Anthropic은 지원되는 API workflow를 위한 server-side compaction도 제공한다.
7. 품질·비용·속도를 함께 측정한다
대표 과제를 간결한 컨텍스트, 중간 컨텍스트, 큰 컨텍스트로 각각 시험한다. 정답률, 놓친 근거, 응답 시간, 토큰 비용을 비교한다. 최적의 크기는 필요한 근거를 안정적으로 담는 가장 작은 컨텍스트다.
전체 1M 윈도우가 가치 있는 경우
답이 큰 자료 묶음에 흩어진 관계에 실제로 의존할 때 매우 큰 컨텍스트를 사용한다.
- 수백 개 파일을 가로지르는 횡단형 refactor
- 여러 service에 걸친 dependency 분석
- 서로 연결된 많은 문서를 검토하는 법률·compliance 작업
- 결정과 도구 이력을 유지해야 하는 장기 agent
- 지연 시간보다 누락 방지가 중요한 연구 종합
- 기존 구현과 새 구현을 함께 비교해야 하는 migration
이때도 입력은 정리해야 한다. manifest를 추가하고, 문서 경계를 표시하고, 권위 있는 출처와 메모를 구분하고, 우선 검토할 파일을 지정한다.
간결한 컨텍스트가 더 나은 경우
다음 작업은 컨텍스트를 작게 유지하는 편이 좋다.
- 단일 파일 버그 수정
- 범위가 명확한 코드 리뷰
- 문서의 한 부분 다시 쓰기
- 빠른 사실 확인이나 형식 변환
- 지연 시간이 중요한 대화형 경험
- 불필요한 토큰 하나하나가 반복 비용으로 커지는 운영 요청
Claude가 빠르게 필요한 파일을 가져올 수 있다면 매 요청마다 저장소 전체를 보내는 것은 대개 낭비다.
결정 체크리스트
거대한 프롬프트를 보내기 전에 확인하자.
- 답을 만들려면 이 자료의 대부분이 실제로 필요한가?
- 필요한 조각을 그때그때 retrieval로 가져올 수 있는가?
- 중복되거나 오래되거나 모순되는 지시가 있는가?
- thinking과 출력을 위한 공간을 남겼는가?
- 고정 prefix를 충분히 반복해 캐싱 이익을 얻을 수 있는가?
- 구독 사용 한도와 컨텍스트 용량을 따로 측정하고 있는가?
결론
Claude Opus 5에는 짧은 컨텍스트 버전과 1M 컨텍스트 버전이 따로 없다. claude-opus-5가 특별한 장문 모델 ID나 추가 요금 없이 네이티브 1M 토큰 윈도우를 지원한다.
하지만 ‘1M을 지원한다’와 ‘항상 1M을 넣어야 한다’는 전혀 다른 말이다. 제품 접근성, 계정 사용 한도, 요청 비용, 캐시 동작, 지연 시간, 컨텍스트 품질은 각각 따로 판단해야 한다. 넓은 범위의 문서 간 추론이 정말 필요한 작업에는 전체 윈도우를 활용하자. 집중된 작업에는 더 작고 깨끗한 컨텍스트가 대개 더 빠르고 저렴하며 신뢰하기 쉽다.
공식 출처

简短的答案是:是的,使用短上下文和长上下文的 Claude Opus 5 是完全相同的模型。 Anthropic 没有发布单独的“长上下文”模型 ID。API 模型名是 claude-opus-5,其 1,000,000 token 上下文窗口既是默认值,也是最大容量。
不过,这个答案需要补充四个重要条件:
- 1M 窗口是一种容量,并不意味着应该把它填满。
- 产品访问权限和订阅使用限额与模型容量是两回事。
- Prompt caching 可以降低重复上下文的成本,但不会减少上下文窗口中的 token 数量。
- 长上下文性能比以前更好,但无关或过时的信息仍可能降低准确率。
原文还有一个必须修正的关键点:Anthropic 当前的帮助中心说明,Opus 5 在所有付费计划的 Claude 聊天中都支持 1M 上下文。因此,“Claude.ai 通常只提供约 200k”的说法对现在的 Opus 5 已经不准确。
已核实的关键规格
| 项目 | 当前 Opus 5 规格 |
|---|---|
| API 模型 ID | claude-opus-5 |
| 上下文窗口 | 1M token,默认且最大 |
| 单独的短上下文模型 | 无 |
| 最大输出 | 128k token |
| 基础 API 价格 | 每百万输入 token $5,每百万输出 token $25 |
| 长上下文附加费 | 无 |
| Extended thinking | 默认启用 |
| API 平台 | Claude API、Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry |
以上数据来自 Anthropic 的 Opus 5 模型文档和当前价格页面。价格与产品政策可能变化,在制定生产预算前应再次查看官方页面。
“默认 1M”的准确含义
“默认”并不意味着每次请求都会自动发送、处理或按一百万 token 计费。它的意思是:不存在一个较小的标准 Opus 5 上下文版本,也不需要 beta header 才能开启更大的窗口。
如果一次请求包含 18,000 个输入 token,你支付的是大约 18,000 个输入 token 的费用,而不是整个模型容量。之后如果对话的活跃上下文增长到 300,000 token,就会按照 API 的 token 计算和缓存规则处理这部分上下文。
上下文窗口也不仅包含你输入的文字。Anthropic 的上下文窗口指南说明,其中可能包括:
- system prompt;
- 所有被保留的用户和助手消息;
- 工具定义与工具结果;
- 附加的图片和文档;
- extended thinking token;
- 正在生成的新输出。
最后一点尤其重要。Opus 5 最多可以输出 128k token,但启用 thinking 时,max_tokens 同时包含内部 thinking 和可见回答。不要把输入塞到最后一个 token,然后假设模型仍有无限空间进行推理和回答。
哪些使用环境支持 1M?
模型相同,但外围产品决定你如何访问它,以及如何管理用量。
| 使用环境 | 1M 上下文状态 | 实际注意事项 |
|---|---|---|
| Claude API | 默认可用 | 按处理的 token 付费;rate 和 spend limit 仍适用 |
| Amazon Bedrock、Vertex AI、Microsoft Foundry | 可用 | 各提供商的 quota 和配置仍适用 |
| Claude 付费聊天 | 所有付费计划的 Opus 5 均可用 | 接近上限时,聊天可能自动总结早期消息 |
| Pro、Max、Team、Enterprise 的 Claude Code | Opus 5 可用 | Pro 用户需要启用 usage credits 才能在 Opus 模型中使用 1M |
当前的 Claude 付费计划上下文指南明确列出:付费聊天和 Claude Code 中的 Opus 5 都支持 1M。因此,今天再用“API 是 1M,网页是 200k”进行固定比较会产生误导。
订阅的使用限额仍然是另一种约束。即使你能使用具备 1M 容量的模型,也可能在填满上下文之前先触及滚动 session 或每周用量上限。上下文容量回答“一个活跃请求能参考多少内容?”,使用限额回答“这个账号在一段时间内能消费多少服务?”
同一个模型,两种工作范围
不要把短上下文和长上下文理解成“小 Opus”和“大 Opus”。更准确的理解是:同一台引擎加载了不同大小的工作集。
| 精简上下文 | 超大上下文 |
|---|---|
| 请求更快、更便宜 | 一次请求可包含更多跨文件、跨文档证据 |
| 无关材料较少争夺注意力 | 适合发现分散在大规模资料中的关系 |
| 更容易追踪模型为何得出某个答案 | 延迟和输入成本更高 |
| 适合聚焦修改和快速提问 | 过时、重复或冲突指令的风险更高 |
Anthropic 表示,Opus 5 在长上下文中的指令遵循、工具使用和推理一致性比早期模型更好。这是实质性进步,但并不代表一百万个未经整理的 token 会和一万个精心挑选的 token 一样有效。
Anthropic 自己的上下文窗口指南仍然提醒注意“context rot”:上下文越长,召回率和准确率可能下降。因此,实际目标不是把 token 数量最大化,而是尽可能提供相关、最新且不重复的证据。
1M token 的实际成本
Opus 5 的基础输入价格是每百万 token $5。仅计算输入时:
| 单次请求处理的输入 | 基础输入成本 |
|---|---|
| 20,000 token | $0.10 |
| 50,000 token | $0.25 |
| 200,000 token | $1.00 |
| 1,000,000 token | $5.00 |
输出另按每百万 token $25 计费。一次请求若包含 1M 个未缓存输入 token 和 4,000 个输出 token,在不计平台附加费用的情况下约为 $5.10:输入 $5.00,输出 $0.10。
还要注意,Claude 4.7 之后的 Opus 模型使用了新的 tokenizer。Anthropic 表示,同一段文本可能比早期模型产生大约 30% 更多的 token。迁移时不要沿用旧模型的 token 数量估算,应重新计算真实 prompt。
对于 API 应用,在发送异常大的请求前,可以先使用 Anthropic 免费的 Token Count API。它能使用目标模型的 tokenizer 计算消息、工具、图片和文档。
Prompt caching:强大,但常被误解
当多个请求重复使用同一个大型 prefix 时,prompt caching 很有价值。例如代码库快照、政策资料库、产品目录或很长的 system prompt。
Opus 5 当前的缓存价格为:
| 缓存操作 | 每百万 token 成本 |
|---|---|
| 标准输入 | $5.00 |
| 5 分钟缓存写入 | $6.25 |
| 1 小时缓存写入 | $10.00 |
| 缓存读取 | $0.50 |
缓存命中时,重复部分的成本是标准输入的 10%,也就是降低 90%。但首次写入比普通输入更贵,因此只有真正复用 prefix 时才划算。
最重要的是:缓存 token 仍然占用 1M 上下文窗口。缓存改变的是重复 prefix 的计费和延迟,并不会创造 10M 上下文,也不会把缓存文字从活跃上下文中删除。缓存层级和有效期可以查看 Anthropic 的 prompt caching 文档。
实用的上下文预算流程
在把大型代码库或文档堆交给 Opus 5 之前,可以按以下步骤操作。
1. 先定义要做的决定
明确你需要的结果:迁移计划、冲突合同条款列表、依赖关系图,还是实现 patch。任务越具体,就越容易排除无关材料。
2. 计算完整请求
不要只计算源文档。还要包括工具 schema、对话历史、图片和 system prompt,并为 thinking 和输出留出空间。
3. 分离稳定上下文与变化上下文
把固定指令和参考资料放进可复用的 prefix,把当前任务、最新观察和易变数据放在后面。这种结构也有利于缓存复用。
4. 删除过时和重复证据
不要在不必要时同时放入同一文件的三个自动摘要、过时的工具结果和完整原文。互相冲突的副本会让模型更难判断。
5. 按需检索细节
面对巨大代码库时,先提供仓库地图、关键 interface、测试和与任务直接相关的文件。发现依赖关系后,再让工具读取其他文件。1M 窗口是有用的上限,而不是 retrieval 的替代品。
6. 压缩长时间 session
对于累积许多 turn 和工具结果的 agent workflow,应该总结已完成工作,保留决策和未解决问题,并移除不再具有操作价值的细节。Anthropic 也为支持的 API workflow 提供 server-side compaction。
7. 同时衡量质量、成本和延迟
用精简、中等和大型上下文分别测试一个有代表性的任务。比较正确率、遗漏证据、响应时间和 token 成本。最佳上下文大小,是能够稳定容纳任务所需证据的最小值。
何时值得使用完整 1M 窗口?
当答案确实依赖于大规模资料中分散的关系时,超大上下文才真正有价值:
- 横跨数百个文件的系统性 refactor;
- 跨多个 service 的 dependency 分析;
- 审查许多相互关联文档的法律或 compliance 工作;
- 必须保留决策和工具历史的长周期 agent;
- 避免遗漏比降低延迟更重要的研究综合;
- 必须同时比较新旧实现的 migration。
即使如此,也要组织输入。添加 manifest,标记文档边界,区分权威来源与普通笔记,并指出优先文件。
何时精简上下文更好?
以下任务更适合较小的上下文:
- 单文件 bug 修复;
- 范围明确的代码审查;
- 重写文档中的一个部分;
- 快速查证或格式处理;
- 对延迟敏感的交互体验;
- 每个多余 token 都会反复增加成本的生产请求。
如果 Claude 能在几秒内获取缺少的文件,就没有必要每次请求都发送整个代码库。
决策检查表
发送巨大 prompt 之前,先问自己:
- 答案真的需要这些材料中的大部分吗?
- 能否在需要时通过 retrieval 获取相关部分?
- 是否存在重复、过时或互相矛盾的指令?
- 是否为 thinking 和输出预留了空间?
- 稳定 prefix 会被复用足够多次,从而值得缓存吗?
- 是否把订阅使用限额与上下文容量分开衡量?
结论
Claude Opus 5 没有单独的短上下文版和 1M 上下文版。claude-opus-5 原生支持 1M token 窗口,不需要特殊的长上下文模型 ID,也没有长上下文附加费。
但“支持 1M”不等于“每次都应该输入 1M”。产品访问、账号使用限额、请求成本、缓存行为、延迟和上下文质量仍是不同的运营决策。只有任务真正需要广泛的跨文档推理时,才使用完整窗口。对于聚焦任务,更小、更干净的上下文通常更快、更便宜,也更容易信任。
官方来源

短く答えると、はい。短いコンテキストで使うClaude Opus 5と、長いコンテキストで使うClaude Opus 5は同じモデルです。 Anthropicは「長文用」の別モデルIDを公開していません。APIモデルはclaude-opus-5で、1,000,000トークンのコンテキストウィンドウが標準であり、最大容量でもあります。
ただし、この答えには4つの重要な条件があります。
- 1Mウィンドウは容量であり、埋めるべき目標ではありません。
- 製品へのアクセスとサブスクリプションの利用上限は、モデル容量とは別です。
- Prompt cachingは繰り返し使うコンテキストのコストを下げますが、コンテキストウィンドウ内のトークン数は減らしません。
- 長いコンテキストの性能は以前より向上しましたが、無関係または古い情報は依然として精度を下げる可能性があります。
元の説明には、重要な訂正も必要です。現在のAnthropicヘルプセンターによると、Opus 5はすべての有料プランのClaudeチャットで1Mコンテキストを利用できます。「Claude.aiは通常約200kに制限される」という区別は、現在のOpus 5には当てはまりません。
検証済みの主要仕様
| 項目 | 現在のOpus 5仕様 |
|---|---|
| APIモデルID | claude-opus-5 |
| コンテキストウィンドウ | 1Mトークン、標準かつ最大 |
| 別の短コンテキストモデル | なし |
| 最大出力 | 128kトークン |
| 基本API料金 | 入力100万トークンあたり$5、出力100万トークンあたり$25 |
| 長コンテキスト追加料金 | なし |
| Extended thinking | 標準で有効 |
| APIプラットフォーム | Claude API、Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry |
これらの数値は、AnthropicのOpus 5モデルドキュメントと現在の料金ページで確認できます。料金や製品ポリシーは変わる可能性があるため、本番の予算を決める前に公式ページを再確認してください。
「1Mが標準」の正確な意味
「標準」は、すべてのリクエストが自動的に100万トークンを送信・処理し、その分が課金されるという意味ではありません。より小さい標準版Opus 5が存在せず、大きなウィンドウを有効にするためのbeta headerも不要という意味です。
リクエストに18,000入力トークンが含まれる場合、モデルの全容量ではなく、約18,000入力トークン分を支払います。その後、会話のアクティブコンテキストが300,000トークンに増えれば、そのコンテキストがAPIのトークン計算とキャッシュ規則に従って処理されます。
コンテキストウィンドウに入るのは、入力した文章だけではありません。Anthropicのコンテキストウィンドウガイドによると、次の項目が含まれる可能性があります。
- system prompt
- 保持されるすべてのユーザー・アシスタントメッセージ
- ツール定義とツール結果
- 添付した画像と文書
- extended thinkingトークン
- 新しく生成される出力
最後の項目は特に重要です。Opus 5の最大出力は128kトークンですが、thinkingが有効な場合、max_tokensには内部thinkingと表示される回答の両方が含まれます。入力を最後のトークンまで詰めても、推論と回答の空間が無限に残るわけではありません。
1Mウィンドウはどこで利用できるか
モデルは同じでも、アクセス方法と利用量の管理方法は製品によって異なります。
| 利用環境 | 1Mコンテキスト | 実務上の注意 |
|---|---|---|
| Claude API | 標準で利用可能 | 処理トークンに応じた課金。rate・spend limitは別途適用 |
| Amazon Bedrock、Vertex AI、Microsoft Foundry | 利用可能 | 各プロバイダーのquotaと設定が適用 |
| Claudeの有料チャット | すべての有料プランのOpus 5で利用可能 | 上限に近づくと過去のメッセージを自動要約する場合がある |
| Pro、Max、Team、EnterpriseのClaude Code | Opus 5で利用可能 | ProユーザーはOpusモデルの1M利用にusage creditsの有効化が必要 |
現在のClaude有料プランのコンテキストガイドには、有料チャットとClaude CodeのOpus 5で1Mが明記されています。そのため、現在は「APIは1M、Webは200k」という固定的な比較は誤解を招きます。
サブスクリプションの利用上限は、依然として別の制約です。1M対応モデルを使えても、コンテキストを埋める前にローリングsessionまたは週単位の利用上限に達することがあります。コンテキスト容量は「1つのアクティブなリクエストがどれだけの内容を参照できるか」を示し、利用上限は「アカウントが一定期間にどれだけサービスを消費できるか」を示します。
同じモデル、異なる作業範囲
短いコンテキストと長いコンテキストを「小さいOpusと大きいOpus」と考えるより、同じエンジンに異なる大きさの作業セットを載せると考える方が正確です。
| 小さく整理したコンテキスト | 非常に大きなコンテキスト |
|---|---|
| リクエストが速く安い | 1回でより多くのファイル・文書間の根拠を含められる |
| 無関係な情報が注意を奪いにくい | 大規模資料に分散した関係の発見に向く |
| 回答理由を追跡しやすい | レイテンシと入力コストが高い |
| 集中的な修正や素早い質問に向く | 古い、重複、矛盾した指示が混ざるリスクが高い |
Anthropicは、Opus 5が以前のモデルよりも長いコンテキスト全体で指示への追従、ツール利用、推論を一貫して維持すると説明しています。これは重要な改善です。ただし、整理されていない100万トークンが、厳選した1万トークンと同じ価値を持つという保証ではありません。
Anthropic自身のコンテキストウィンドウガイドも、コンテキストが増えるほど再現率と精度が低下し得る「context rot」に注意を促しています。実務上の目標はトークン数の最大化ではなく、関連性があり、最新で、重複していない根拠を最大限に提供することです。
1Mトークンの実際のコスト
Opus 5の基本入力料金は100万トークンあたり$5です。入力だけなら次のようになります。
| 1リクエストで処理する入力 | 基本入力コスト |
|---|---|
| 20,000トークン | $0.10 |
| 50,000トークン | $0.25 |
| 200,000トークン | $1.00 |
| 1,000,000トークン | $5.00 |
出力は100万トークンあたり$25で別途課金されます。キャッシュされていない1M入力トークンと4,000出力トークンのリクエストは、プラットフォーム固有の追加料金を除くと約**$5.10**です。入力$5.00と出力$0.10の合計です。
Claude 4.7以降のOpusモデルが新しいtokenizerを使う点にも注意してください。Anthropicによると、同じ文章でも以前のモデルより約30%多くトークン化される場合があります。移行コストを古いモデルのトークン数から推測せず、実際のpromptを再計測しましょう。
APIアプリケーションでは、特に大きなリクエストを送る前にAnthropicの無料Token Count APIを利用できます。対象モデルのtokenizerでメッセージ、ツール、画像、文書をまとめて数えられます。
Prompt caching:強力だが誤解されやすい機能
Prompt cachingは、コードベースのスナップショット、ポリシー文書群、商品カタログ、長いsystem promptなど、複数のリクエストが同じ大きなprefixを再利用する場合に有効です。
現在のOpus 5のキャッシュ料金は次のとおりです。
| キャッシュ操作 | 100万トークンあたりの料金 |
|---|---|
| 標準入力 | $5.00 |
| 5分キャッシュ書き込み | $6.25 |
| 1時間キャッシュ書き込み | $10.00 |
| キャッシュ読み取り | $0.50 |
キャッシュhitでは再利用部分が標準入力の10%になり、90%安くなります。ただし、最初の書き込みは通常入力より高いため、そのprefixを再利用して初めて効果があります。
最も重要なのは、キャッシュされたトークンも1Mコンテキストウィンドウに含まれることです。キャッシュは繰り返しprefixの料金とレイテンシを変えますが、10Mコンテキストを作ったり、キャッシュした文章をアクティブコンテキストから削除したりはしません。詳しくはAnthropicのPrompt cachingドキュメントを参照してください。
実務的なコンテキスト予算の手順
非常に大きなリポジトリや文書群をOpus 5に渡す前に、次の手順を使います。
1. まず必要な判断を定義する
移行計画、矛盾する契約条項の一覧、依存関係図、実装patchなど、必要な成果物を明確にします。課題が具体的なら無関係な資料を除外しやすくなります。
2. 実際のリクエスト全体を数える
ソース文書だけでなく、ツールschema、会話履歴、画像、system promptも含めます。thinkingと出力の余白も確保します。
3. 安定したコンテキストと変動するコンテキストを分ける
固定の指示や参考資料は再利用できるprefixに置きます。現在の課題、直近の観察、変化しやすいデータは後ろに置きます。この構成はキャッシュ再利用にも有利です。
4. 古い根拠と重複を削除する
同じファイルについての3つの自動要約、古いツール出力、完全な原文をすべて入れる必要があるか確認します。矛盾するコピーはモデルの判断を難しくします。
5. 詳細は必要に応じて取得する
巨大なコードベースでは、リポジトリマップ、主要interface、テスト、課題に直接関係するファイルから始めます。依存関係が見つかったときに、ツールで追加ファイルを取得します。1Mウィンドウは有用な上限ですが、retrievalの代替ではありません。
6. 長期sessionをcompactする
多数のturnとツール結果が蓄積するagent workflowでは、完了した作業を要約し、決定と未解決の問題を残して、運用上不要になった詳細を削除します。Anthropicは対応するAPI workflow向けにserver-side compactionも提供しています。
7. 品質・コスト・レイテンシを一緒に測る
代表的な課題を、小・中・大のコンテキストで試します。正確性、見落とした根拠、応答時間、トークンコストを比較します。最適なサイズは、課題に必要な根拠を安定して含められる最小のコンテキストです。
1Mウィンドウ全体を使う価値がある場合
答えが大規模な資料に分散した関係へ本当に依存するとき、非常に大きなコンテキストが有効です。
- 数百ファイルを横断するrefactor
- 複数serviceにまたがるdependency分析
- 関連する多数の文書を扱う法務・complianceレビュー
- 決定とツール履歴を保持する必要がある長期agent
- レイテンシより見落とし防止が重要な調査統合
- 旧実装と新実装を同時に比較するmigration
その場合も入力は整理します。manifestを追加し、文書の境界を示し、権威ある情報源とメモを区別し、優先ファイルを指定してください。
小さなコンテキストの方がよい場合
次の作業ではコンテキストを小さく保ちます。
- 単一ファイルのbug修正
- 範囲が明確なコードレビュー
- 文書の一部分の書き換え
- 簡単な事実確認やフォーマット作業
- レイテンシが重要なインタラクティブ体験
- 不要なトークンが繰り返しコストになる本番リクエスト
Claudeが不足ファイルを数秒で取得できるなら、すべてのリクエストでリポジトリ全体を送るのは通常無駄です。
判断チェックリスト
巨大なpromptを送る前に確認します。
- 答えには、この資料の大部分が本当に必要か?
- 必要な部分をretrievalでその都度取得できないか?
- 重複、古い、矛盾した指示はないか?
- thinkingと出力の余白を確保したか?
- 安定したprefixは、キャッシュが有効になるほど再利用されるか?
- サブスクリプションの利用上限とコンテキスト容量を分けて測っているか?
結論
Claude Opus 5には、短コンテキスト版と1Mコンテキスト版が別々に存在するわけではありません。claude-opus-5が、特別な長コンテキスト用モデルIDや追加料金なしでネイティブな1Mトークンウィンドウをサポートします。
ただし「1Mをサポートする」と「常に1Mを入力すべき」は別の話です。製品アクセス、アカウントの利用上限、リクエストコスト、キャッシュ動作、レイテンシ、コンテキスト品質はそれぞれ別に判断する必要があります。幅広い文書間推論が本当に必要な作業ではフルウィンドウを使い、集中的な作業では、より小さく整理したコンテキストを使う方が通常は速く、安く、信頼しやすくなります。
公式情報源

La respuesta breve es sí: Claude Opus 5 con contexto corto y Claude Opus 5 con contexto largo son exactamente el mismo modelo. Anthropic no publica un ID separado para una variante «long context». El modelo de la API es claude-opus-5, y su ventana de 1.000.000 de tokens es tanto la capacidad predeterminada como la máxima.
Sin embargo, esta respuesta necesita cuatro matices importantes:
- Una ventana de 1M es una capacidad, no un objetivo que haya que llenar.
- El acceso al producto y los límites de uso de la suscripción son independientes de la capacidad del modelo.
- Prompt caching puede reducir el coste del contexto repetido, pero no reduce el número de tokens dentro de la ventana.
- El rendimiento con contexto largo ha mejorado, pero la información irrelevante u obsoleta todavía puede reducir la precisión.
También hay que corregir una afirmación importante del texto original: el centro de ayuda actual de Anthropic indica que Opus 5 admite 1M de contexto en el chat de Claude en todos los planes de pago. La antigua distinción según la cual «Claude.ai suele estar limitado a unos 200k» ya no es correcta para Opus 5.
Datos verificados
| Elemento | Especificación actual de Opus 5 |
|---|---|
| ID del modelo API | claude-opus-5 |
| Ventana de contexto | 1M de tokens, predeterminada y máxima |
| Modelo separado de contexto corto | No |
| Salida máxima | 128k tokens |
| Precio base de API | $5 / millón de tokens de entrada, $25 / millón de tokens de salida |
| Recargo por contexto largo | Ninguno |
| Extended thinking | Activado por defecto |
| Plataformas API | Claude API, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry |
Estas cifras proceden de la documentación del modelo Opus 5 y la página de precios actual de Anthropic. Los precios y las políticas pueden cambiar, así que conviene revisarlas antes de fijar un presupuesto de producción.
Qué significa realmente «1M por defecto»
«Por defecto» no significa que todas las solicitudes envíen, procesen o facturen automáticamente un millón de tokens. Significa que no existe una variante estándar de Opus 5 con una ventana menor y que no hace falta un beta header para desbloquear la ventana grande.
Si una solicitud contiene 18.000 tokens de entrada, se pagan aproximadamente 18.000 tokens, no la capacidad completa del modelo. Si la conversación crece después hasta un contexto activo de 300.000 tokens, ese contexto se procesa según las reglas de conteo y caché de la API.
La ventana también contiene más que el texto escrito por el usuario. La guía de ventanas de contexto de Anthropic indica que puede incluir:
- el system prompt;
- todos los mensajes retenidos del usuario y del asistente;
- definiciones y resultados de herramientas;
- imágenes y documentos adjuntos;
- tokens de extended thinking;
- la nueva salida que se está generando.
El último punto importa especialmente. Opus 5 puede generar hasta 128k tokens, pero cuando thinking está activo, max_tokens incluye tanto el thinking interno como la respuesta visible. No conviene llenar la entrada hasta el último token y asumir que aún queda espacio ilimitado para razonar y responder.
Dónde está disponible la ventana de 1M
El modelo es el mismo, pero el producto que lo rodea decide cómo se accede a él y cómo se administra el uso.
| Entorno | Estado del contexto de 1M | Consideración práctica |
|---|---|---|
| Claude API | Disponible por defecto | Pago por token procesado; siguen existiendo rate y spend limits |
| Amazon Bedrock, Vertex AI, Microsoft Foundry | Disponible | Se aplican las quotas y configuraciones de cada proveedor |
| Chat de Claude de pago | Disponible con Opus 5 en todos los planes de pago | El chat puede resumir mensajes anteriores al acercarse al límite |
| Claude Code en Pro, Max, Team y Enterprise | Disponible con Opus 5 | En Pro hay que activar usage credits para usar 1M con modelos Opus |
La guía actual sobre contexto en planes de pago enumera explícitamente 1M para Opus 5 tanto en el chat de pago como en Claude Code. Por eso, comparar hoy «API con 1M» frente a «web con 200k» resulta engañoso.
El límite de uso de una suscripción sigue siendo una restricción distinta. Es posible tener acceso a un modelo capaz de manejar 1M y alcanzar antes un límite móvil por session o un límite semanal. La capacidad responde a «¿cuánto puede considerar una solicitud activa?». El límite de uso responde a «¿cuánto servicio puede consumir esta cuenta durante cierto periodo?».
El mismo modelo en dos puntos de operación
No conviene pensar en el contexto corto y largo como un «Opus pequeño» y un «Opus grande». Es mejor entenderlo como el mismo motor con conjuntos de trabajo de distinto tamaño.
| Contexto ligero | Contexto muy grande |
|---|---|
| Solicitudes más rápidas y baratas | Más evidencia entre archivos y documentos en una sola solicitud |
| Menos material irrelevante compitiendo por atención | Mejor para relaciones dispersas por un corpus grande |
| Es más fácil investigar por qué respondió de cierta manera | Mayor latencia y coste de entrada |
| Ideal para ediciones focalizadas y preguntas rápidas | Mayor riesgo de instrucciones obsoletas, duplicadas o conflictivas |
Anthropic afirma que Opus 5 mantiene las instrucciones, el uso de herramientas y el razonamiento de forma más consistente a lo largo de contextos grandes que modelos anteriores. Es una mejora real, pero no una promesa de que un millón de tokens sin depurar sean tan útiles como diez mil cuidadosamente seleccionados.
La propia guía de contexto de Anthropic sigue advirtiendo sobre el «context rot»: a medida que el contexto crece, la recuperación y la precisión pueden degradarse. El objetivo práctico no es maximizar tokens, sino maximizar la evidencia relevante, actual y no duplicada disponible para el modelo.
Cuánto cuesta 1M de tokens en la práctica
Con el precio base de entrada de Opus 5 de $5 por millón de tokens, los ejemplos de coste solo de entrada son sencillos:
| Entrada procesada en una solicitud | Coste base de entrada |
|---|---|
| 20.000 tokens | $0.10 |
| 50.000 tokens | $0.25 |
| 200.000 tokens | $1.00 |
| 1.000.000 tokens | $5.00 |
La salida se factura por separado a $25 por millón de tokens. Una solicitud con 1M de tokens de entrada sin caché y 4.000 tokens de salida costaría aproximadamente $5.10, antes de cualquier cargo propio de la plataforma: $5.00 de entrada y $0.10 de salida.
También hay que tener en cuenta que los modelos Opus a partir de Claude 4.7 usan un tokenizer nuevo. Según Anthropic, el mismo texto puede producir aproximadamente un 30% más de tokens que con modelos anteriores. Conviene volver a contar un prompt real, en vez de estimar la migración a partir del total del modelo anterior.
En aplicaciones API, se puede usar la Token Count API gratuita de Anthropic antes de enviar solicitudes excepcionalmente grandes. Cuenta mensajes, herramientas, imágenes y documentos con el tokenizer del modelo de destino.
Prompt caching: potente, pero fácil de malinterpretar
Prompt caching es útil cuando muchas solicitudes reutilizan el mismo prefix grande: una instantánea del código, una biblioteca de políticas, un catálogo o un system prompt extenso.
Los precios actuales de caché para Opus 5 son:
| Operación de caché | Coste por millón de tokens |
|---|---|
| Entrada estándar | $5.00 |
| Escritura de caché de 5 minutos | $6.25 |
| Escritura de caché de 1 hora | $10.00 |
| Lectura de caché | $0.50 |
Un cache hit reduce el coste de la parte reutilizada al 10% de la entrada estándar, es decir, un 90% menos. Sin embargo, la primera escritura cuesta más que una entrada normal, así que solo compensa si el prefix se reutiliza.
Lo más importante es que los tokens en caché siguen contando dentro de la ventana de 1M. El caché cambia la facturación y la latencia de prefixes repetidos; no crea una ventana de 10M ni elimina el texto almacenado del contexto activo. La documentación de prompt caching explica la jerarquía y la duración.
Un flujo práctico para presupuestar el contexto
Antes de proporcionar a Opus 5 un repositorio o conjunto documental muy grande, puede aplicarse este proceso.
1. Definir primero la decisión
Especifica el resultado: un plan de migración, una lista de cláusulas contractuales en conflicto, un mapa de dependencias o un patch. Una tarea precisa permite excluir material irrelevante.
2. Contar la solicitud real
No hay que contar solo los documentos fuente. También se incluyen schemas de herramientas, historial de conversación, imágenes y system prompt. Además, se debe reservar espacio para thinking y salida.
3. Separar contexto estable y cambiante
Coloca instrucciones y referencias estables en un prefix reutilizable. Pon la tarea actual, observaciones recientes y datos volátiles al final. Esta estructura también mejora el uso del caché.
4. Eliminar evidencia obsoleta y duplicada
No incluyas tres resúmenes generados del mismo archivo, resultados de herramientas antiguos y el archivo original completo si la tarea no necesita todo. Las copias contradictorias dificultan el trabajo del modelo.
5. Recuperar detalles bajo demanda
Para un código enorme, empieza con el mapa del repositorio, las interfaces clave, las pruebas y los archivos directamente relacionados con la tarea. Permite que las herramientas obtengan archivos adicionales cuando aparezca una dependencia. La ventana de 1M es un techo útil, no un sustituto de retrieval.
6. Compactar sessions largas
En agent workflows que acumulan muchos turn y resultados de herramientas, resume el trabajo completado, conserva decisiones y preguntas pendientes, y elimina detalles que ya no sean operativamente útiles. Anthropic también ofrece server-side compaction para workflows API compatibles.
7. Medir calidad, coste y latencia juntos
Prueba una tarea representativa con contexto ligero, medio y grande. Compara corrección, evidencia omitida, tiempo de respuesta y coste. El mejor tamaño es el más pequeño que contenga de forma fiable la evidencia que necesita la tarea.
Cuándo merece la pena usar la ventana completa de 1M
Usa un contexto muy grande cuando la respuesta dependa realmente de relaciones repartidas por un corpus amplio:
- un refactor transversal entre cientos de archivos;
- análisis de dependency entre varios services;
- revisión legal o de compliance de muchos documentos relacionados;
- un agent de largo recorrido que deba conservar decisiones e historial de herramientas;
- una síntesis de investigación en la que las omisiones cuesten más que la latencia;
- una migration que requiera comparar implementaciones antiguas y nuevas.
Incluso entonces, organiza la entrada: añade un manifest, marca los límites de los documentos, distingue las fuentes autoritativas de las notas e identifica los archivos prioritarios.
Cuándo es mejor un contexto ligero
Mantén el contexto pequeño para:
- corregir un bug en un solo archivo;
- una revisión de código focalizada;
- reescribir una sección de un documento;
- una tarea rápida de datos o formato;
- una experiencia interactiva sensible a la latencia;
- solicitudes de producción repetidas donde cada token innecesario multiplica el coste.
Si Claude puede obtener un archivo que falta en segundos, enviar el repositorio entero en cada solicitud suele ser un desperdicio.
Lista de comprobación
Antes de enviar un prompt enorme, pregunta:
- ¿La respuesta necesita evidencia de la mayor parte de este material?
- ¿Puede retrieval obtener las partes relevantes cuando hagan falta?
- ¿Hay instrucciones duplicadas, obsoletas o contradictorias?
- ¿He reservado espacio para thinking y salida?
- ¿El prefix estable se reutilizará lo suficiente para justificar el caché?
- ¿Estoy midiendo los límites de la suscripción por separado de la capacidad de contexto?
Conclusión
Claude Opus 5 no tiene versiones separadas de contexto corto y de 1M. claude-opus-5 admite de forma nativa una ventana de 1M de tokens, sin un ID especial ni recargo por contexto largo.
Pero «admite 1M» no significa «siempre debe recibir 1M». El acceso al producto, los límites de la cuenta, el coste, el caché, la latencia y la calidad del contexto son decisiones operativas diferentes. Utiliza la ventana completa cuando la tarea requiera de verdad razonar entre muchos documentos. Para trabajo focalizado, un contexto más pequeño y limpio suele ser más rápido, barato y fiable.