Velokey
Tutorials

So nutzt du die Claude Fable 5 API (mit Python)

Ein funktionierender Claude Fable 5 API-Leitfaden — erster Aufruf, die 5 Parameter die 400 zurückgeben wenn du wie bei einem älteren Modell codest, Refusal-Handling und was es kostet.

So nutzt du die Claude Fable 5 API (mit Python)

TL;DR

  • Rufe Claude Fable 5 über Anthropics Messages API mit der Model-ID claude-fable-5 auf — installiere das anthropic SDK, setze ANTHROPIC_API_KEY und sende eine messages.create-Anfrage
  • Der Haken: Code, der für ältere Claude- (oder GPT-) Modelle geschrieben wurde, bricht bei Fable 5. temperature, top_p, top_k, budget_tokens, thinking: {type:"disabled"} und Assistant-Prefills liefern alle einen 400
  • Thinking ist immer aktiv — steuere die Tiefe mit output_config.effort (lowmax), nicht mit einem Token-Budget. Behandle den refusal-Stop-Reason und aktiviere Fallbacks
  • Fable 5 erfordert 30-tägige Datenspeicherung (ZDR-Orgs erhalten bei jeder Anfrage einen 400) und kostet $10 / $50 pro 1M Input-/Output-Tokens — etwa 2× Opus 4.8
  • Willst du Anthropic-Account, Tier und Retention-Setup überspringen? Rufe claude-fable-5 über den OpenAI-kompatiblen Endpoint von Velokey mit einem Key auf — gleicher Preis $10/$50, ohne die Parameter-Fallen unten

Die meisten „So rufst du die API auf“-Anleitungen zeigen dir ein Hello-World mit drei Zeilen und hören auf. Das ist in Ordnung, bis Fable 5 beim ersten echten Request einen 400 zurückgibt, weil du aus Gewohnheit temperature mitgegeben hast, oder dein Code response.content[0] liest und bei einem Refusal abstürzt. Fable 5 ist Anthropics fähigstes Modell, hat aber eine strengere Request-Oberfläche als alles davor. Hier ist der funktionierende Aufruf und danach die fünf Dinge, die deine Integration tatsächlich kaputtmachen.

How to use the Claude Fable 5 API
Claude Fable 5 API: der erste Aufruf, die Parameter die 400 liefern, und Refusal-Handling

Was brauchst du, um die Claude Fable 5 API aufzurufen?

Du brauchst einen bezahlten Anthropic-Account, das anthropic SDK und — das erwischt viele — eine Organisations-Datenspeicherung von mindestens 30 Tagen. Fable 5 ist unter Zero Data Retention (ZDR) nicht verfügbar; eine ZDR-Org erhält bei jeder Fable-5-Anfrage einen 400 invalid_request_error, egal wie sauber die Payload ist.

Die Model-ID ist claude-fable-5. Sie hat ein 1M-Token-Kontextfenster (Standard und Maximum) und bis zu 128K Output-Tokens. Installieren und authentifizieren:

pip install anthropic
export ANTHROPIC_API_KEY="sk-ant-..."   # never hardcode

Bevor du deinen ersten Aufruf machst, prüfe:

AnforderungWarum es wichtig ist
Bezahlter Account, ausreichender TierFable 5 liegt über Opus-Tier; prüfe den Modellzugang
Datenspeicherung ≥ 30 TageZDR-Orgs erhalten bei jeder Anfrage 400
anthropic SDK installiertNutze das offizielle SDK, keinen OpenAI-kompatiblen Shim
Model-ID claude-fable-5Exakter String — kein Datums-Suffix

Wie machst du deinen ersten Claude Fable 5 API-Aufruf?

Du rufst client.messages.create() mit model="claude-fable-5" und einer messages-Liste auf. Gib keinen thinking-Parameter mit — Thinking ist immer aktiv — und steuere die Reasoning-Tiefe stattdessen mit output_config.effort.

import anthropic

client = anthropic.Anthropic()  # reads ANTHROPIC_API_KEY from the environment

response = client.messages.create(
    model="claude-fable-5",
    max_tokens=16000,
    output_config={"effort": "high"},   # low | medium | high | xhigh | max
    messages=[
        {"role": "user", "content": "Explain the tradeoffs of event sourcing in two paragraphs."}
    ],
)

# Always check stop_reason before reading content (see refusals below)
if response.stop_reason != "refusal":
    for block in response.content:
        if block.type == "text":
            print(block.text)

Das ist das gesamte Hello-World. effort ist der zentrale Qualitäts-/Latenz-Regler — high ist ein guter Standard, xhigh ist der Sweet Spot für Coding und agentische Arbeit, und low/medium eignen sich für Routineaufgaben und schlagen oft die Top-Einstellungen älterer Modelle. Die rohe Gedankenkette wird nie zurückgegeben; wenn du eine lesbare Reasoning-Zusammenfassung willst, übergib thinking={"type": "adaptive", "display": "summarized"}.

Wie rufst du Claude Fable 5 über Velokey auf (ohne Anthropic-Account)?

Wenn du den Anthropic-Account, den Usage-Tier und die 30-Tage-Retention-Anforderung überspringen möchtest, rufe Fable 5 über den OpenAI-kompatiblen Endpoint von [Velokey](/model/claude-fable-5) auf. Zeige einen beliebigen OpenAI-Client auf die Base-URL von Velokey, setze deinen Velokey-Key ein und setze das Modell auf claude-fable-5 — es ist eine Standard-Chat-Completion, daher greifen die Parameter-Fallen im nächsten Abschnitt nicht.

from openai import OpenAI

client = OpenAI(
    base_url="https://api.velokey.ai/v1",
    api_key="sk-velokey-...",   # your Velokey key — not an Anthropic key
)

response = client.chat.completions.create(
    model="claude-fable-5",
    messages=[{"role": "user", "content": "Explain the tradeoffs of event sourcing in two paragraphs."}],
)
print(response.choices[0].message.content)

Gleicher Preis von $10 / $50 pro 1M wie beim direkten Anthropic-Aufruf, abgerechnet über Velokey-Credits, mit einem Key für jedes Modell das du nutzt — und ohne das Anthropic-spezifische Setup. Das ist der schnellste Weg zu einem funktionierenden Fable-5-Aufruf. Der Rest dieses Guides behandelt den direkten Anthropic-Weg und die Request-Eigenheiten, die damit einhergehen und die der OpenAI-kompatible Endpoint ausgleicht.

Was bricht, wenn du Claude Fable 5 wie ein älteres Modell aufrufst?

Beim direkten Aufruf über Anthropic liefern fünf Request-Parameter, die bei älteren Claude- oder GPT-Modellen funktionierten, bei Fable 5 einen 400. Das ist der Teil, der aus einem „schnellen Tausch“ einen Nachmittag Debugging macht (und die Reibung, die der Velokey-Weg oben umgeht).

Parameter, die bei Fable 5 400 liefern:

Was du gewohnt bistBei Fable 5Lösung
temperature, top_p, top_k400Entfernen — steuere stattdessen über den Prompt
thinking: {type:"enabled", budget_tokens: N}400Weglassen; nutze output_config.effort
thinking: {type:"disabled"}400Den thinking-Parameter komplett weglassen
Assistant-Turn-Prefill (letzte Nachricht role:"assistant")400Nutze output_config.format (Structured Outputs)
Jede Anfrage von einer ZDR-Org400≥30-tägige Datenspeicherung aktivieren

*Quelle: Anthropic Claude Fable 5 API-Dokumentation, 2026.*

Das mentale Modell: Fable 5 hat die Sampling-Regler und das feste Thinking-Budget absichtlich entfernt. Es gibt kein temperature=0 für Determinismus und keine budget_tokens-Obergrenze — du formst das Verhalten über den Prompt und begrenzst die Tiefe mit effort. Wenn du eine funktionierende Opus- oder GPT-Integration migrierst, lösche zuerst diese Parameter, bevor du etwas anderes anfasst.

Wie handhabst du Claude Fable 5 Refusals?

Fable 5 betreibt Safety-Classifier, die eine Anfrage ablehnen können — und eine Ablehnung ist kein HTTP-Fehler. Es kommt ein erfolgreicher 200 mit stop_reason: "refusal" und einem leeren (oder partiellen, mid-stream) content-Array zurück. Code, der response.content[0].text bedingungslos liest, stürzt dabei ab.

Zwei Dinge zu tun. Erstens immer auf stop_reason branchen, bevor du Content liest. Zweitens Fallbacks aktivieren, damit eine False-Positive-Ablehnung nicht einfach fehlschlägt — harmlose Arbeit in Security-Tooling oder Life Sciences kann den Classifier auslösen, daher ist das auch für legitime Apps relevant:

response = client.beta.messages.create(
    model="claude-fable-5",
    max_tokens=16000,
    betas=["server-side-fallback-2026-06-01"],
    fallbacks=[{"model": "claude-opus-4-8"}],   # re-served in the same call on a decline
    output_config={"effort": "high"},
    messages=[{"role": "user", "content": "..."}],
)

if response.stop_reason == "refusal":
    # The whole chain (Fable 5 + fallback) declined — surface it, don't retry as-is
    handle_refusal(response)
else:
    print(next(b.text for b in response.content if b.type == "text"))

Mit dem serverseitigen fallbacks-Parameter wird eine abgelehnte Anfrage transparent auf claude-opus-4-8 im selben Aufruf erneut ausgeführt, und die Abrechnung wird gutgeschrieben, sodass du nicht doppelt belastet wirst. Eine Ablehnung vor jeglichem Output wird gar nicht abgerechnet. Aktiviere das standardmäßig in neuem Fable-5-Code — es ist opt-in, ohne es stoppt ein Refusal einfach.

Was kostet die Claude Fable 5 API?

Fable 5 kostet $10 pro 1M Input-Tokens und $50 pro 1M Output-Tokens — ungefähr 2× Claude Opus 4.8 ($5 / $25). Es ist für die härteste Reasoning- und long-horizon agentische Arbeit bepreist, nicht für Alltagsaufrufe mit hohem Volumen.

Was eine einzelne Anfrage kostet:

Modell10K in + 2K outRelativ
claude-fable-5$0.20
claude-opus-4-8$0.10

*Per-Token-Rechnung auf veröffentlichten Raten. Fable 5: 10K×$10/1M + 2K×$50/1M = $0.20.*

Claude Fable 5 API pricing vs Opus 4.8
Claude Fable 5 kostet $10/$50 pro 1M Tokens — etwa doppelt so viel wie Opus 4.8

Zwei Hebel halten die Rechnung im Rahmen. Senke effort bei Routinearbeit auf medium oder low — Fable 5 bei niedrigem Effort erreicht oft das Niveau älterer Modelle an deren Obergrenze. Und nutze [Prompt Caching](/blog/claude-api-pricing-2026) für wiederholten Kontext; gecachte Reads werden mit etwa einem Zehntel der Input-Rate abgerechnet. Noch ein operativer Hinweis: Einzelne Anfragen bei harten Aufgaben können mehrere Minuten dauern, also streame alles mit großem max_tokens, um Client-Timeouts zu vermeiden:

with client.messages.stream(
    model="claude-fable-5",
    max_tokens=64000,
    output_config={"effort": "xhigh"},
    messages=[{"role": "user", "content": "..."}],
) as stream:
    message = stream.get_final_message()

Wenn du lieber keinen Anthropic-Account und keine 30-Tage-Retention-Einstellungen direkt verwalten möchtest, stellt ein Unified Gateway wie [Velokey](/model/claude-fable-5) claude-fable-5 über einen OpenAI-kompatiblen Endpoint neben anderen Modellen bereit — du rufst es mit demselben Key auf, den du für alles andere nutzt. Wie Fable 5 preislich gegen andere Frontier-Modelle abschneidet, zeigt unser Claude API Pricing Guide, die GPT-5.6-Tier-Aufschlüsselung und der GLM-5.2 vs GPT-5.5 vs Opus 4.8 Vergleich.

Häufig gestellte Fragen

Was ist die Claude Fable 5 API Model-ID?

Die Model-ID ist claude-fable-5 — der exakte String, ohne Datums-Suffix. Es ist Anthropics fähigstes weit freigegebenes Modell, mit einem 1M-Token-Kontextfenster (Standard und Maximum) und bis zu 128K Output-Tokens. Rufe es über die Messages API (client.messages.create) mit dem offiziellen anthropic SDK auf.

Warum liefert meine Claude Fable 5 Anfrage einen 400?

Die üblichen Ursachen sind Parameter, die Fable 5 entfernt hat: temperature, top_p, top_k, thinking: {budget_tokens}, thinking: {type:"disabled"} oder ein Assistant-Turn-Prefill — jedes liefert einen 400. Eine separate Ursache ist eine Zero-Data-Retention-Org, die bei jeder Fable-5-Anfrage 400 liefert. Entferne die Sampling-/Thinking-Parameter und bestätige ≥30-tägige Retention.

Wie steuere ich die Thinking-Tiefe bei Claude Fable 5?

Nutze output_config.effortlow, medium, high, xhigh oder max. Thinking ist immer aktiv und kann weder deaktiviert noch mit einem festen budget_tokens versehen werden (beides 400). high ist ein solider Standard; xhigh eignet sich für Coding und agentische Aufgaben. Für eine Reasoning-Zusammenfassung füge thinking={"type":"adaptive","display":"summarized"} hinzu.

Was kostet die Claude Fable 5 API?

$10 pro 1M Input-Tokens und $50 pro 1M Output-Tokens — etwa 2× Claude Opus 4.8. Eine Anfrage mit 10K Input / 2K Output liegt bei etwa $0.20. Niedrigerer effort und Prompt Caching (gecachte Reads werden mit ~10 % des Input-Preises abgerechnet) sind die wichtigsten Wege, die Kosten bei hohem Volumen zu senken.

Wie handhabe ich einen Claude Fable 5 Refusal?

Prüfe response.stop_reason, bevor du content liest — ein Refusal liefert HTTP 200 mit stop_reason: "refusal" und leerem oder partiellem Content. Aktiviere den serverseitigen fallbacks-Parameter (mit betas=["server-side-fallback-2026-06-01"]), damit eine Ablehnung im selben Aufruf auf claude-opus-4-8 erneut bedient wird, statt fehlzuschlagen.

Kann ich die Claude Fable 5 API ohne Anthropic-Account nutzen?

Nicht direkt — Fable 5 erfordert einen bezahlten Anthropic-Account mit 30-tägiger Datenspeicherung. Du kannst es über ein Unified API Gateway erreichen, das den Upstream-Anthropic-Zugang übernimmt, sodass du claude-fable-5 über einen OpenAI-kompatiblen Endpoint aufrufst, ohne Account oder Retention-Einstellungen selbst zu verwalten.


Willst du Claude Fable 5 ohne Verwaltung eines Anthropic-Accounts? [Hole dir deinen Velokey API-Key](/model/claude-fable-5) und rufe claude-fable-5 über einen OpenAI-kompatiblen Endpoint auf — derselbe Key, neben jedem anderen Modell das du nutzt.


*Zuletzt aktualisiert: 13. Juli 2026. API-Details stammen aus Anthropics Claude Fable 5 Dokumentation zum Zeitpunkt der Erstellung. Preise, Parameter und Modellverhalten werden von Anthropic festgelegt und können sich ändern — prüfe die offiziellen Docs, bevor du in Produktion gehst.*