StartseiteModelleLlama 3.1 405B
MetaPower Stufe

Llama 3.1 405B

Meta · Released July 2024

Eingabepreis

$2.70

pro 1M Token

Ausgabepreis

$2.70

pro 1M Token

Kontextfenster

128K

tokens

Geschwindigkeits-Score

65

von 100

Benchmarks

Durchschn. 87/100
Coding88/100
Reasoning88/100
Extraction87/100
Creative86/100
VisionN/A

Preise

Eingabe

Prompt-Token

$2.70/ 1M

Ausgabe

Generierte Token

$2.70/ 1M

Am besten fuer

reasoningcodinganalysis

Llama 3.1 405B im Vergleich

Bei typischem Mix aus 70 % Eingabe und 30 % Ausgabe kommt Llama 3.1 405B auf $2.70 pro Million Token. Damit liegt es über 47 % der 32 hier erfassten Modelle, und 1 weitere Modelle derselben Flaggschiff-Stufe unterbieten es. Die Stufe ist ein Leistungsetikett, kein Preisband — die Spanne innerhalb einer Stufe ist oft größer als der Abstand zwischen Stufen, weshalb eine Auswahl allein nach Stufe meist zu teuer wird.

Die Eingabe kostet $2.70 pro Million, die Ausgabe $2.70 — ein Verhältnis von 1.0x. Dieses Verhältnis zählt mehr als jede der beiden Zahlen für sich: Eine Zusammenfassungs- oder Klassifizierungslast liest weit mehr, als sie schreibt, und folgt dem Eingabepreis; Codegenerierung oder lange Texte drehen das um und folgen dem Ausgabepreis. Vergleichen Sie Modelle nach dem Verhältnis, das Ihr Traffic tatsächlich hat, nicht nach dem Eingabepreis allein.

Das Benchmark-Profil ist ungewöhnlich flach — Programmierung führt mit 88/100, doch nur 2 Punkte trennen die stärkste von der schwächsten Kategorie. Das macht Llama 3.1 405B zur sicheren Standardwahl für gemischte Lasten, bei denen sich nicht vorhersagen lässt, welche Fähigkeit eine Anfrage beansprucht — und zur schlechten Wahl, wenn Sie einen Spezialisten brauchen.

Das Kontextfenster umfasst 128K Token, der Durchsatzwert liegt bei 65/100. Kontext rechnet sich nur, wenn Sie ihn füllen — und genau das Füllen macht eine Anfrage teuer: Ein großes Fenster ist eine Option, kein Rabatt. Beurteilen Sie den Geschwindigkeitswert eines Flaggschiff-Modells nach Ihrem Einsatz: Im interaktiven Chat entscheidet er alles, bei nächtlicher Batch-Arbeit fast nichts.

Vor der Festlegung prüfenswert: DeepSeek V3 schneidet bei Programmierung und Reasoning zusammen mindestens ebenso gut ab und kommt auf $0.32 pro Million gegenüber $2.70 bei Llama 3.1 405B. Das macht Llama 3.1 405B nicht zur falschen Wahl — Kontextfenster, Latenz, Anbieterbindung und bestimmte Fähigkeiten liegen außerhalb eines Benchmark-Werts — aber es heißt, dass der Preisunterschied einen Grund braucht.

Der nächstliegende Vergleich ist Claude 3 Opus von Anthropic mit $33.00 pro Million gegenüber $2.70. 6 Modelle dieser Stufe erzielen bei Programmierung und Reasoning zusammen höhere Werte — und das ist die nützliche Perspektive: Die Frage ist selten, ob ein Modell gut ist, sondern ob es das Günstigste ist, das für die konkrete Arbeit gut genug ist, die Sie ihm schicken.

Was es in der Produktion kostet

Bei 10M + 2M Token pro Monat — eine realistische mittelgroße Produktionslast — kostet Llama 3.1 405B rund $32.40. Für dieses Modell gibt es keinen Batch-Rabatt, dieser Wert ist also die Untergrenze — der übliche Hebel, Hintergrundarbeit auf eine günstigere asynchrone Stufe zu verlagern, steht hier nicht zur Verfügung.

Preisverlauf

No price changes since launch

Staerken

  • Largest open-source model — competitive with GPT-4
  • Fully self-hostable — no per-token cost on own infra
  • Active community fine-tuning ecosystem
  • Strong coding and reasoning benchmarks

Vermeiden fuer

  • Vision tasks (text-only)
  • Teams without substantial GPU infrastructure
  • Low-latency real-time requirements