AccueilModelesLlama 3 70B
MetaFast Niveau Vision

Llama 3 70B

Meta · Released April 2024

Prix Entree

$0.65

par 1M tokens

Prix Sortie

$2.75

par 1M tokens

Fenetre de Contexte

8K

tokens

Score Vitesse

92

sur 100

Benchmarks

Moy. 73/100
Coding76/100
Reasoning79/100
Extraction80/100
Creative80/100
Vision52/100

Tarification

Entree

Tokens de prompt

$0.65/ 1M

Sortie

Tokens generes

$2.75/ 1M

Ideal Pour

chatbotanalysisextraction

Llama 3 70B en contexte

Sur un mélange typique de 70 % d'entrée et 30 % de sortie, Llama 3 70B revient à 1.28 $ le million de tokens. Cela le place au-dessus de 28 % des 32 modèles suivis ici, et 8 autres modèles du même palier économique passent en dessous. Le palier est une étiquette de capacité, pas une tranche de prix : l'écart à l'intérieur d'un palier est souvent plus large qu'entre paliers, et c'est pourquoi choisir au palier seul fait généralement dépenser trop.

L'entrée coûte 0.65 $ le million et la sortie 2.75 $, soit un rapport de 4.2x. Ce rapport compte plus que chacun des deux chiffres pris isolément : une charge de résumé ou de classification lit bien plus qu'elle n'écrit et suivra le prix d'entrée, tandis que la génération de code ou la rédaction longue inverse la chose et suivra celui de sortie. Comparez les modèles sur le rapport qu'a réellement votre trafic, pas sur le seul prix d'entrée.

Le profil de benchmarks est irrégulier plutôt que plat : extraction de données à 80/100 contre vision à 52/100, soit 28 points d'écart. Une moyenne masque cela. Si votre charge se situe du côté fort, ce modèle rend plus que son prix ; si elle se situe du côté faible, un modèle moins cher au profil plus plat vous servira mieux.

La fenêtre de contexte est de 8K tokens et le score de débit de 92/100. Le contexte ne se justifie que si vous le remplissez, et le remplir est précisément ce qui rend une requête coûteuse : une grande fenêtre est une option, pas une remise. Pour un modèle de palier économique, jugez la vitesse selon votre usage : elle décide de tout en chat interactif et de presque rien en traitement par lots nocturne.

À vérifier avant de vous engager : Gemini 2.0 Flash obtient au moins aussi bien en programmation et raisonnement combinés et revient à 0.19 $ le million contre 1.28 $ pour Llama 3 70B. Cela ne fait pas de Llama 3 70B un mauvais choix — fenêtre de contexte, latence, dépendance au fournisseur et capacités spécifiques échappent à un score de benchmark — mais cela signifie que l'écart de prix doit avoir une raison derrière lui.

La comparaison la plus proche est GPT-4o Mini, de OpenAI, à 0.29 $ le million contre 1.28 $. 6 modèles de ce palier obtiennent un meilleur score en programmation et raisonnement combinés, et c'est le bon cadrage : la question est rarement de savoir si un modèle est bon, mais s'il est le moins cher parmi ceux qui sont assez bons pour le travail précis que vous lui envoyez.

Ce que cela coûte en production

À 10M + 2M tokens par mois — une charge de production moyenne réaliste — Llama 3 70B revient à environ 12.00 $. Ce modèle n'a pas de remise par lots : ce chiffre est donc un plancher — le levier habituel consistant à basculer le travail de fond vers un palier asynchrone moins cher n'existe pas ici.

Historique Prix

No price changes since launch

Points Forts

  • Fully open source — self-hostable
  • No vendor lock-in
  • Cost-effective at high volume on own infra
  • Active community and fine-tuning ecosystem

A Eviter

  • Vision tasks
  • Long context (only 8K tokens)
  • Teams without GPU infrastructure