InicioModelosLlama 3.1 405B
MetaPower Nivel

Llama 3.1 405B

Meta · Released July 2024

Precio de Entrada

$2.70

por 1M tokens

Precio de Salida

$2.70

por 1M tokens

Ventana de Contexto

128K

tokens

Puntuacion de Velocidad

65

de 100

Benchmarks

Prom. 87/100
Coding88/100
Reasoning88/100
Extraction87/100
Creative86/100
VisionN/A

Precios

Entrada

Tokens de prompt / contexto

$2.70/ 1M

Salida

Tokens generados

$2.70/ 1M

Ideal Para

reasoningcodinganalysis

Llama 3.1 405B en contexto

En una mezcla típica de 70% entrada / 30% salida, Llama 3.1 405B sale a $2.70 por millón de tokens. Eso lo sitúa por encima del 47% de los 32 modelos que seguimos aquí, y 1 modelos más de la misma capa buque insignia quedan por debajo. La capa es una etiqueta de capacidad, no una banda de precio: la horquilla dentro de una capa suele ser más ancha que la distancia entre capas, y por eso elegir solo por capa tiende a hacer gastar de más.

La entrada cuesta $2.70 por millón y la salida $2.70, una proporción de 1.0x. Esa proporción importa más que cualquiera de las dos cifras por separado: una carga de resumen o clasificación lee mucho más de lo que escribe y seguirá el precio de entrada, mientras que la generación de código o la escritura larga lo invierten y seguirán el de salida. Compara modelos según la proporción real de tu tráfico, no según el precio de entrada.

El perfil de benchmarks es inusualmente plano: programación lidera con 88/100, pero solo 2 puntos separan la categoría más fuerte de la más débil. Eso convierte a Llama 3.1 405B en una opción por defecto segura para cargas mixtas donde no puedes predecir qué capacidad exigirá cada petición, y en mala elección si necesitas un especialista.

La ventana de contexto es de 128K tokens y la puntuación de rendimiento, 65/100. El contexto solo se gana su sitio si lo llenas, y llenarlo es justo lo que encarece una petición: una ventana grande es una opción, no un descuento. Para un modelo de capa buque insignia, juzga la velocidad según lo que hagas: lo decide todo en chat interactivo y casi nada en procesos nocturnos por lotes.

Conviene comprobarlo antes de decidir: DeepSeek V3 puntúa al menos igual en programación y razonamiento combinados y sale a $0.32 por millón frente a los $2.70 de Llama 3.1 405B. Eso no convierte a Llama 3.1 405B en mala elección —ventana de contexto, latencia, dependencia del proveedor y capacidades concretas quedan fuera de una puntuación de benchmark—, pero sí significa que la diferencia de precio necesita un motivo detrás.

La comparación más cercana es Claude 3 Opus, de Anthropic, a $33.00 por millón frente a $2.70. 6 modelos de esta capa puntúan más alto en programación y razonamiento combinados, que es el encuadre útil: la pregunta rara vez es si un modelo es bueno, sino si es lo más barato que resulta suficientemente bueno para el trabajo concreto que le envías.

Lo que cuesta en producción

Con 10M + 2M tokens al mes —una carga de producción mediana realista— Llama 3.1 405B cuesta unos $32.40. Este modelo no tiene descuento por lotes, así que esa cifra es el suelo: aquí no está disponible la palanca habitual de mover el trabajo de fondo a una capa asíncrona más barata.

Historial de Precios

No price changes since launch

Fortalezas

  • Largest open-source model — competitive with GPT-4
  • Fully self-hostable — no per-token cost on own infra
  • Active community fine-tuning ecosystem
  • Strong coding and reasoning benchmarks

Evitar Para

  • Vision tasks (text-only)
  • Teams without substantial GPU infrastructure
  • Low-latency real-time requirements