La respuesta depende de una sola cosa que casi nadie explica bien: la memoria de la tarjeta gráfica, no su velocidad. Una GPU lentísima con memoria de sobra corre el modelo; una rapidísima sin memoria suficiente, no lo corre en absoluto.
La regla
VRAM necesaria ≈ parámetros × bytes por parámetro × 1,2
Ese 1,2 cubre el contexto de la conversación —lo que técnicamente se llama caché KV— y el margen de operación. Los bytes por parámetro dependen de la precisión con la que guardes el modelo:
| Precisión | Bytes por parámetro | Un 70B pide | Calidad |
|---|---|---|---|
| FP16 (completa) | 2 | ~168 GB | La original |
| Q8 (8 bits) | 1 | ~84 GB | Prácticamente idéntica |
| Q4 (4 bits) | 0,5 | ~42 GB | Muy buena para uso general |
| Q3 o menos | < 0,4 | ~34 GB | Se nota la degradación |
Cuantizar es reducir la precisión con la que se guarda cada número del modelo. Q4 es el punto dulce: reduce el tamaño a la cuarta parte y la mayoría de la gente no distingue las respuestas de las del modelo completo.
Entonces, ¿qué tarjeta?
| GPU | VRAM | ¿Corre un 70B? |
|---|---|---|
| RTX 5060 / 5070 | 8–12 GB | No. Su terreno son los modelos de 7B a 12B |
| RTX 5080 / 5070 Ti | 16 GB | No. Hasta 24B cuantizados |
| RTX 5090 | 32 GB | No, y aquí es donde falla mucha gente |
| 2× RTX 5090 | 64 GB | Sí, en Q4, con holgura |
| RTX 6000 Ada | 48 GB | Sí, en Q4, con contexto moderado |
| 2× RTX 6000 Ada | 96 GB | Sí, en Q8 |
| 4× RTX 6000 Ada | 192 GB | Sí, en FP16 |
Fíjate en la fila de la RTX 5090. Es la tarjeta de consumo más potente que existe, cuesta miles de dólares, y sus 32 GB no alcanzan para un 70B en Q4, que pide unos 42. Es el error más caro de esta categoría: comprar la tarjeta más rápida en lugar de la que tiene la memoria que necesitas.
Que quepa no es lo mismo que que sirva
Un modelo puede entrar justo en la memoria y responder tan despacio que nadie lo use. Como referencia de orden de magnitud: por debajo de 10 tokens por segundo la espera se hace incómoda; entre 20 y 40 se lee con comodidad; por encima de 60 la respuesta aparece más rápido de lo que puedes leerla.
Y con varios usuarios a la vez la cuenta cambia: cada conversación simultánea consume su propia porción de caché. Un equipo dimensionado para una persona se arrodilla con cinco.
La pregunta incómoda: ¿de verdad necesitas un 70B?
En la mayoría de los casos que vemos, no.
Un modelo de 7B a 14B bien elegido resuelve perfectamente responder sobre tus procedimientos, redactar correos, resumir actas o clasificar documentos. Y corre en una tarjeta de US$ 570 en vez de en un equipo de veinte mil.
El 70B se justifica cuando necesitas razonamiento de varios pasos, análisis de textos largos y complejos, o generación de código no trivial. Si tu caso es un asistente sobre documentación interna, empezar por ahí es pagar de más para no notar la diferencia.
Cómo lo decidimos en la práctica
Con tus preguntas reales. Montamos una prueba con dos o tres modelos de tamaños distintos, la corremos contra tu propia documentación, y comparamos las respuestas. En una tarde queda claro cuál es el más pequeño que hace el trabajo — y ese es el que hay que comprar.
Puedes ver qué equipo corresponde a cada tamaño en el catálogo, o armar el tuyo pieza por pieza en el configurador.