Saltar al contenido

Donde entran datos, y salen soluciones · Santiago de los Caballeros, RD

Tel. +1 809 233 6113 Cel. +1 849 620 1320 info@factoriadatos.com

¿Qué GPU necesito para correr un modelo de 70B?

La respuesta depende de una sola cosa que casi nadie explica bien: la memoria de la tarjeta gráfica, no su velocidad. Una GPU lentísima con memoria de sobra corre el modelo; una rapidísima sin memoria suficiente, no lo corre en absoluto.

La regla

VRAM necesaria ≈ parámetros × bytes por parámetro × 1,2

Ese 1,2 cubre el contexto de la conversación —lo que técnicamente se llama caché KV— y el margen de operación. Los bytes por parámetro dependen de la precisión con la que guardes el modelo:

PrecisiónBytes por parámetroUn 70B pideCalidad
FP16 (completa)2~168 GBLa original
Q8 (8 bits)1~84 GBPrácticamente idéntica
Q4 (4 bits)0,5~42 GBMuy buena para uso general
Q3 o menos< 0,4~34 GBSe nota la degradación

Cuantizar es reducir la precisión con la que se guarda cada número del modelo. Q4 es el punto dulce: reduce el tamaño a la cuarta parte y la mayoría de la gente no distingue las respuestas de las del modelo completo.

Entonces, ¿qué tarjeta?

GPUVRAM¿Corre un 70B?
RTX 5060 / 50708–12 GBNo. Su terreno son los modelos de 7B a 12B
RTX 5080 / 5070 Ti16 GBNo. Hasta 24B cuantizados
RTX 509032 GBNo, y aquí es donde falla mucha gente
2× RTX 509064 GBSí, en Q4, con holgura
RTX 6000 Ada48 GBSí, en Q4, con contexto moderado
2× RTX 6000 Ada96 GBSí, en Q8
4× RTX 6000 Ada192 GBSí, en FP16

Fíjate en la fila de la RTX 5090. Es la tarjeta de consumo más potente que existe, cuesta miles de dólares, y sus 32 GB no alcanzan para un 70B en Q4, que pide unos 42. Es el error más caro de esta categoría: comprar la tarjeta más rápida en lugar de la que tiene la memoria que necesitas.

Que quepa no es lo mismo que que sirva

Un modelo puede entrar justo en la memoria y responder tan despacio que nadie lo use. Como referencia de orden de magnitud: por debajo de 10 tokens por segundo la espera se hace incómoda; entre 20 y 40 se lee con comodidad; por encima de 60 la respuesta aparece más rápido de lo que puedes leerla.

Y con varios usuarios a la vez la cuenta cambia: cada conversación simultánea consume su propia porción de caché. Un equipo dimensionado para una persona se arrodilla con cinco.

La pregunta incómoda: ¿de verdad necesitas un 70B?

En la mayoría de los casos que vemos, no.

Un modelo de 7B a 14B bien elegido resuelve perfectamente responder sobre tus procedimientos, redactar correos, resumir actas o clasificar documentos. Y corre en una tarjeta de US$ 570 en vez de en un equipo de veinte mil.

El 70B se justifica cuando necesitas razonamiento de varios pasos, análisis de textos largos y complejos, o generación de código no trivial. Si tu caso es un asistente sobre documentación interna, empezar por ahí es pagar de más para no notar la diferencia.

Cómo lo decidimos en la práctica

Con tus preguntas reales. Montamos una prueba con dos o tres modelos de tamaños distintos, la corremos contra tu propia documentación, y comparamos las respuestas. En una tarde queda claro cuál es el más pequeño que hace el trabajo — y ese es el que hay que comprar.

Puedes ver qué equipo corresponde a cada tamaño en el catálogo, o armar el tuyo pieza por pieza en el configurador.


Siguiente paso

Dinos qué quieres resolver y te decimos qué hace falta

En cinco preguntas tienes un rango de inversión orientativo. Y si prefieres hablarlo, coordinamos una reunión virtual y lo revisas con un ingeniero — no con un vendedor.