Ejecutar un LLM en tu propio servidor
Ejecutar un LLM en tu propio servidor exige medir VRAM, coste y operación. Guía práctica para elegir GPU, proveedor y límites antes de desplegar.
Cloud para e-commerce y riesgo cambiario
Evalúa cloud para e-commerce, costes en moneda dura, copias, CDN y proveedores con rutas razonables hacia LatAm.
Para ejecutar un LLM en tu propio servidor, empieza por el tamaño del modelo y la VRAM disponible, no por la marca del proveedor. La inferencia local funciona cuando la memoria cubre modelo y contexto, y cuando el coste mensual no ahoga la caja.
La decisión real no es instalar, sino operar
Levantar un modelo de lenguaje ya no tiene misterio. Lo caro llega después: memoria de vídeo justa, discos lentos, colas que se acumulan, copias que nadie restaura y facturas que parecían razonables cuando todo era una demo.
Para un equipo en España o Latinoamérica, el servidor propio tiene sentido cuando pesan la privacidad de datos, un uso estable o la necesidad de ajustar el modelo. Si el tráfico sube y baja, mida el coste en su caja antes de comprar horas de GPU.
La búsqueda sobre LLM todavía mezcla definiciones básicas con tutoriales demasiado genéricos. Aquí conviene separar requisitos de inferencia, coste de infraestructura y riesgo operativo con datos verificables de GPU y planes.
Qué hardware mirar primero
La VRAM manda porque el modelo debe caber junto con contexto, caché y margen de cuantización. Una GPU barata deja de ser barata si obliga a recortar contexto o a descargar capas en la RAM del sistema.
| GPU de referencia | VRAM | Lectura práctica |
|---|---|---|
| NVIDIA A10 | 24 GB | Inferencia ligera y pruebas controladas. |
| NVIDIA RTX 4090 | 24 GB | Buen músculo bruto, peor encaje si necesita garantías de centro de datos. |
| NVIDIA L40S | 48 GB | Mejor margen para modelos medianos y concurrencia moderada. |
| NVIDIA A100 | 80 GB | Opción seria para modelos grandes, lotes amplios o servicio interno exigente. |
La tabla no sustituye una prueba con tu modelo. Sirve para evitar el error habitual: mirar solo tokens por segundo y olvidar VRAM efectiva, temperatura, disponibilidad regional y coste de reserva.
Proveedores que encajan con inferencia propia
HostScout no trata estos planes como una clasificación absoluta. Son ejemplos útiles para entender rangos: servidores GPU dedicados, GPU en nube y capacidad bajo demanda. Todas las cifras salen de datos revisados para la ficha del proveedor.
| Proveedor | Plan observado | Recurso clave | Precio visible |
|---|---|---|---|
| Hetzner | GEX44 | 1 GPU, 64 GB RAM, 14 vCPU | 232,30 €/mes |
| Hostkey | gpu.v3-4090 | 1 GPU, 64 GB RAM, 12 vCPU, 1000 GB NVMe | 320,00 €/mes |
| Scaleway | L4-1-24G | 1 GPU, 48 GB RAM, 8 vCPU | 574,88 €/mes |
| DigitalOcean | GPU Droplet RTX 4000 Ada | 1 GPU, 32 GB RAM, 8 vCPU, 500 GB NVMe | 446,52 €/mes |
| Lambdalabs | 1x NVIDIA A10 | 1 GPU, 226 GB RAM, 30 vCPU, 1331 GB SSD | 1,13 €/h |
La lectura fría: Hetzner y Hostkey pueden cuadrar para inferencia estable si aceptas administrar más piezas. Scaleway y DigitalOcean simplifican el arranque, pero obligan a vigilar factura mensual y límites de red.
Lambdalabs encaja mejor cuando necesitas GPU por horas o pruebas intensivas. Gcore aporta opciones de inferencia distribuida, y Vultr ofrece GPU bare metal de gama alta, pero ahí la pregunta ya es presupuesto, no instalación.
Pasos de montaje sin romanticismo
Un despliegue sensato empieza chico. Primero valida el modelo con una carga realista. Después decide si lo servirás para uso interno, automatización de producto o clientes finales. Cada caso cambia red, seguridad y tolerancia a caída.
- Modelo y cuantización: elige una variante que quepa en la VRAM objetivo sin depender de intercambio a disco.
- Sistema operativo: usa una imagen estable con controladores GPU probados y evita mezclar repositorios sin necesidad.
- Servicio de inferencia: separa el proceso del modelo de la aplicación que consume respuestas.
- Almacenamiento: guarda pesos, caché y registros en volúmenes que puedas respaldar y restaurar.
- Seguridad: limita el acceso por red y registra uso anómalo antes de exponer una API.
No metas todo en una sola máquina sin plan de salida. Si el servidor cae, también caen los pesos, la caché y la cola. Para uso interno puede bastar; para producto pagado, necesitas reinicio limpio y copia recuperable.
Cuándo elegir servidor propio
El servidor propio conviene si el uso es constante, los datos no deben salir de tu entorno o necesitas controlar versiones del modelo. También tiene sentido si tu equipo ya opera Linux, GPU y observabilidad sin depender de asistencia básica.
Evítalo si solo necesitas respuestas ocasionales, si el presupuesto cambia con cada devaluación o si nadie mantendrá parches, copias y métricas. Una API externa o un proveedor gestionado puede salir menos caro que una GPU infrautilizada.
Para proyectos con usuarios en España, México o Argentina, añade una revisión de latencia y pagos. La tarjeta, la divisa y el soporte horario importan tanto como el benchmark. Una instancia barata en otra región puede sentirse lenta y complicar soporte.
Riesgos que se comen el ahorro
El primer riesgo es sobredimensionar. Comprar una GPU de gama alta para un modelo pequeño deja dinero parado. El segundo es subdimensionar. Si falta VRAM, aparecen latencias raras y recortes de contexto justo cuando el servicio empieza a usarse.
El tercer riesgo es el almacenamiento. Los pesos del modelo, la caché y los registros crecen. Si el plan no aclara discos, copias y recuperación, pregunta antes. Un servidor GPU sin restauración probada es una apuesta, no infraestructura.
El cuarto riesgo es la factura. Un precio por hora parece inocente hasta que el servicio queda encendido todo el mes. Un precio mensual parece estable hasta que sumas copias, tráfico, direcciones IP, soporte y migración. El dólar también es una variable técnica.
Lista de comprobación
- VRAM del modelo: deja margen para contexto y cuantización, o revisa riesgo de intercambio en disco.
- Plan GPU: compara precio, RAM, CPU y disco, o revisa si la factura ignora copias y tráfico.
- Región: prueba latencia desde tus usuarios reales, o revisa riesgo de soporte lento y pagos bloqueados.
- Recuperación: restaura pesos y configuración en una máquina limpia, o revisa riesgo de caída prolongada.
Cómo lo mantenemos actualizado
Los datos de proveedores y hardware se revisan con fichas estructuradas de HostScout y fuentes de producto. Para precios, regiones y planes GPU, el criterio público es simple: si la cifra no tiene fecha y origen verificable, no debería decidir tu compra.
Este material prioriza inferencia local y operación inicial. No promete rendimiento universal porque cada modelo cambia con cuantización, tamaño de contexto, lote, controlador y patrón de llamadas. Antes de comprometer gasto mensual, prueba tu propio flujo.
Preguntas frecuentes
¿Necesito una GPU para ejecutar un LLM propio?
¿Qué proveedor elegir para empezar?
¿Un VPS normal sirve para un LLM?
¿Cuándo conviene una API externa?
Preparado por
Cloud para e-commerce y riesgo cambiario
Evalúa cloud para e-commerce, costes en moneda dura, copias, CDN y proveedores con rutas razonables hacia LatAm.
Datos verificados
HostScout editorialArtículos relacionados
Cómo elegir un VPS: recursos y coste real
Cómo elegir un VPS por vCPU, RAM, almacenamiento, CPU steal, copias y coste final, con una lista práctica para evitar recursos inútiles.
Cómo configurar SSH sin perder el acceso
Cómo configurar SSH con claves sin bloquear el servidor: usuario correcto, permisos, segunda sesión, validación de sshd y plan de recuperación.
Desplegar Node.js en un servidor sin improvisar
Guía para desplegar Node.js con npm ci, usuario dedicado, systemd, nginx, TLS, firewall, health checks, logs y rollback verificable.
IaaS, PaaS y SaaS: diferencias con ejemplos
IaaS, PaaS y SaaS explicados con ejemplos: compare control, tareas operativas, coste real, responsabilidad compartida y facilidad de salida.
Qué es NGINX y qué hace en un hosting
Entiende cuándo NGINX sirve archivos, reenvía solicitudes, reparte tráfico o guarda respuestas, y qué cambia entre Open Source y NGINX Plus.
Qué es un servidor: tipos y cómo elegir
Qué es un servidor, cómo responde a los clientes y qué distingue a servidores web, DNS, de archivos, correo y bases de datos.