Tu propia IA, en un servidor con GPU.
Elegimos la tarjeta que necesita tu modelo, te la entregamos con él funcionando y cerrada a internet, y nuestro equipo la mantiene. Tú la usas; nosotros respondemos por ella.
Tenemos servidores con GPU desde los pensados para un modelo pequeño hasta los que llevan varias tarjetas profesionales. No te vendemos una máquina de catálogo: elegimos la que necesita lo que quieres hacer, y la administramos igual sea cual sea.
Qué es un servidor con GPU.
Un servidor con GPU es un servidor normal con una tarjeta gráfica potente dentro. La tarjeta es lo que hace que un modelo de inteligencia artificial conteste en segundos: sin ella, el mismo modelo tarda minutos en cada respuesta o directamente no arranca. La cifra que manda es la memoria gráfica, la VRAM, porque el modelo tiene que caber entero ahí dentro.
Tenerla tuya cambia dos cosas. La primera, que lo que le preguntas al modelo no sale de tu máquina: no hay una empresa de fuera leyendo tus contratos ni tus correos. La segunda, que no pagas por pregunta: pagas la máquina al mes y le hablas lo que quieras. A cambio, alguien tiene que montarla, mantenerla y responder cuando falla. Esa parte es la nuestra.
Qué te entregamos.
No es una máquina vacía con acceso root. Es esto, funcionando.
La máquina justa
Con la tarjeta que pide tu modelo, ni más ni menos, el sistema instalado, los controladores de la tarjeta (los drivers de NVIDIA y CUDA) probados y todo en orden antes de que entres.
Tu modelo, respondiendo
Elegimos contigo el modelo que encaja con lo que quieres hacer y con lo que cabe, y lo dejamos funcionando con el programa que lo sirve (Ollama o vLLM).
Un chat privado para tu equipo
Una ventana tipo ChatGPT en tu propia dirección, con un usuario por persona. Tu equipo entra desde el navegador y no instala nada.
Una API para tus programas
La misma forma de conectar que usa OpenAI, así que lo que ya habla con ChatGPT (n8n, tu CRM, tus scripts) puede hablar con tu modelo cambiando una dirección.
Cerrada a internet
Cortafuegos, accesos con usuario y contraseña y, si hace falta, conexión privada. Tu modelo solo lo usa quien tú digas.
Vigilada
No miramos solo si la máquina está encendida: comprobamos que el modelo contesta y cómo van la memoria, la temperatura y el uso de la tarjeta.
Copias de lo tuyo
La configuración, los modelos que hayas adaptado y los datos de tu chat, con copias que comprobamos que se pueden recuperar.
Personas, no tickets
Un equipo que conoce tu máquina y lo que corre en ella. Cuando escribes, no empiezas de cero.
Qué tarjeta necesita tu modelo.
| Tamaño del modelo | Ejemplos | Comprimido (Q4) | Calidad alta (Q8) | Sin comprimir (FP16) | Qué tarjeta te hace falta |
|---|---|---|---|---|---|
| 7-8 mil millones | Las versiones pequeñas de Llama, Qwen o Mistral | 4,6 GB | 8 GB | 16 GB | Una de gama de entrada. Con una grande, caben varios a la vez. |
| 14 mil millones | Las medianas de Qwen o Phi | 8 GB | 14 GB | 28 GB | Una de gama media, o de entrada si va comprimido. |
| 32 mil millones | Las grandes de Qwen o Gemma | 18,2 GB | 32 GB | 64 GB | Una de gama alta. Es el punto dulce para un asistente de empresa que razona bien. |
| 70 mil millones | Las más grandes de Llama o Qwen | 39,9 GB | 70 GB | 140 GB | Una profesional de las grandes, comprimido. En calidad alta o sin comprimir, varias. |
Un ejemplo: en una tarjeta de 96 GB cabe un modelo de 70 mil millones comprimido y con margen para documentos largos, o varios modelos pequeños a la vez. Las cifras son orientativas de lo que ocupa el modelo en sí. Encima hay que sumar un 15-20 % de margen y la memoria del contexto, que es lo que suele pillar desprevenido: un modelo de 70 mil millones leyendo un documento de unas 100 páginas puede necesitar decenas de GB más. Por eso no elegimos el modelo por su fama, sino midiendo con tus documentos.
¿No sabes qué tarjeta te hace falta? Cuéntanos qué quieres correr y lo medimos por ti.
Que lo midáis vosotrosPara qué la usa una empresa.
Un asistente que conoce tu empresa
Le das tus procedimientos, tus tarifas y tus manuales, y tu equipo le pregunta como a un compañero veterano. Contesta citando de qué documento sale, para que se pueda comprobar.
Clases y reuniones pasadas a texto
Una academia que graba sus clases las deja transcribiendo por la noche y por la mañana tiene el texto y el resumen, listos para subir al aula virtual. Sin pagar por minuto y sin mandar la voz de nadie fuera.
Preguntar a miles de documentos
Contratos, expedientes, fichas técnicas. En vez de buscar a mano, preguntas "qué contratos vencen este trimestre con penalización" y te devuelve la lista con el enlace a cada uno.
Imágenes para tu tienda
Fondos de producto, variaciones de color y piezas para redes, generadas en tu máquina. Haces cien pruebas o mil y la factura es la misma.
Automatizaciones que piensan
Tus flujos de n8n clasifican correos, resumen pedidos o redactan respuestas llamando a tu modelo, no a uno que cobra por cada llamada y se queda con los datos.
Render y vídeo
Con una tarjeta profesional, las escenas de Blender o Cinema 4D y el vídeo en 4K dejan de ser un problema. Lo que en tu ordenador tarda una noche se manda a la máquina y tú sigues trabajando.
Lo que te podemos instalar.
Cada pieza, montada, conectada con las demás y mantenida. Y si quieres saber cómo funciona por dentro, tienes la guía al lado.
Tu modelo de IA
Llama, Qwen, Mistral, Gemma o el que encaje con tu tarea y con tu licencia. Lo elegimos probándolo con tus documentos, no por fama.
Qué modelo elegirEl programa que lo sirve
Ollama si lo usa tu equipo, vLLM si lo llaman tus aplicaciones cientos de veces al día. Con la misma conexión que la API de OpenAI.
Ollama, vLLM o llama.cppUn chat privado para tu equipo
Open WebUI: una ventana tipo ChatGPT en tu dirección, con un usuario por persona y el historial en tu máquina.
Cómo funciona Open WebUIPreguntar a tus documentos
Contratos, manuales o expedientes en una base de conocimiento. Le preguntas y te contesta citando de dónde lo saca.
Cómo se pregunta a documentosTranscripción de audio
Whisper pasa a texto clases, reuniones y llamadas, con subtítulos si los necesitas. El audio no sale de tu máquina.
Cómo funciona WhisperGeneración de imágenes
ComfyUI con modelos de imagen de licencia comercial: fondos de producto, variaciones y piezas para redes, sin pagar por imagen.
Imágenes en tu servidorAutomatizaciones con IA
Tus flujos de n8n clasificando correos o resumiendo pedidos con tu modelo, en vez de con uno que cobra por llamada.
n8n con tu propio modeloTodo cerrado a internet
Cortafuegos, accesos con usuario y, si hace falta, conexión privada. Nada de modelos abiertos para cualquiera.
Por qué importa¿Ves lo que necesitas? Dinos para qué lo quieres y te decimos qué piezas montar.
Qué haces tú y qué hacemos nosotros.
Casi todos los proveedores te dan la máquina con los controladores instalados, y ahí termina su parte.
| La máquina sola | Con nosotros | |
|---|---|---|
| Poner la máquina en marcha | Te dan el acceso y el sistema con CUDA. El resto es cosa tuya | Te la entregamos con tu modelo contestando |
| Elegir qué modelo cabe | Pruebas, se queda sin memoria, vuelves a probar | Lo medimos con tus documentos antes de decidir |
| Una actualización del sistema toca el controlador | La tarjeta deja de responder y te toca averiguar por qué | Probamos antes y actualizamos en ventana |
| Que nadie de fuera use tu modelo | El programa que lo sirve no trae contraseña de serie | Cerrado desde el primer día |
| El disco se llena de modelos | Te enteras cuando el siguiente no se descarga | Lo vigilamos y limpiamos lo que no se usa |
| Deja de contestar un martes a las nueve | Lo descubre tu equipo | Lo vemos nosotros y lo levantamos |
| La tarjeta lleva semanas parada | La sigues pagando sin saberlo | Te avisamos, por si no te compensa |
Lo que se rompe cuando nadie la administra.
El controlador que se desincroniza
Es el fallo más típico de estas máquinas. El sistema se actualiza solo, instala una versión nueva del controlador de NVIDIA y la tarjeta deja de responder con un error que tiene nombre propio: "Failed to initialize NVML". El modelo no arranca y nadie ha tocado nada. Se evita controlando qué se actualiza y cuándo, y probándolo antes.
El modelo abierto a todo internet
Ollama, el programa más usado para servir modelos, no trae contraseña de serie. Un estudio de seguridad publicado en enero de 2026 contó unas 175.000 máquinas con Ollama abiertas a internet en 130 países, casi la mitad capaces de ejecutar acciones. Cualquiera podía usarlas, gastar su tarjeta y leer lo que se les pedía.
El disco que se llena
Cada modelo ocupa decenas de GB, y probar cinco es muy fácil. Cuando el disco se llena, el siguiente no se descarga, las copias fallan y a veces el propio sistema se queda sin sitio para trabajar.
El documento largo que lo tumba
El modelo va perfecto en las pruebas y un día alguien le pasa un informe de 200 páginas. La memoria del contexto se dispara, la tarjeta se queda corta y el servicio se cae. Se evita dimensionando con documentos reales y poniendo límites.
Todo esto lo vigilamos nosotros para que no lo descubra tu equipo.
Que lo llevéis vosotrosTus datos se quedan en tu máquina.
Cuando usas un servicio de IA de fuera, lo que le escribes viaja a sus servidores. La Agencia Española de Protección de Datos, en su propia política de uso de IA generativa (noviembre de 2025), pide mirar antes cuatro cosas del proveedor: si usa las conversaciones para entrenar, dónde guarda los datos, cuánto tiempo y si su personal las lee.
Con tu propia máquina, las cuatro respuestas las decides tú: no entrena con nada, los datos se quedan en Europa, se borran cuando tú digas y no los lee nadie que no hayas autorizado. Eso no te hace cumplir el RGPD solo, porque qué datos le das y quién entra sigue siendo cosa tuya, pero te quita de encima la parte más difícil de justificar. Lo vemos contigo antes de montar nada.
Máquina propia o pagar por uso.
Te compensa si lo usas poco
Si le haces unas decenas de preguntas al día y no hay datos delicados de por medio, un servicio de pago por uso te sale más barato que una máquina encendida todo el mes. Si es tu caso, te lo decimos.
Te compensa si lo usas mucho o con datos tuyos
Si lo usa todo el equipo a diario, si procesas documentos por miles o si no quieres que tus datos salgan de casa, la cuota fija gana. Le hablas lo que quieras y la factura no cambia.
De la idea a tu IA funcionando.
Nos cuentas qué quieres
Qué quieres que haga, con qué documentos y cuánta gente lo va a usar. Una conversación, sin tecnicismos.
Te proponemos la máquina y el modelo
Con el precio de la máquina y el de la gestión por separado, y el motivo de cada elección. Si no te compensa, te lo decimos.
La montamos y la probamos con lo tuyo
Modelo, chat, accesos y copias, probados con tus documentos reales y no con ejemplos.
La administramos
Actualizaciones probadas, vigilancia y un equipo que conoce tu instalación. Tú la usas.
Si necesitas más, o menos.
Servidores dedicados con varias GPU
Para entrenar modelos grandes o servir varios modelos grandes a la vez, una tarjeta se queda corta. Lo montamos en un servidor dedicado con varias, con la misma gestión. Va siempre a presupuesto.
A lo mejor no necesitas GPU
Si lo que quieres es un asistente que hace tareas y piensa con un modelo de fuera, basta un servidor normal, mucho más barato. Lo vemos en la primera conversación.
Preguntas frecuentes
Un servidor con una tarjeta gráfica potente dentro. Es lo que hace falta para mover un modelo de inteligencia artificial con soltura: donde un servidor normal tarda minutos en cada respuesta, la GPU tarda segundos. La cifra que importa es la memoria de la tarjeta (VRAM), porque el modelo tiene que caber entero en ella.
¿Qué quieres que haga tu IA?
Cuéntanos qué quieres correr, con qué documentos y para cuándo. Te proponemos la máquina y el modelo, con el precio de todo. Y si creemos que no te compensa, te lo diremos.