Ir al contenido
Avantys .
Avantys Transforma Servidores con GPU
// TRANSFORMA · SERVIDORES CON GPU

Tu propia IA, en un servidor con GPU.

Elegimos la tarjeta que necesita tu modelo, te la entregamos con él funcionando y cerrada a internet, y nuestro equipo la mantiene. Tú la usas; nosotros respondemos por ella.

Entera La tarjeta, solo para ti
A medida La tarjeta que pide tu modelo
Una o varias GPU por servidor
Europa Tus datos, en casa
Gestionada Por personas, no por un robot

Tenemos servidores con GPU desde los pensados para un modelo pequeño hasta los que llevan varias tarjetas profesionales. No te vendemos una máquina de catálogo: elegimos la que necesita lo que quieres hacer, y la administramos igual sea cual sea.

// QUÉ ES

Qué es un servidor con GPU.

Un servidor con GPU es un servidor normal con una tarjeta gráfica potente dentro. La tarjeta es lo que hace que un modelo de inteligencia artificial conteste en segundos: sin ella, el mismo modelo tarda minutos en cada respuesta o directamente no arranca. La cifra que manda es la memoria gráfica, la VRAM, porque el modelo tiene que caber entero ahí dentro.

Tenerla tuya cambia dos cosas. La primera, que lo que le preguntas al modelo no sale de tu máquina: no hay una empresa de fuera leyendo tus contratos ni tus correos. La segunda, que no pagas por pregunta: pagas la máquina al mes y le hablas lo que quieras. A cambio, alguien tiene que montarla, mantenerla y responder cuando falla. Esa parte es la nuestra.

// LO QUE TE LLEVAS

Qué te entregamos.

No es una máquina vacía con acceso root. Es esto, funcionando.

La máquina justa

Con la tarjeta que pide tu modelo, ni más ni menos, el sistema instalado, los controladores de la tarjeta (los drivers de NVIDIA y CUDA) probados y todo en orden antes de que entres.

Tu modelo, respondiendo

Elegimos contigo el modelo que encaja con lo que quieres hacer y con lo que cabe, y lo dejamos funcionando con el programa que lo sirve (Ollama o vLLM).

Un chat privado para tu equipo

Una ventana tipo ChatGPT en tu propia dirección, con un usuario por persona. Tu equipo entra desde el navegador y no instala nada.

Una API para tus programas

La misma forma de conectar que usa OpenAI, así que lo que ya habla con ChatGPT (n8n, tu CRM, tus scripts) puede hablar con tu modelo cambiando una dirección.

Cerrada a internet

Cortafuegos, accesos con usuario y contraseña y, si hace falta, conexión privada. Tu modelo solo lo usa quien tú digas.

Vigilada

No miramos solo si la máquina está encendida: comprobamos que el modelo contesta y cómo van la memoria, la temperatura y el uso de la tarjeta.

Copias de lo tuyo

La configuración, los modelos que hayas adaptado y los datos de tu chat, con copias que comprobamos que se pueden recuperar.

Personas, no tickets

Un equipo que conoce tu máquina y lo que corre en ella. Cuando escribes, no empiezas de cero.

// CUÁNTA VRAM NECESITAS

Qué tarjeta necesita tu modelo.

Tamaño del modelo Ejemplos Comprimido (Q4) Calidad alta (Q8) Sin comprimir (FP16) Qué tarjeta te hace falta
7-8 mil millones Las versiones pequeñas de Llama, Qwen o Mistral 4,6 GB 8 GB 16 GB Una de gama de entrada. Con una grande, caben varios a la vez.
14 mil millones Las medianas de Qwen o Phi 8 GB 14 GB 28 GB Una de gama media, o de entrada si va comprimido.
32 mil millones Las grandes de Qwen o Gemma 18,2 GB 32 GB 64 GB Una de gama alta. Es el punto dulce para un asistente de empresa que razona bien.
70 mil millones Las más grandes de Llama o Qwen 39,9 GB 70 GB 140 GB Una profesional de las grandes, comprimido. En calidad alta o sin comprimir, varias.

Un ejemplo: en una tarjeta de 96 GB cabe un modelo de 70 mil millones comprimido y con margen para documentos largos, o varios modelos pequeños a la vez. Las cifras son orientativas de lo que ocupa el modelo en sí. Encima hay que sumar un 15-20 % de margen y la memoria del contexto, que es lo que suele pillar desprevenido: un modelo de 70 mil millones leyendo un documento de unas 100 páginas puede necesitar decenas de GB más. Por eso no elegimos el modelo por su fama, sino midiendo con tus documentos.

¿No sabes qué tarjeta te hace falta? Cuéntanos qué quieres correr y lo medimos por ti.

Que lo midáis vosotros
// PARA QUÉ SE USA

Para qué la usa una empresa.

Un asistente que conoce tu empresa

Le das tus procedimientos, tus tarifas y tus manuales, y tu equipo le pregunta como a un compañero veterano. Contesta citando de qué documento sale, para que se pueda comprobar.

Clases y reuniones pasadas a texto

Una academia que graba sus clases las deja transcribiendo por la noche y por la mañana tiene el texto y el resumen, listos para subir al aula virtual. Sin pagar por minuto y sin mandar la voz de nadie fuera.

Preguntar a miles de documentos

Contratos, expedientes, fichas técnicas. En vez de buscar a mano, preguntas "qué contratos vencen este trimestre con penalización" y te devuelve la lista con el enlace a cada uno.

Imágenes para tu tienda

Fondos de producto, variaciones de color y piezas para redes, generadas en tu máquina. Haces cien pruebas o mil y la factura es la misma.

Automatizaciones que piensan

Tus flujos de n8n clasifican correos, resumen pedidos o redactan respuestas llamando a tu modelo, no a uno que cobra por cada llamada y se queda con los datos.

Render y vídeo

Con una tarjeta profesional, las escenas de Blender o Cinema 4D y el vídeo en 4K dejan de ser un problema. Lo que en tu ordenador tarda una noche se manda a la máquina y tú sigues trabajando.

// QUÉ TE INSTALAMOS

Lo que te podemos instalar.

Cada pieza, montada, conectada con las demás y mantenida. Y si quieres saber cómo funciona por dentro, tienes la guía al lado.

Tu modelo de IA

Llama, Qwen, Mistral, Gemma o el que encaje con tu tarea y con tu licencia. Lo elegimos probándolo con tus documentos, no por fama.

Qué modelo elegir

El programa que lo sirve

Ollama si lo usa tu equipo, vLLM si lo llaman tus aplicaciones cientos de veces al día. Con la misma conexión que la API de OpenAI.

Ollama, vLLM o llama.cpp

Un chat privado para tu equipo

Open WebUI: una ventana tipo ChatGPT en tu dirección, con un usuario por persona y el historial en tu máquina.

Cómo funciona Open WebUI

Preguntar a tus documentos

Contratos, manuales o expedientes en una base de conocimiento. Le preguntas y te contesta citando de dónde lo saca.

Cómo se pregunta a documentos

Transcripción de audio

Whisper pasa a texto clases, reuniones y llamadas, con subtítulos si los necesitas. El audio no sale de tu máquina.

Cómo funciona Whisper

Generación de imágenes

ComfyUI con modelos de imagen de licencia comercial: fondos de producto, variaciones y piezas para redes, sin pagar por imagen.

Imágenes en tu servidor

Automatizaciones con IA

Tus flujos de n8n clasificando correos o resumiendo pedidos con tu modelo, en vez de con uno que cobra por llamada.

n8n con tu propio modelo

Todo cerrado a internet

Cortafuegos, accesos con usuario y, si hace falta, conexión privada. Nada de modelos abiertos para cualquiera.

Por qué importa

¿Ves lo que necesitas? Dinos para qué lo quieres y te decimos qué piezas montar.

// LA MÁQUINA SOLA O CON NOSOTROS

Qué haces tú y qué hacemos nosotros.

Casi todos los proveedores te dan la máquina con los controladores instalados, y ahí termina su parte.

La máquina sola Con nosotros
Poner la máquina en marcha Te dan el acceso y el sistema con CUDA. El resto es cosa tuya Te la entregamos con tu modelo contestando
Elegir qué modelo cabe Pruebas, se queda sin memoria, vuelves a probar Lo medimos con tus documentos antes de decidir
Una actualización del sistema toca el controlador La tarjeta deja de responder y te toca averiguar por qué Probamos antes y actualizamos en ventana
Que nadie de fuera use tu modelo El programa que lo sirve no trae contraseña de serie Cerrado desde el primer día
El disco se llena de modelos Te enteras cuando el siguiente no se descarga Lo vigilamos y limpiamos lo que no se usa
Deja de contestar un martes a las nueve Lo descubre tu equipo Lo vemos nosotros y lo levantamos
La tarjeta lleva semanas parada La sigues pagando sin saberlo Te avisamos, por si no te compensa
// LO QUE NADIE TE CUENTA

Lo que se rompe cuando nadie la administra.

El controlador que se desincroniza

Es el fallo más típico de estas máquinas. El sistema se actualiza solo, instala una versión nueva del controlador de NVIDIA y la tarjeta deja de responder con un error que tiene nombre propio: "Failed to initialize NVML". El modelo no arranca y nadie ha tocado nada. Se evita controlando qué se actualiza y cuándo, y probándolo antes.

El modelo abierto a todo internet

Ollama, el programa más usado para servir modelos, no trae contraseña de serie. Un estudio de seguridad publicado en enero de 2026 contó unas 175.000 máquinas con Ollama abiertas a internet en 130 países, casi la mitad capaces de ejecutar acciones. Cualquiera podía usarlas, gastar su tarjeta y leer lo que se les pedía.

El disco que se llena

Cada modelo ocupa decenas de GB, y probar cinco es muy fácil. Cuando el disco se llena, el siguiente no se descarga, las copias fallan y a veces el propio sistema se queda sin sitio para trabajar.

El documento largo que lo tumba

El modelo va perfecto en las pruebas y un día alguien le pasa un informe de 200 páginas. La memoria del contexto se dispara, la tarjeta se queda corta y el servicio se cae. Se evita dimensionando con documentos reales y poniendo límites.

Todo esto lo vigilamos nosotros para que no lo descubra tu equipo.

Que lo llevéis vosotros
// TUS DATOS

Tus datos se quedan en tu máquina.

Cuando usas un servicio de IA de fuera, lo que le escribes viaja a sus servidores. La Agencia Española de Protección de Datos, en su propia política de uso de IA generativa (noviembre de 2025), pide mirar antes cuatro cosas del proveedor: si usa las conversaciones para entrenar, dónde guarda los datos, cuánto tiempo y si su personal las lee.

Con tu propia máquina, las cuatro respuestas las decides tú: no entrena con nada, los datos se quedan en Europa, se borran cuando tú digas y no los lee nadie que no hayas autorizado. Eso no te hace cumplir el RGPD solo, porque qué datos le das y quién entra sigue siendo cosa tuya, pero te quita de encima la parte más difícil de justificar. Lo vemos contigo antes de montar nada.

// ¿TE COMPENSA?

Máquina propia o pagar por uso.

Pagar por uso

Te compensa si lo usas poco

Si le haces unas decenas de preguntas al día y no hay datos delicados de por medio, un servicio de pago por uso te sale más barato que una máquina encendida todo el mes. Si es tu caso, te lo decimos.

Máquina propia

Te compensa si lo usas mucho o con datos tuyos

Si lo usa todo el equipo a diario, si procesas documentos por miles o si no quieres que tus datos salgan de casa, la cuota fija gana. Le hablas lo que quieras y la factura no cambia.

// CÓMO TRABAJAMOS

De la idea a tu IA funcionando.

01

Nos cuentas qué quieres

Qué quieres que haga, con qué documentos y cuánta gente lo va a usar. Una conversación, sin tecnicismos.

02

Te proponemos la máquina y el modelo

Con el precio de la máquina y el de la gestión por separado, y el motivo de cada elección. Si no te compensa, te lo decimos.

03

La montamos y la probamos con lo tuyo

Modelo, chat, accesos y copias, probados con tus documentos reales y no con ejemplos.

04

La administramos

Actualizaciones probadas, vigilancia y un equipo que conoce tu instalación. Tú la usas.

// OTRAS MEDIDAS

Si necesitas más, o menos.

Más de una tarjeta

Servidores dedicados con varias GPU

Para entrenar modelos grandes o servir varios modelos grandes a la vez, una tarjeta se queda corta. Lo montamos en un servidor dedicado con varias, con la misma gestión. Va siempre a presupuesto.

Menos de lo que parece

A lo mejor no necesitas GPU

Si lo que quieres es un asistente que hace tareas y piensa con un modelo de fuera, basta un servidor normal, mucho más barato. Lo vemos en la primera conversación.

Ver servidores dedicados Ver VPS gestionado

// FAQ

Preguntas frecuentes

Un servidor con una tarjeta gráfica potente dentro. Es lo que hace falta para mover un modelo de inteligencia artificial con soltura: donde un servidor normal tarda minutos en cada respuesta, la GPU tarda segundos. La cifra que importa es la memoria de la tarjeta (VRAM), porque el modelo tiene que caber entero en ella.

¿Qué quieres que haga tu IA?

Cuéntanos qué quieres correr, con qué documentos y para cuándo. Te proponemos la máquina y el modelo, con el precio de todo. Y si creemos que no te compensa, te lo diremos.