Tu IA, en España y sin guardar tus prompts
Inferencia de LLM privada con una API compatible con OpenAI, sobre GPU NVIDIA en nuestro centro de datos de Cogent en Madrid. Tus prompts no se guardan ni se usan para entrenar, y todo se procesa en España.
- API compatible con OpenAI
- 576 GB de VRAM
- Sin guardar prompts
- RGPD, datos en España
Cambiar es una línea
Si ya usas el SDK de OpenAI, apunta base_url a nuestro endpoint y elige el modelo. Chat completions y streaming, igual que ahora.
- chat/completions
- stream: true
- El modelo se elige por su nombre
1from openai import OpenAI23client = OpenAI(4 base_url="https://api.hostealo.com/v1",5 api_key="TU_API_KEY",6)78stream = client.chat.completions.create(9 model="qwen3-32b",10 messages=[{"role": "user", "content": "Resume este contrato en 3 puntos"}],11 stream=True,12)13for chunk in stream:14 print(chunk.choices[0].delta.conEndpoint de ejemplo: te lo damos al activar el servicio.
Dos servidores GPU, cada uno para lo suyo
Un servidor de cada tipo en el centro de datos de Cogent en Madrid. Elegimos dónde corre tu modelo según su tamaño, la cuantización y el tipo de carga.
4x NVIDIA RTX PRO 6000 Blackwell
384 GB de VRAM en un solo servidor para los modelos grandes: el modelo se reparte entre las cuatro GPU y responde desde una sola API.
- GPU
- 4x NVIDIA RTX PRO 6000 Blackwell
- VRAM por GPU
- 96 GB
- VRAM total
- 384 GB
- Arquitectura
- Blackwell
- Ubicación
- Cogent, Madrid
Pensado para modelos grandes como GPT-OSS 120B o Llama 3.x 70B.
4x NVIDIA RTX 6000 Ada
192 GB de VRAM para muchas peticiones a la vez: modelos medianos, embeddings y transcripción, con las peticiones agrupadas en lotes y repartidas entre las cuatro GPU.
- GPU
- 4x NVIDIA RTX 6000 Ada
- VRAM por GPU
- 48 GB
- VRAM total
- 192 GB
- Arquitectura
- Ada Lovelace
- Ubicación
- Cogent, Madrid
Pensado para modelos de 7B a 32B, embeddings, Whisper y cargas con mucha concurrencia.
Los modelos que ya usas
Familias abiertas habituales, servidas con la misma API. Qué tamaño cabe y en qué servidor depende del modelo y de la cuantización: te lo confirmamos antes de activar.
Qwen 2.5 / Qwen3
DeepSeek R1 (distill)
Mistral / Mixtral
Gemma
GPT-OSS
Phi
Embeddings
Whisper
Tu modelo o una solución a medida
Cargamos tus pesos propios o ajustados (fine-tuned) y montamos soluciones completas: RAG sobre tus documentos privados, agentes y asistentes internos.
Según tamaño y cuantización. Sin cifras de rendimiento garantizadas.
Entra el prompt, sale la respuesta, no queda nada
Procesamos tu petición en Madrid y la olvidamos. Sin registros de contenido, sin entrenamiento con tus datos y sin salir de España.
No guardamos prompts
Ni los prompts ni las respuestas se almacenan.
No entrenamos con tus datos
Tus peticiones nunca se usan para entrenar modelos.
Todo en España
La inferencia se hace en nuestros servidores de Cogent en Madrid.
RGPD
Datos tratados en España, dentro de la Unión Europea.
Anti-DDoS delante
El servicio queda detrás de Hostealo Shield, nuestra mitigación en Madrid.
Hostealo cuenta con certificación ISO 27001 y conformidad con el ENS categoría media.
Para qué la usan las empresas
Casos que encajan con una IA privada en España.
Asistente interno con tus documentos
Atención al cliente
Análisis de documentos
Sector público y ENS
Desarrolladores
Transcripción y búsqueda
Preguntas frecuentes
Lo que suelen preguntarnos antes de pedir acceso.
Es un servicio de inferencia de modelos de lenguaje (LLM) en nuestros servidores GPU de Madrid, con una API compatible con la de OpenAI. Tus aplicaciones envían las peticiones a nuestro endpoint y los modelos se ejecutan en España, en hardware de Hostealo.
Sí. El endpoint de chat completions es compatible, con streaming incluido. Con el SDK oficial de OpenAI solo cambias base_url y la clave de API, y eliges el modelo por su nombre.
No. Los prompts y las respuestas no se almacenan y nunca se usan para entrenar modelos. La petición se procesa y se descarta.
En nuestros servidores del centro de datos de Cogent en Madrid. Todo el procesamiento se hace en España, dentro de la Unión Europea, de acuerdo con el RGPD.
Familias abiertas habituales como Llama 3.x, Qwen 2.5 y Qwen3, las versiones distill de DeepSeek R1, Mistral y Mixtral, Gemma, GPT-OSS 20B y 120B y Phi, además de modelos de embeddings (BGE, E5, Qwen) y Whisper para transcripción. Qué tamaño cabe depende del modelo y de su cuantización; te lo confirmamos antes de activar.
Sí. Cargamos pesos propios o ajustados (fine-tuned) siempre que quepan en la memoria de nuestras GPU, y también montamos soluciones a medida como RAG sobre tus documentos privados o agentes.
Dos servidores en Madrid: uno con 4x NVIDIA RTX PRO 6000 Blackwell de 96 GB (384 GB de VRAM) para modelos grandes y otro con 4x NVIDIA RTX 6000 Ada de 48 GB (192 GB de VRAM) para modelos medianos, embeddings y cargas con mucha concurrencia. En total, 576 GB de VRAM.
No publicamos precios: preparamos una propuesta según el caso de uso, el modelo y el volumen. Escríbenos por WhatsApp, por email o abre una solicitud desde tu área de clientes.
El acceso se da bajo solicitud: no hay alta automática ni plan gratuito. Cuéntanos qué quieres montar y te explicamos cómo empezar.
Hostealo cuenta con certificación ISO 27001 y conformidad con el ENS categoría media, y los datos se procesan en España. Si tu proyecto tiene requisitos concretos, cuéntanoslos al pedir acceso y lo revisamos contigo.
Cuéntanos qué quieres montar
No hay alta automática ni precios públicos: preparamos el acceso según tu caso de uso, el modelo y el volumen. Escríbenos por el canal que prefieras.
Si puedes, dinos: empresa, caso de uso, modelo que te interesa y volumen aproximado.

