# Tu IA, en España y sin guardar tus prompts

Inferencia de LLM privada con una API compatible con OpenAI, sobre GPU NVIDIA en nuestro centro de datos de Cogent en Madrid. Tus prompts no se guardan ni se usan para entrenar, y todo se procesa en España.

## Datos clave

- Nuevo · Madrid, España
- API compatible con OpenAI
- 576 GB de VRAM
- Sin guardar prompts
- RGPD, datos en España

## Cambiar es una línea

Si ya usas el SDK de OpenAI, apunta base_url a nuestro endpoint y elige el modelo. Chat completions y streaming, igual que ahora.

Endpoint de ejemplo: te lo damos al activar el servicio.

## Dos servidores GPU, cada uno para lo suyo

Un servidor de cada tipo en el centro de datos de Cogent en Madrid. Elegimos dónde corre tu modelo según su tamaño, la cuantización y el tipo de carga.

### Servidor 1: 4x NVIDIA RTX PRO 6000 Blackwell

384 GB de VRAM en un solo servidor para los modelos grandes: el modelo se reparte entre las cuatro GPU y responde desde una sola API.

| Especificación |   |
| --- | --- |
| GPU | 4x NVIDIA RTX PRO 6000 Blackwell |
| VRAM por GPU | 96 GB |
| VRAM total | 384 GB |
| Arquitectura | Blackwell |
| Ubicación | Cogent, Madrid |

Pensado para modelos grandes como GPT-OSS 120B o Llama 3.x 70B.

### Servidor 2: 4x NVIDIA RTX 6000 Ada

192 GB de VRAM para muchas peticiones a la vez: modelos medianos, embeddings y transcripción, con las peticiones agrupadas en lotes y repartidas entre las cuatro GPU.

| Especificación |   |
| --- | --- |
| GPU | 4x NVIDIA RTX 6000 Ada |
| VRAM por GPU | 48 GB |
| VRAM total | 192 GB |
| Arquitectura | Ada Lovelace |
| Ubicación | Cogent, Madrid |

Pensado para modelos de 7B a 32B, embeddings, Whisper y cargas con mucha concurrencia.

## Los modelos que ya usas

Familias abiertas habituales, servidas con la misma API. Qué tamaño cabe y en qué servidor depende del modelo y de la cuantización: te lo confirmamos antes de activar.

| Familia | Tamaños | Uso |
| --- | --- | --- |
| Llama 3.x | 8B, 70B | chat, código, multilingüe |
| Qwen 2.5 / Qwen3 | 7B a 72B | chat, código, razonamiento |
| DeepSeek R1 (distill) | 7B a 70B | razonamiento |
| Mistral / Mixtral | 7B, 24B, 8x7B | chat, multilingüe |
| Gemma | 2B a 27B | chat, resumen |
| GPT-OSS | 20B, 120B | chat, razonamiento, agentes |
| Phi | 3.8B, 14B | chat, ligero |
| Embeddings | BGE, E5, Qwen | búsqueda, RAG |
| Whisper | voz a texto | transcripción |

Según tamaño y cuantización. Sin cifras de rendimiento garantizadas.

### Tu modelo o una solución a medida

Cargamos tus pesos propios o ajustados (fine-tuned) y montamos soluciones completas: RAG sobre tus documentos privados, agentes y asistentes internos.

## Entra el prompt, sale la respuesta, no queda nada

Procesamos tu petición en Madrid y la olvidamos. Sin registros de contenido, sin entrenamiento con tus datos y sin salir de España.

- **No guardamos prompts:** Ni los prompts ni las respuestas se almacenan.
- **No entrenamos con tus datos:** Tus peticiones nunca se usan para entrenar modelos.
- **Todo en España:** La inferencia se hace en nuestros servidores de Cogent en Madrid.
- **RGPD:** Datos tratados en España, dentro de la Unión Europea.
- **Anti-DDoS delante:** El servicio queda detrás de Hostealo Shield, nuestra mitigación en Madrid.

Hostealo cuenta con certificación ISO 27001 y conformidad con el ENS categoría media.

- [ISO 27001](https://hostealo.es/iso-27001-certificate.pdf)
- [ENS categoría media](https://hostealo.es/ens-certificado-conformidad-medio.pdf)

## Para qué la usan las empresas

Casos que encajan con una IA privada en España.

- **Asistente interno con tus documentos:** RAG sobre contratos, manuales o tickets internos sin que salgan de España.
- **Atención al cliente:** Respuestas y borradores para tu equipo de soporte sobre tu propia base de conocimiento.
- **Análisis de documentos:** Resúmenes, extracción de datos y clasificación de textos largos.
- **Sector público y ENS:** Un proveedor español con ISO 27001 y ENS categoría media para proyectos con datos sensibles.
- **Desarrolladores:** Sustituye la API de OpenAI cambiando una línea y sigue usando el mismo SDK.
- **Transcripción y búsqueda:** Whisper para pasar audio a texto y embeddings para buscar en tu información.

## Preguntas frecuentes

Lo que suelen preguntarnos antes de pedir acceso.

### ¿Qué es la IA privada de Hostealo?

Es un servicio de inferencia de modelos de lenguaje (LLM) en nuestros servidores GPU de Madrid, con una API compatible con la de OpenAI. Tus aplicaciones envían las peticiones a nuestro endpoint y los modelos se ejecutan en España, en hardware de Hostealo.

### ¿Es compatible con la API de OpenAI?

Sí. El endpoint de chat completions es compatible, con streaming incluido. Con el SDK oficial de OpenAI solo cambias base_url y la clave de API, y eliges el modelo por su nombre.

### ¿Guardáis mis prompts o las respuestas?

No. Los prompts y las respuestas no se almacenan y nunca se usan para entrenar modelos. La petición se procesa y se descarta.

### ¿Dónde se procesan los datos?

En nuestros servidores del centro de datos de Cogent en Madrid. Todo el procesamiento se hace en España, dentro de la Unión Europea, de acuerdo con el RGPD.

### ¿Qué modelos puedo usar?

Familias abiertas habituales como Llama 3.x, Qwen 2.5 y Qwen3, las versiones distill de DeepSeek R1, Mistral y Mixtral, Gemma, GPT-OSS 20B y 120B y Phi, además de modelos de embeddings (BGE, E5, Qwen) y Whisper para transcripción. Qué tamaño cabe depende del modelo y de su cuantización; te lo confirmamos antes de activar.

### ¿Podéis cargar mi propio modelo o uno ajustado?

Sí. Cargamos pesos propios o ajustados (fine-tuned) siempre que quepan en la memoria de nuestras GPU, y también montamos soluciones a medida como RAG sobre tus documentos privados o agentes.

### ¿Qué hardware hay detrás?

Dos servidores en Madrid: uno con 4x NVIDIA RTX PRO 6000 Blackwell de 96 GB (384 GB de VRAM) para modelos grandes y otro con 4x NVIDIA RTX 6000 Ada de 48 GB (192 GB de VRAM) para modelos medianos, embeddings y cargas con mucha concurrencia. En total, 576 GB de VRAM.

### ¿Cuánto cuesta?

No publicamos precios: preparamos una propuesta según el caso de uso, el modelo y el volumen. Escríbenos por WhatsApp, por email o abre una solicitud desde tu área de clientes.

### ¿Puedo darme de alta y probarlo ya?

El acceso se da bajo solicitud: no hay alta automática ni plan gratuito. Cuéntanos qué quieres montar y te explicamos cómo empezar.

### ¿Sirve para proyectos del sector público?

Hostealo cuenta con certificación ISO 27001 y conformidad con el ENS categoría media, y los datos se procesan en España. Si tu proyecto tiene requisitos concretos, cuéntanoslos al pedir acceso y lo revisamos contigo.

## Cuéntanos qué quieres montar

No hay alta automática ni precios públicos: preparamos el acceso según tu caso de uso, el modelo y el volumen. Escríbenos por el canal que prefieras.

- **WhatsApp** (Respuesta rápida de ventas): [wa.me/34900433332](https://wa.me/34900433332?text=Hola%2C%20me%20interesa%20la%20IA%20privada%20de%20Hostealo%20(API%20compatible%20con%20OpenAI%20en%20Madrid).%20%C2%BFPodemos%20hablar%3F)
- **Email**: [contacto@hostealo.es](mailto:contacto@hostealo.es?subject=IA%20privada&body=Hola%2C%0A%0Ame%20interesa%20la%20IA%20privada%20de%20Hostealo.%0A%0AEmpresa%3A%0ACaso%20de%20uso%3A%0AModelo%20que%20nos%20interesa%3A%0AVolumen%20aproximado%20(peticiones%20o%20tokens%20al%20mes)%3A%0A%0AGracias.)
- **Abrir solicitud** (Desde tu área de clientes): [my.hostealo.com/support/new](https://my.hostealo.com/support/new?subject=Solicitud%20de%20acceso%3A%20IA%20privada&department=sales&body=Hola%2C%20quiero%20solicitar%20acceso%20a%20la%20IA%20privada.%0A%0AEmpresa%3A%0ACaso%20de%20uso%3A%0AModelo%20que%20nos%20interesa%3A%0AVolumen%20aproximado%20(peticiones%20o%20tokens%20al%20mes)%3A)

Si puedes, dinos: empresa, caso de uso, modelo que te interesa y volumen aproximado.

---

Versión HTML canónica: https://hostealo.es/ia-privada
