Saltar al contenido
Nuevo · Madrid, España

Tu IA, en España y sin guardar tus prompts

Inferencia de LLM privada con una API compatible con OpenAI, sobre GPU NVIDIA en nuestro centro de datos de Cogent en Madrid. Tus prompts no se guardan ni se usan para entrenar, y todo se procesa en España.

  • API compatible con OpenAI
  • 576 GB de VRAM
  • Sin guardar prompts
  • RGPD, datos en España
OpenAI API

Cambiar es una línea

Si ya usas el SDK de OpenAI, apunta base_url a nuestro endpoint y elige el modelo. Chat completions y streaming, igual que ahora.

  • chat/completions
  • stream: true
  • El modelo se elige por su nombre
1from openai import OpenAI
2
3client = OpenAI(
4 base_url="https://api.hostealo.com/v1",
5 api_key="TU_API_KEY",
6)
7
8stream = client.chat.completions.create(
9 model="qwen3-32b",
10 messages=[{"role": "user", "content": "Resume este contrato en 3 puntos"}],
11 stream=True,
12)
13for chunk in stream:
14 print(chunk.choices[0].delta.con
Salida (streaming)Respuesta completa
1. Duración de 24 meses con renovación automática. 2. Penalización del 20 % por baja anticipada. 3. Los datos se tratan en la UE conforme al RGPD.

Endpoint de ejemplo: te lo damos al activar el servicio.

Hardware en Madrid

Dos servidores GPU, cada uno para lo suyo

Un servidor de cada tipo en el centro de datos de Cogent en Madrid. Elegimos dónde corre tu modelo según su tamaño, la cuantización y el tipo de carga.

576 GB VRAM8 GPU NVIDIACogent Madrid
Servidor 1384 GB

4x NVIDIA RTX PRO 6000 Blackwell

384 GB de VRAM en un solo servidor para los modelos grandes: el modelo se reparte entre las cuatro GPU y responde desde una sola API.

GPU
4x NVIDIA RTX PRO 6000 Blackwell
VRAM por GPU
96 GB
VRAM total
384 GB
Arquitectura
Blackwell
Ubicación
Cogent, Madrid

Pensado para modelos grandes como GPT-OSS 120B o Llama 3.x 70B.

Servidor 2192 GB

4x NVIDIA RTX 6000 Ada

192 GB de VRAM para muchas peticiones a la vez: modelos medianos, embeddings y transcripción, con las peticiones agrupadas en lotes y repartidas entre las cuatro GPU.

GPU
4x NVIDIA RTX 6000 Ada
VRAM por GPU
48 GB
VRAM total
192 GB
Arquitectura
Ada Lovelace
Ubicación
Cogent, Madrid

Pensado para modelos de 7B a 32B, embeddings, Whisper y cargas con mucha concurrencia.

Los modelos que ya usas

Familias abiertas habituales, servidas con la misma API. Qué tamaño cabe y en qué servidor depende del modelo y de la cuantización: te lo confirmamos antes de activar.

Llama 3.x

8B, 70B
chatcódigomultilingüe

Qwen 2.5 / Qwen3

7B a 72B
chatcódigorazonamiento

DeepSeek R1 (distill)

7B a 70B
razonamiento

Mistral / Mixtral

7B, 24B, 8x7B
chatmultilingüe

Gemma

2B a 27B
chatresumen

GPT-OSS

20B, 120B
chatrazonamientoagentes

Phi

3.8B, 14B
chatligero

Embeddings

BGE, E5, Qwen
búsquedaRAG

Whisper

voz a texto
transcripción

Tu modelo o una solución a medida

Cargamos tus pesos propios o ajustados (fine-tuned) y montamos soluciones completas: RAG sobre tus documentos privados, agentes y asistentes internos.

Cuéntanos tu caso

Según tamaño y cuantización. Sin cifras de rendimiento garantizadas.

RGPD

Entra el prompt, sale la respuesta, no queda nada

Procesamos tu petición en Madrid y la olvidamos. Sin registros de contenido, sin entrenamiento con tus datos y sin salir de España.

  • No guardamos prompts

    Ni los prompts ni las respuestas se almacenan.

  • No entrenamos con tus datos

    Tus peticiones nunca se usan para entrenar modelos.

  • Todo en España

    La inferencia se hace en nuestros servidores de Cogent en Madrid.

  • RGPD

    Datos tratados en España, dentro de la Unión Europea.

  • Anti-DDoS delante

    El servicio queda detrás de Hostealo Shield, nuestra mitigación en Madrid.

Hostealo cuenta con certificación ISO 27001 y conformidad con el ENS categoría media.

Para qué la usan las empresas

Casos que encajan con una IA privada en España.

Asistente interno con tus documentos

RAG sobre contratos, manuales o tickets internos sin que salgan de España.

Atención al cliente

Respuestas y borradores para tu equipo de soporte sobre tu propia base de conocimiento.

Análisis de documentos

Resúmenes, extracción de datos y clasificación de textos largos.

Sector público y ENS

Un proveedor español con ISO 27001 y ENS categoría media para proyectos con datos sensibles.

Desarrolladores

Sustituye la API de OpenAI cambiando una línea y sigue usando el mismo SDK.

Transcripción y búsqueda

Whisper para pasar audio a texto y embeddings para buscar en tu información.

Preguntas frecuentes

Lo que suelen preguntarnos antes de pedir acceso.

Es un servicio de inferencia de modelos de lenguaje (LLM) en nuestros servidores GPU de Madrid, con una API compatible con la de OpenAI. Tus aplicaciones envían las peticiones a nuestro endpoint y los modelos se ejecutan en España, en hardware de Hostealo.

Sí. El endpoint de chat completions es compatible, con streaming incluido. Con el SDK oficial de OpenAI solo cambias base_url y la clave de API, y eliges el modelo por su nombre.

No. Los prompts y las respuestas no se almacenan y nunca se usan para entrenar modelos. La petición se procesa y se descarta.

En nuestros servidores del centro de datos de Cogent en Madrid. Todo el procesamiento se hace en España, dentro de la Unión Europea, de acuerdo con el RGPD.

Familias abiertas habituales como Llama 3.x, Qwen 2.5 y Qwen3, las versiones distill de DeepSeek R1, Mistral y Mixtral, Gemma, GPT-OSS 20B y 120B y Phi, además de modelos de embeddings (BGE, E5, Qwen) y Whisper para transcripción. Qué tamaño cabe depende del modelo y de su cuantización; te lo confirmamos antes de activar.

Sí. Cargamos pesos propios o ajustados (fine-tuned) siempre que quepan en la memoria de nuestras GPU, y también montamos soluciones a medida como RAG sobre tus documentos privados o agentes.

Dos servidores en Madrid: uno con 4x NVIDIA RTX PRO 6000 Blackwell de 96 GB (384 GB de VRAM) para modelos grandes y otro con 4x NVIDIA RTX 6000 Ada de 48 GB (192 GB de VRAM) para modelos medianos, embeddings y cargas con mucha concurrencia. En total, 576 GB de VRAM.

No publicamos precios: preparamos una propuesta según el caso de uso, el modelo y el volumen. Escríbenos por WhatsApp, por email o abre una solicitud desde tu área de clientes.

El acceso se da bajo solicitud: no hay alta automática ni plan gratuito. Cuéntanos qué quieres montar y te explicamos cómo empezar.

Hostealo cuenta con certificación ISO 27001 y conformidad con el ENS categoría media, y los datos se procesan en España. Si tu proyecto tiene requisitos concretos, cuéntanoslos al pedir acceso y lo revisamos contigo.

Acceso bajo solicitud

Cuéntanos qué quieres montar

No hay alta automática ni precios públicos: preparamos el acceso según tu caso de uso, el modelo y el volumen. Escríbenos por el canal que prefieras.

Si puedes, dinos: empresa, caso de uso, modelo que te interesa y volumen aproximado.