LM Studio — Servidor Local OpenAI-Compatible
Guía completa de LM Studio en ChatCielo: instala modelos GGUF, levanta el servidor en http://localhost:1234/v1 y conecta ChatCielo en minutos para pruebas locales antes de producción
LM Studio en ChatCielo
LM Studio es la forma más rápida de probar modelos GGUF en tu PC con interfaz visual y exponerlos como un servidor OpenAI-compatible en http://localhost:1234/v1. ChatCielo lo consume igual que a OpenAI — cambias solo el Base URL. Ideal para validar prompts, comparar modelos y hacer demos on-premise antes de pasar a Ollama en servidor.
Usa LM Studio en tu notebook/PC para iterar rápido y, cuando el prompt y el modelo estén validados, migra el mismo modelo (o su equivalente cuantizado) a Ollama en VPS para producción. La API es idéntica: lo que funciona en localhost:1234 funciona en ollama.tudominio.com.
Qué es LM Studio y por qué usarlo
| Característica | Detalle |
|---|---|
| Interfaz visual | Busca, descarga y prueba modelos sin tocar la terminal. Conversación, parámetros y logs en una sola ventana. |
| Modelos GGUF | Soporta Llama 3.3, Mistral, Qwen 2.5, Gemma, Phi en formatos Q4_K_M, Q5, Q8 — cuantizaciones que corren en CPU/GPU de consumo. |
| Servidor OpenAI-compatible | Levanta POST /v1/chat/completions, GET /v1/models y POST /v1/completions en http://localhost:1234/v1 con un clic. |
| 100% local y offline | Una vez descargado el GGUF, funciona sin internet. Privacidad total para pruebas con datos sensibles. |
| Cambio de modelo en caliente | Cargas otro GGUF y el endpoint responde con el nuevo modelo sin reiniciar ChatCielo — solo cambia el nombre en la configuración. |
1. Instalación
- Ve a lmstudio.ai y descarga el instalador para tu sistema.
- Instala y abre LM Studio.
- En la primera apertura acepta los términos — no requiere cuenta para uso local.
- Verifica que detecta tu GPU: ve a Settings > System y confirma
GPU acceleration: Available(Metal en macOS, CUDA/Vulkan en Windows). Si no tienes GPU dedicada, funcionará en CPU — más lento pero válido para pruebas.
2. Selección y descarga de modelos GGUF
En LM Studio, abre la pestaña Discover (🔍) o Search.
Modelos recomendados para ChatCielo (español neutro)
| Modelo en LM Studio | Nombre GGUF típico | Tamaño | VRAM/RAM Q4 | Ideal para |
|---|---|---|---|---|
| Llama 3.3 70B Instruct Q4 | llama-3.3-70b-instruct-Q4_K_M.gguf | ~42 GB | ~24 GB | Ventas / soporte calidad premium local |
| Qwen 2.5 14B Instruct Q4 | qwen2.5-14b-instruct-q4_k_m.gguf | ~9 GB | ~9 GB | Sweet spot — multilingüe, rápido, cabe en RTX 3060/4060 |
| Qwen 2.5 32B Instruct Q4 | qwen2.5-32b-instruct-q4_k_m.gguf | ~20 GB | ~20 GB | Calidad superior si tienes 24 GB |
| Mistral 7B Instruct Q4 | mistral-7b-instruct-v0.3-Q4_K_M.gguf | ~4.5 GB | ~5 GB | Triaje ultraligero, prueba en CPU |
| Gemma 2 9B Instruct Q4 | gemma-2-9b-it-Q4_K_M.gguf | ~6 GB | ~6 GB | Alternativa equilibrada, buen español |
Si tu PC tiene 8 GB RAM y sin GPU dedicada, descarga solo mistral-7b o qwen2.5-7b en Q4_K_M. Modelos de 14B+ requieren 16 GB RAM mínimo y serán lentos en CPU. En ese caso prueba en la nube con Ollama VPS.
Cómo descargar:
- En Discover, busca por ejemplo
qwen2.5 14by filtra porGGUF. - Elige la variante
Q4_K_M(cuantización recomendada: mejor equilibrio calidad/peso). - Haz clic en Download. LM Studio lo guarda en
~/.cache/lm-studio/models/. - Repite para los 2–3 modelos que quieras comparar.
Cómo elegir cuantización
| Cuantización | Calidad | VRAM | Cuándo usar |
|---|---|---|---|
Q2_K | Baja | Mínima | Solo si no cabe nada más — alucina más |
Q4_K_M | Muy buena | Media | Recomendada para ChatCielo — 95% de la calidad FP16 con 25% del peso |
Q5_K_M | Excelente | Media-alta | Si tienes VRAM de sobra y quieres máxima fidelidad |
Q8_0 | Casi idéntica a FP16 | Alta | Solo para validación final, no necesaria en producción |
3. Levantar el servidor local OpenAI-compatible
Carga el modelo
- Ve a la pestaña Chat (💬) en LM Studio.
- Arriba, en Select a model to load, elige el GGUF descargado (ej.
qwen2.5-14b-instruct-q4_k_m). - Ajusta parámetros de carga:
- Context Length (n_ctx):
4096para pruebas,8192si tu prompt es largo. No subas a 32k si tu PC es modesta — consume RAM. - GPU Offload: ponlo al máximo que permita tu VRAM (ej.
35/35 layerssi tienes 24 GB).
- Context Length (n_ctx):
- Haz clic en Load Model. Espera a que diga
Model loaded.
Inicia el servidor
- Ve a la pestaña Local Server (↔️) en el lateral izquierdo.
- Arriba verás Server Status: Stopped y el modelo cargado.
- Configura:
- Port:
1234(por defecto). - CORS: habilita
Enable CORSsi probarás desde el navegador.
- Port:
- Haz clic en Start Server.
Verás:
Anota exactamente lo que muestra LM Studio como Server URL: por defecto es http://localhost:1234/v1. Ese es el Base URL que pegarás en ChatCielo.
Prueba el servidor con curl (verificación obligatoria)
Abre una terminal y ejecuta:
Si responde coherentemente en español, el servidor está listo para ChatCielo.
Prueba también con llama o mistral cambiando el campo model por el nombre exacto que muestra GET /v1/models.
4. Configuración en ChatCielo
ChatCielo se conecta a LM Studio exactamente igual que a Ollama: como proveedor OpenAI compatible vía Base URL.
Configura el canal
Ve a Canales > Tu canal > Integración IA > OpenAI / ChatGPT.
| Campo | Qué poner para LM Studio local | Ejemplo |
|---|---|---|
| Proveedor / Tipo | OpenAI (compatible) o OpenAI | — |
| Base URL | http://localhost:1234/v1 si ChatCielo corre en la misma máquina que LM Studio | http://localhost:1234/v1 |
| Base URL (si ChatCielo está en la nube/VPS) | Usa la IP de tu PC en la red local o un túnel | http://192.168.1.50:1234/v1 o https://xxxx.trycloudflare.com/v1 |
| API Key | Cualquiera — LM Studio no valida por defecto | lm-studio o sk-local |
| Modelo | Nombre exacto que devuelve GET /v1/models | qwen2.5-14b-instruct-q4_k_m, mistral-7b-instruct-v0.3-Q4_K_M |
| Prompt del Sistema | Tus instrucciones (ver plantillas en Ollama) | — |
| Temperatura | 0–2 | 0.3 soporte, 0.6 ventas |
| Max Tokens | 150–4096 | 350–500 para WhatsApp |
| Palabra clave de derivación | hablar con asesor, asesor humano | — |
Si ChatCielo no está en localhost — cómo exponer LM Studio
LM Studio por defecto solo escucha en 127.0.0.1. Si tu ChatCielo está en otro equipo o en la nube:
Opción A — Misma red Wi-Fi / LAN (pruebas oficina):
Opción B — Tailscale / ngrok (recomendado para demos con cliente):
No expongas LM Studio directo a internet sin túnel autenticado. Es un servidor de desarrollo sin auth. Para producción real usa Ollama + Nginx + Bearer en un VPS.
Pruebas en local y validación
- En ChatCielo haz clic en Probar / Enviar mensaje de prueba con: "Hola, ¿cuánto tarda el envío a Lima?"
- Verifica que la respuesta llegue en <2 s (en GPU) o 3–6 s (en CPU) y en español neutro.
- Haz pruebas cruzadas cambiando el modelo:
- Carga
mistral-7ben LM Studio → cambia Modelo en ChatCielo amistral-7b...→ prueba de nuevo. - Carga
qwen2.5-14b→ cambia y compara calidad.
- Carga
- Desde tu PC prueba el webhook que usará ChatCielo:
- Con un número de WhatsApp de prueba, escribe al canal conectado y confirma que el flujo completo (cliente → ChatCielo → LM Studio → ChatCielo → WhatsApp) funciona.
5. Consejos de uso y flujo hacia producción
- Itera prompts en minutos con interfaz visual — sin Docker ni
curl. - Compara 3 modelos en una tarde y decide cuál vale la pena llevar a servidor.
- Haz demos al cliente con datos ficticios sin gastar tokens en la nube.
- Limitaciones: no es un servidor hardening para producción (sin auth, sin réplicas, sin logs centralizados).
6. Parámetros y troubleshooting
| Campo en LM Studio | Recomendado para ChatCielo | Nota |
|---|---|---|
| Context Length (n_ctx) | 4096–8192 | Más contexto = más RAM. Para prompts de WhatsApp con histórico de 10 mensajes, 4096 basta. |
| Temperature | 0.2–0.4 soporte, 0.5–0.6 ventas | Se configura en ChatCielo por request, no en la carga del modelo. |
| GPU Offload | Todo lo que permita tu VRAM | Si se queda sin VRAM, LM Studio hace offload a RAM (más lento). |
| Repeat Penalty | 1.05–1.1 | Evita repeticiones en modelos pequeños. |
| Problema | Causa | Solución |
|---|---|---|
Failed to load model | GGUF corrupto o RAM insuficiente | Re-descarga el GGUF y baja n_ctx a 2048. Cierra otras apps. |
Connection refused en ChatCielo | LM Studio en 127.0.0.1 y ChatCielo en otra máquina | Usa túnel cloudflared/ngrok o pon ChatCielo en la misma máquina para pruebas. |
model not found | Nombre de modelo distinto al que muestra GET /v1/models | Copia exactamente el id que devuelve curl localhost:1234/v1/models y pégalo en ChatCielo. |
| Respuestas en inglés o alucina | Prompt sin "español neutro" o modelo muy pequeño | Agrega "Responde siempre en español neutro" al system prompt y prueba qwen2.5:14b en lugar de mistral:7b. |
| Muy lento (>8 s) | CPU sin GPU y modelo grande | Cambia a mistral-7b Q4 o qwen2.5-7b Q4 para CPU, o pasa a VPS con GPU. |
| ChatCielo dice "timeout" | max_tokens muy alto + modelo lento | Baja max_tokens a 350 y prueba de nuevo. |
Comandos útiles (si usas CLI de LM Studio / curl)
Cuando tu prompt esté estable en LM Studio, documenta modelo exacto + cuantización + n_ctx + prompt final + temperatura y pásalo a tu VPS de Ollama. Así replicas el comportamiento 1:1 en producción sin sorpresas.
7. Siguiente paso
- Si validaste en LM Studio y quieres pasar a producción on-premise, sigue la guía de Ollama — misma API, pero en servidor 24/7 con GPU y dominio propio.
- Para base de conocimiento con PDFs locales, combina LM Studio/Ollama con Dify on-premise.
- Si prefieres no gestionar GPU, evalúa DeepSeek (nube más barata) o Qwen antes de decidir.