ChatCieloDocs

LM Studio — Servidor Local OpenAI-Compatible

Guía completa de LM Studio en ChatCielo: instala modelos GGUF, levanta el servidor en http://localhost:1234/v1 y conecta ChatCielo en minutos para pruebas locales antes de producción

LM Studio en ChatCielo

LM Studio es la forma más rápida de probar modelos GGUF en tu PC con interfaz visual y exponerlos como un servidor OpenAI-compatible en http://localhost:1234/v1. ChatCielo lo consume igual que a OpenAI — cambias solo el Base URL. Ideal para validar prompts, comparar modelos y hacer demos on-premise antes de pasar a Ollama en servidor.

Usa LM Studio en tu notebook/PC para iterar rápido y, cuando el prompt y el modelo estén validados, migra el mismo modelo (o su equivalente cuantizado) a Ollama en VPS para producción. La API es idéntica: lo que funciona en localhost:1234 funciona en ollama.tudominio.com.

Qué es LM Studio y por qué usarlo

CaracterísticaDetalle
Interfaz visualBusca, descarga y prueba modelos sin tocar la terminal. Conversación, parámetros y logs en una sola ventana.
Modelos GGUFSoporta Llama 3.3, Mistral, Qwen 2.5, Gemma, Phi en formatos Q4_K_M, Q5, Q8 — cuantizaciones que corren en CPU/GPU de consumo.
Servidor OpenAI-compatibleLevanta POST /v1/chat/completions, GET /v1/models y POST /v1/completions en http://localhost:1234/v1 con un clic.
100% local y offlineUna vez descargado el GGUF, funciona sin internet. Privacidad total para pruebas con datos sensibles.
Cambio de modelo en calienteCargas otro GGUF y el endpoint responde con el nuevo modelo sin reiniciar ChatCielo — solo cambia el nombre en la configuración.

1. Instalación

  1. Ve a lmstudio.ai y descarga el instalador para tu sistema.
  2. Instala y abre LM Studio.
  3. En la primera apertura acepta los términos — no requiere cuenta para uso local.
  4. Verifica que detecta tu GPU: ve a Settings > System y confirma GPU acceleration: Available (Metal en macOS, CUDA/Vulkan en Windows). Si no tienes GPU dedicada, funcionará en CPU — más lento pero válido para pruebas.

2. Selección y descarga de modelos GGUF

En LM Studio, abre la pestaña Discover (🔍) o Search.

Modelos recomendados para ChatCielo (español neutro)

Modelo en LM StudioNombre GGUF típicoTamañoVRAM/RAM Q4Ideal para
Llama 3.3 70B Instruct Q4llama-3.3-70b-instruct-Q4_K_M.gguf~42 GB~24 GBVentas / soporte calidad premium local
Qwen 2.5 14B Instruct Q4qwen2.5-14b-instruct-q4_k_m.gguf~9 GB~9 GBSweet spot — multilingüe, rápido, cabe en RTX 3060/4060
Qwen 2.5 32B Instruct Q4qwen2.5-32b-instruct-q4_k_m.gguf~20 GB~20 GBCalidad superior si tienes 24 GB
Mistral 7B Instruct Q4mistral-7b-instruct-v0.3-Q4_K_M.gguf~4.5 GB~5 GBTriaje ultraligero, prueba en CPU
Gemma 2 9B Instruct Q4gemma-2-9b-it-Q4_K_M.gguf~6 GB~6 GBAlternativa equilibrada, buen español

Si tu PC tiene 8 GB RAM y sin GPU dedicada, descarga solo mistral-7b o qwen2.5-7b en Q4_K_M. Modelos de 14B+ requieren 16 GB RAM mínimo y serán lentos en CPU. En ese caso prueba en la nube con Ollama VPS.

Cómo descargar:

  1. En Discover, busca por ejemplo qwen2.5 14b y filtra por GGUF.
  2. Elige la variante Q4_K_M (cuantización recomendada: mejor equilibrio calidad/peso).
  3. Haz clic en Download. LM Studio lo guarda en ~/.cache/lm-studio/models/.
  4. Repite para los 2–3 modelos que quieras comparar.

Cómo elegir cuantización

CuantizaciónCalidadVRAMCuándo usar
Q2_KBajaMínimaSolo si no cabe nada más — alucina más
Q4_K_MMuy buenaMediaRecomendada para ChatCielo — 95% de la calidad FP16 con 25% del peso
Q5_K_MExcelenteMedia-altaSi tienes VRAM de sobra y quieres máxima fidelidad
Q8_0Casi idéntica a FP16AltaSolo para validación final, no necesaria en producción

3. Levantar el servidor local OpenAI-compatible

Carga el modelo

  1. Ve a la pestaña Chat (💬) en LM Studio.
  2. Arriba, en Select a model to load, elige el GGUF descargado (ej. qwen2.5-14b-instruct-q4_k_m).
  3. Ajusta parámetros de carga:
    • Context Length (n_ctx): 4096 para pruebas, 8192 si tu prompt es largo. No subas a 32k si tu PC es modesta — consume RAM.
    • GPU Offload: ponlo al máximo que permita tu VRAM (ej. 35/35 layers si tienes 24 GB).
  4. Haz clic en Load Model. Espera a que diga Model loaded.

Inicia el servidor

  1. Ve a la pestaña Local Server (↔️) en el lateral izquierdo.
  2. Arriba verás Server Status: Stopped y el modelo cargado.
  3. Configura:
    • Port: 1234 (por defecto).
    • CORS: habilita Enable CORS si probarás desde el navegador.
  4. Haz clic en Start Server.

Verás:

Server running on http://localhost:1234
Endpoints:
  GET  http://localhost:1234/v1/models
  POST http://localhost:1234/v1/chat/completions
  POST http://localhost:1234/v1/completions
  POST http://localhost:1234/v1/embeddings (si el modelo lo soporta)

Anota exactamente lo que muestra LM Studio como Server URL: por defecto es http://localhost:1234/v1. Ese es el Base URL que pegarás en ChatCielo.

Prueba el servidor con curl (verificación obligatoria)

Abre una terminal y ejecuta:

# 1. Lista modelos (debe devolver el GGUF cargado)
curl http://localhost:1234/v1/models | jq .
 
# 2. Chat completion — el mismo que usará ChatCielo
curl http://localhost:1234/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen2.5-14b-instruct-q4_k_m",
    "messages": [
      {"role": "system", "content": "Eres asistente de DemoShop. Responde en máximo 3 líneas, español neutro. Si no sabes un dato, di que derivas a asesor."},
      {"role": "user", "content": "Hola, ¿hacen envíos a Bogotá?"}
    ],
    "temperature": 0.3,
    "max_tokens": 350
  }' | jq -r '.choices[0].message.content'

Si responde coherentemente en español, el servidor está listo para ChatCielo.

Prueba también con llama o mistral cambiando el campo model por el nombre exacto que muestra GET /v1/models.

4. Configuración en ChatCielo

ChatCielo se conecta a LM Studio exactamente igual que a Ollama: como proveedor OpenAI compatible vía Base URL.

Configura el canal

Ve a Canales > Tu canal > Integración IA > OpenAI / ChatGPT.

CampoQué poner para LM Studio localEjemplo
Proveedor / TipoOpenAI (compatible) o OpenAI
Base URLhttp://localhost:1234/v1 si ChatCielo corre en la misma máquina que LM Studiohttp://localhost:1234/v1
Base URL (si ChatCielo está en la nube/VPS)Usa la IP de tu PC en la red local o un túnelhttp://192.168.1.50:1234/v1 o https://xxxx.trycloudflare.com/v1
API KeyCualquiera — LM Studio no valida por defectolm-studio o sk-local
ModeloNombre exacto que devuelve GET /v1/modelsqwen2.5-14b-instruct-q4_k_m, mistral-7b-instruct-v0.3-Q4_K_M
Prompt del SistemaTus instrucciones (ver plantillas en Ollama)
Temperatura020.3 soporte, 0.6 ventas
Max Tokens1504096350500 para WhatsApp
Palabra clave de derivaciónhablar con asesor, asesor humano

Si ChatCielo no está en localhost — cómo exponer LM Studio

LM Studio por defecto solo escucha en 127.0.0.1. Si tu ChatCielo está en otro equipo o en la nube:

Opción A — Misma red Wi-Fi / LAN (pruebas oficina):

# En LM Studio > Local Server > Settings, cambia Host a 0.0.0.0
# o inicia con flag si usas CLI:
# LM Studio aún no expone CLI para host; usa un túnel:
 
# Túnel rápido con cloudflared (sin abrir puertos del router)
cloudflared tunnel --url http://localhost:1234
# copia la URL https://xxxx.trycloudflare.com y usa https://xxxx.trycloudflare.com/v1 como Base URL

Opción B — Tailscale / ngrok (recomendado para demos con cliente):

ngrok http 1234
# Base URL: https://xxxx.ngrok-free.app/v1

No expongas LM Studio directo a internet sin túnel autenticado. Es un servidor de desarrollo sin auth. Para producción real usa Ollama + Nginx + Bearer en un VPS.

Pruebas en local y validación

  1. En ChatCielo haz clic en Probar / Enviar mensaje de prueba con: "Hola, ¿cuánto tarda el envío a Lima?"
  2. Verifica que la respuesta llegue en <2 s (en GPU) o 3–6 s (en CPU) y en español neutro.
  3. Haz pruebas cruzadas cambiando el modelo:
    • Carga mistral-7b en LM Studio → cambia Modelo en ChatCielo a mistral-7b... → prueba de nuevo.
    • Carga qwen2.5-14b → cambia y compara calidad.
  4. Desde tu PC prueba el webhook que usará ChatCielo:
curl http://localhost:1234/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen2.5-14b-instruct-q4_k_m",
    "messages": [
      {"role":"system","content":"Eres asistente de DemoShop. Máximo 3 líneas, español neutro. Variable protocolo {{protocol}}."},
      {"role":"user","content":"Mi pedido 12345 no llegó, ¿qué hago?"}
    ],
    "temperature": 0.3
  }' | jq .
  1. Con un número de WhatsApp de prueba, escribe al canal conectado y confirma que el flujo completo (cliente → ChatCielo → LM Studio → ChatCielo → WhatsApp) funciona.

5. Consejos de uso y flujo hacia producción

  • Itera prompts en minutos con interfaz visual — sin Docker ni curl.
  • Compara 3 modelos en una tarde y decide cuál vale la pena llevar a servidor.
  • Haz demos al cliente con datos ficticios sin gastar tokens en la nube.
  • Limitaciones: no es un servidor hardening para producción (sin auth, sin réplicas, sin logs centralizados).

6. Parámetros y troubleshooting

Campo en LM StudioRecomendado para ChatCieloNota
Context Length (n_ctx)40968192Más contexto = más RAM. Para prompts de WhatsApp con histórico de 10 mensajes, 4096 basta.
Temperature0.20.4 soporte, 0.50.6 ventasSe configura en ChatCielo por request, no en la carga del modelo.
GPU OffloadTodo lo que permita tu VRAMSi se queda sin VRAM, LM Studio hace offload a RAM (más lento).
Repeat Penalty1.051.1Evita repeticiones en modelos pequeños.
ProblemaCausaSolución
Failed to load modelGGUF corrupto o RAM insuficienteRe-descarga el GGUF y baja n_ctx a 2048. Cierra otras apps.
Connection refused en ChatCieloLM Studio en 127.0.0.1 y ChatCielo en otra máquinaUsa túnel cloudflared/ngrok o pon ChatCielo en la misma máquina para pruebas.
model not foundNombre de modelo distinto al que muestra GET /v1/modelsCopia exactamente el id que devuelve curl localhost:1234/v1/models y pégalo en ChatCielo.
Respuestas en inglés o alucinaPrompt sin "español neutro" o modelo muy pequeñoAgrega "Responde siempre en español neutro" al system prompt y prueba qwen2.5:14b en lugar de mistral:7b.
Muy lento (>8 s)CPU sin GPU y modelo grandeCambia a mistral-7b Q4 o qwen2.5-7b Q4 para CPU, o pasa a VPS con GPU.
ChatCielo dice "timeout"max_tokens muy alto + modelo lentoBaja max_tokens a 350 y prueba de nuevo.

Comandos útiles (si usas CLI de LM Studio / curl)

# Ver modelos cargados
curl http://localhost:1234/v1/models | jq .
 
# Health check
curl http://localhost:1234/v1/chat/completions -H "Content-Type: application/json" -d '{
  "model": "qwen2.5-14b-instruct-q4_k_m",
  "messages": [{"role":"user","content":"ping"}]
}'
 
# Ver logs del servidor en LM Studio
# Local Server > Logs (panel inferior) — muestra cada request de ChatCielo

Cuando tu prompt esté estable en LM Studio, documenta modelo exacto + cuantización + n_ctx + prompt final + temperatura y pásalo a tu VPS de Ollama. Así replicas el comportamiento 1:1 en producción sin sorpresas.

7. Siguiente paso

  • Si validaste en LM Studio y quieres pasar a producción on-premise, sigue la guía de Ollama — misma API, pero en servidor 24/7 con GPU y dominio propio.
  • Para base de conocimiento con PDFs locales, combina LM Studio/Ollama con Dify on-premise.
  • Si prefieres no gestionar GPU, evalúa DeepSeek (nube más barata) o Qwen antes de decidir.