Cómo ejecutar inferencia SLM local
Requisitos previos
- Un despliegue con el binario del modelo SLM local instalado en la ruta que
local-slm.serviceespera (véase Cómo autoalojar un despliegue) - El servicio
slm-doormanen ejecución y en buen estado (véase Cómo configurar el gateway Doorman) - Una sesión con acceso de nivel User (véase Cómo emparejar un dispositivo nuevo)
Propósito
La pila de inferencia de la plataforma ejecuta un modelo de lenguaje pequeño de forma local, en el Tier A, al que se accede a través del gateway Doorman. Toda la inferencia de Tier A permanece en el hardware del propio operador — ningún dato de prompt sale del despliegue. Esta guía inicia el modelo local, confirma que Doorman lo ve como listo y envía una solicitud, tanto desde la TUI de consola como directamente contra la API.
Procedimiento
-
Inicie el servicio SLM local, si no está ya en ejecución:
sudo systemctl start local-slm -
Confirme que arrancó correctamente:
systemctl is-active local-slm journalctl -u local-slm --since "1 minute ago"Un arranque saludable registra en el log la carga del modelo y el enlace del servicio a su puerto (por defecto
127.0.0.1:8080). Si falla, verifique que el archivo del modelo indicado en la configuración de la unidad exista realmente en la ruta que el servicio espera. -
Confirme que Doorman ve el Tier A como listo. En la consola, pulse F9 para abrir el panel de salud del SLM Cartridge, que lee el
/readyzde Doorman.tier_a(mostrado también comoA — Local) debe estar entrue/verde antes de que una solicitud tenga éxito. Pulse R para actualizar. -
Envíe un prompt desde la consola. Con el Tier A activo, escriba un prompt en la línea de entrada de F9 y pulse Enter — la respuesta se transmite token a token en el área de salida, y la barra de estado muestra el nivel activo durante la generación.
-
O envíe un prompt directamente vía la API:
curl -X POST http://127.0.0.1:9080/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{"messages":[{"role":"user","content":"Summarise the role of the Doorman gateway."}]}'La respuesta es un objeto JSON compatible con OpenAI con un arreglo
choices; cada elección contiene el texto generado.
Resultado esperado
Un prompt enviado mientras el Tier A está listo devuelve una respuesta generada sin que ningún dato salga del host — la línea F9 de la consola y la llamada a /v1/chat/completions recorren la misma ruta de solicitud subyacente, simplemente desde dos clientes distintos.
Verificación
Las solicitudes de inferencia desde la consola son seguras conforme a SYS-ADR-07 por construcción: por la capa del modelo solo pasa texto plano de prompt, nunca datos estructurados de la plataforma (registros de entidades, entradas WORM). Confirme que el Tier A siguió siendo el nivel que sirvió la solicitud, en lugar de haber caído silenciosamente a otro, consultando /readyz de nuevo tras la solicitud:
curl http://127.0.0.1:9080/readyz
tier_a: true y ai_available: true confirman que el Tier A sirvió la solicitud. Si el Tier B (Yo-Yo) está configurado y el Tier A deja de estar disponible a mitad de sesión, Doorman enruta automáticamente al Tier B en lugar de fallar — véase Protocolo Doorman para el orden completo de fallback.
Reversión
Detenga el servicio del modelo local; Doorman sigue en ejecución e informa tier_a: false en su siguiente comprobación de /readyz, en lugar de fallar:
sudo systemctl stop local-slm
Próximos pasos
- Ejecutar su primera consulta SLM — un primer recorrido guiado de consulta desde la consola
- Consultar el DataGraph — otra capacidad enrutada por Doorman, búsqueda de entidades en vez de inferencia
- Protocolo Doorman — el modelo completo de fallback entre niveles, para cuando el Tier A solo no basta
Véase también
- Arquitectura del stack Rust de service-slm — arquitectura de la pila SLM local y los niveles de modelo compatibles
- Protocolo Doorman — el protocolo del gateway Doorman; preparación, enrutamiento y comportamiento de fallback entre niveles
- app-console-slm — consola de monitorización de infraestructura de inferencia — el cartucho SLM de os-console y el panel de salud del Doorman
- Ejecutar su primera consulta SLM — enviar una consulta desde la consola una vez que el modelo esté en ejecución
- Cómo autoalojar un despliegue — provisionar la instancia que aloja la pila de inferencia
- Cómo configurar el gateway Doorman — configurar el Tier A/B/C antes de ejecutar una solicitud de inferencia
Cite this record: /wiki/run-local-slm-inference — revision 3e373253, last updated 4 August 2026.