Especialista soberano en el lado del cliente — Nivel 0
El Especialista Soberano en el Lado del Cliente — Nivel 0 es el modelo de despliegue de referencia para la plataforma: la pila de plataforma completa funcionando en el propio hardware del cliente — la forma operativa de Hospedaje por el cliente — sin dependencia de nube requerida y sin conectividad a internet requerida.
La unidad de referencia
El despliegue de referencia del Nivel 0 es un Totebox — un dispositivo compacto de factor de forma pequeño (x86 o ARM). Los servicios determinísticos propios de la plataforma (el registro, el motor de conocimiento, los servicios de entrada/extracción/salida) suman unos pocos cientos de megabytes de binarios autónomos; el modelo especialista local, una compilación cuantizada de OLMo 3 de 7B parámetros, es con diferencia el componente individual más grande en disco, varios gigabytes con cuantización de 4 bits. No se requiere GPU.
La pila incluye el registro de archivos WORM (service-fs), el motor de conocimiento (service-content), la frontera del Portero (service-slm), el modelo especialista local (OLMo 3 7B Instruct, cuantizado), la interfaz del operador (app-console-slm), y los servicios de entrada, extracción y salida. Todos los componentes son binarios autónomos sin dependencias de tiempo de ejecución más allá del sistema operativo.
El hardware a esta escala cuesta entre trescientos y mil quinientos dólares, según el tamaño y los requisitos del cliente. El costo operativo mensual previsto es cero — no hay suscripción, no hay tarifa de nube recurrente y no hay cargo por asiento.
Por qué un especialista en lugar de un generalista
El modelo local en el Totebox es un especialista en administración de sistemas con enrutamiento de propósito específico. Gestiona preguntas de administración de sistemas e infraestructura, ediciones mecánicas como mensajes de confirmación de Git y validación de esquemas, consultas de rutina contra el registro de auditoría y el grafo de conocimiento del cliente, y tareas de salida corta.
No está previsto para trabajo editorial, generación bilingüe o razonamiento de formato largo. Esas tareas se enrutan al Nivel B de GPU en ráfaga cuando está disponible, o devuelven una respuesta elegante de "nivel no disponible" cuando no lo está.
Inferencia solo con CPU
El especialista del Nivel A es un modelo cuantizado de 7B parámetros, mayor que la clase de modelo que normalmente se esperaría ejecutar cómodamente en núcleos de CPU compartidos — pero la carga de trabajo enrutada al especialista (clasificación de salida corta, ediciones mecánicas, consultas al registro y al grafo de conocimiento) tolera una tasa de tokens por segundo más lenta de lo que exigiría la generación interactiva de formato largo. El operador escribe una pregunta; el especialista responde en pocos segundos para una respuesta corta típica, sin GPU.
No se requieren GPU, mantenimiento de controladores ni gestión térmica. El perfil del hardware es la misma clase que cualquier otro dispositivo interno que el cliente ya opera.
Propiedades de soberanía
El Totebox opera sin los servidores de la plataforma, sin ninguna relación continua con los autores originales del modelo (los archivos GGUF existentes funcionan indefinidamente), sin claves de API externas (el Nivel C es opt-in y está desactivado por defecto), sin conectividad a internet y sin ninguna suscripción a la nube. El substrato funciona completamente sin conexión.
Escala de hardware
Para una empresa de cinco personas, un dispositivo tipo mini-PC es suficiente. Para una firma de treinta personas, un dispositivo ligeramente más grande gestiona las operaciones concurrentes de los Anillos 1, 2 y del nivel de IA. Para una firma de trescientas personas o un hospital regional, se prevé un clúster de varias unidades con una caja de GPU opcional. El enfoque comercial de la plataforma son las dos primeras escalas; los despliegues más grandes son posibles pero no son el mercado principal.
Niveles opcionales
El Nivel B (capacidad de GPU en ráfaga) es opt-in por inquilino. El Nivel C (API externa) es opt-in por inquilino y está desactivado por defecto. Cuando se configura, las llamadas a API externas están limitadas a una lista de propósitos explícitamente permitidos, se registran en el registro de auditoría del cliente y se divulgan al operador. Se prevé que la mayoría de los clientes operen sin el Nivel C en absoluto.
Véase También
- Substrato sin inferencia — El caso base — operación determinística cuando todos los niveles de IA no están disponibles
- Disciplina de cómputo de límite único — toda la inferencia, incluido el especialista local, pasa por el Portero
- Taxonomía semilla como Bootstrap para PYMEs — la taxonomía por inquilino con la que arranca el despliegue del Nivel 0
Cite this record: /wiki/tier-zero-customer-side-sovereign-specialist — revision 7ff56dd5, last updated 1 May 2026.