Decisión de sustrato LLM — Familia OLMo 3
La plataforma PointSav utiliza la familia de modelos OLMo 3 como sustrato de inferencia de lenguaje. La variante instruct de OLMo 3 7B se ejecuta localmente en el hardware del cliente. Un modelo OLMo 3 mayor, ajustado para razonamiento extendido, se ejecuta en instancias de GPU bajo demanda para tareas de inferencia más exigentes. La selección no responde principalmente al desempeño en benchmarks, sino a la profundidad de propiedad que cada modelo permite.
Los tres niveles de apertura
El mercado de modelos de lenguaje en 2026 ofrece tres niveles distintos de apertura, y la diferencia es crítica para cualquier organización que planifique una trayectoria de composición a cinco años.
Nivel 1 — Pesos abiertos. Se publican los archivos de parámetros entrenados. Es posible ejecutar inferencia y ajuste fino LoRA, pero no se pueden inspeccionar los datos de entrenamiento ni continuar el preentrenamiento desde un punto de control conocido.
Nivel 2 — Pesos abiertos con licencia permisiva. Igual que el Nivel 1, con una licencia suficientemente permisiva para incluir el modelo en un producto comercial sin exposición legal.
Nivel 3 — Modelo completamente abierto. Se publican los datos de entrenamiento, el código de entrenamiento y los puntos de control en cada etapa, junto con los pesos y una licencia permisiva. A este nivel es posible continuar el preentrenamiento: partiendo de un punto de control conocido, sobre un corpus propio, para producir un modelo derivado que la organización posee de forma efectiva.
OLMo 3 es el único modelo en el panorama abierto no chino de 2026 que opera en el Nivel 3. 1 Sus datos de entrenamiento son el corpus Dolma 3 (9.3 billones de tokens, publicado bajo Open Data Commons). 2 Su código de entrenamiento es Apache 2.0. Los puntos de control intermedios están disponibles públicamente.
Por qué se descartaron las alternativas
Los modelos de origen chino — independientemente de su calidad técnica y sus licencias permisivas — fueron descartados por las restricciones de adquisición aplicables a una empresa pública canadiense, derivadas del precedente legislativo estadounidense de 2026 sobre infraestructuras de IA de origen chino.
Los modelos Phi-4, Granite 4 y otros con licencias permisivas fueron descartados porque sus datos de entrenamiento son cerrados y de propiedad del fabricante: permiten ajuste fino LoRA pero no preentrenamiento continuo, por lo que no habilitan el camino hacia un modelo base propio.
Llama 4 (Meta). La Licencia Comunitaria de Llama no está aprobada por la OSI e incluye restricciones al uso comercial por encima de un umbral de usuarios. Esta restricción de licencia lo descalifica de forma independiente a la cuestión de los datos de entrenamiento.
Mistral 7B. Licencia Apache 2.0; los datos de entrenamiento están documentados solo parcialmente, sin publicación abierta completa. Arquitectura más antigua; más débil en generación de código que las alternativas de 2026.
Capacidad
La variante de razonamiento de 32B, en la versión actualizada OLMo 3.1, alcanza un 91.4% en HumanEvalPlus — la medida de precisión práctica en generación de código — y se sitúa a menos de dos puntos porcentuales del modelo de pesos abiertos líder en los benchmarks estándar de razonamiento matemático y seguimiento de instrucciones. La variante de 7B es sólida en programación, comprensión lectora y matemáticas, con una ventana de contexto de 65,000 tokens.
Estas cifras no sitúan a OLMo 3 en la frontera absoluta del rendimiento en pesos abiertos. Sí lo sitúan firmemente en el rango donde el Doorman — el servicio que media todas las llamadas de inferencia de IA en la arquitectura de PointSav — produce resultados útiles en las tareas diarias que gestiona. La variante local de 7B maneja el trabajo rutinario; la variante de ráfaga de 32B maneja tareas que requieren razonamiento extendido. Ambas comparten el mismo vocabulario, tokenizador y formato de prompt, lo que significa que la biblioteca de adaptadores entrenada sobre una es compatible con la otra.
Las tres capas de cómputo
El Doorman enruta las solicitudes entre tres capas:
- Capa A — local: OLMo 3 7B Instruct en el hardware del cliente. Costo marginal aproximadamente cero.
- Capa B — ráfaga GPU: la variante de razonamiento de 32B en instancias de GPU de corta duración. Utilizado para razonamiento extendido. Disciplina de apagado inactivo por defecto.
- Capa C — API externa: servicios de terceros bajo lista de permitidos explícita, registrados en el libro de auditoría del cliente.
Trayectoria de preentrenamiento continuo (planificada)
La trayectoria prevista para la plataforma contempla, a partir del segundo año, el inicio del preentrenamiento continuo del modelo base OLMo 3 7B sobre el corpus acumulado de la plataforma, con el objetivo de producir PointSav-OLMo-N — un modelo derivado que incorpora los patrones de uso reales de los clientes. Esta trayectoria es una intención declarada y está sujeta a las condiciones técnicas y económicas del momento.
Véase también
- Escalera de cuatro niveles del sustrato SLM — los cuatro niveles de despliegue construidos sobre este sustrato
- Sustrato de aprendizaje — cómo el uso en producción genera señal de entrenamiento para el preentrenamiento continuo
- Sustrato de trayectoria — el mecanismo de captura de corpus que alimenta el preentrenamiento continuo
- Doorman compuesto — el servicio que enruta todas las llamadas de inferencia entre las tres capas
-
AI2. 'OLMo 3.' Allen Institute for AI, 2025. https://allenai.org/blog/olmo3 ↩
-
AI2. 'Dolma 3 Dataset.' Open Data Commons License. Allen Institute for AI, 2024. https://huggingface.co/datasets/allenai/dolma ↩
Cite this record: /wiki/llm-substrate-decision — revision 14907443, last updated 22 August 2026.