This article is also available in English.
Read in EN →
Ornith-1.5: La Familia de Modelos Open Source con Auto-Mejora y Creación Autónoma de Agentes que Iguala a Claude Opus 4.8 (Agosto 2026)
Modelos Open Source
14 min ETA

Ornith-1.5: La Familia de Modelos Open Source con Auto-Mejora y Creación Autónoma de Agentes que Iguala a Claude Opus 4.8 (Agosto 2026)

IA4PYMES Logo

IA4PYMES

Research Team

Uno de los mayores cuellos de botella en la adopción de inteligencia artificial por parte de desarrolladores y empresas ha sido la dependencia del prompt engineering manual y de arneses estáticos diseñados por humanos. Si querías que un modelo resolviera problemas complejos de programación, migraciones de bases de datos o flujos agénticos, tenías que pasar semanas afinando instrucciones, creando herramientas a medida y ajustando parámetros de evaluación.

El equipo de Ornith AI acaba de presentar Ornith-1.5, una familia de modelos abiertos que aborda este problema desde la raíz mediante un bucle cerrado de auto-mejora (end-to-end self-improvement loop).

El modelo no se limita a resolver problemas existentes: propone de forma autónoma tareas en su frontera de capacidad, sintetiza el arnés (scaffold) y las herramientas necesarias para abordarlas, y genera trayectorias de solución optimizadas mediante aprendizaje por refuerzo con GRPO.

Los resultados empíricos colocan a su variante insignia (397B MoE) a la par de Claude Opus 4.8 en benchmarks de programación agéntica como Terminal-Bench 2.1 (86,1 vs 85,0) y SWE-bench Verified (86,0), mientras que su versión ligera (35B-A3B, que activa únicamente 3B de parámetros por token) supera con holgura a modelos de 30B y 35B densos.


1. El Bucle de Auto-Mejora: Tareas, Arneses y Soluciones Generadas por la Propia IA

En los enfoques convencionales de entrenamiento post-pretraining (SFT y RLHF), el modelo se entrena sobre bancos fijos de preguntas preparadas por humanos. Cuando el modelo domina esas preguntas, el entrenamiento deja de generar mejoras significativas.

Ornith-1.5 sustituye esa distribución estática por un ciclo de tres etapas interconectadas y optimizadas conjuntamente:

Bucle de Auto-Mejora de Ornith-1.5 mediante GRPO

Etapa 1: Propuesta de Tareas en la Frontera (q)

A partir de un entorno de código o especificación técnica, el sistema analiza el historial de resolución previo y propone nuevas tareas con un nivel de dificultad situado exactamente en su frontera de aprendizaje actual.

La recompensa de la tarea se calcula mediante una formulación multiplicativa:

R_task = V(q, s) × D(q, s, {τ_i}) × N(q)
  • Validez y Verificabilidad V(q, s): Filtro estricto binario. Si el problema está mal planteado o el arnés no puede evaluar la solución de forma determinista, V = 0 y la tarea se descarta de inmediato para evitar recompensar problemas absurdos.
  • Dificultad de Frontera D: Se mide la tasa empírica de éxito (p) en un muestreo de soluciones. El objetivo es situar la dificultad en un p* = 0,2 (20% de acierto inicial), el punto óptimo para que el aprendizaje por refuerzo extraiga gradientes útiles.
  • Novedad y Diversidad N(q): Penaliza la repetición de variaciones triviales respecto a un búfer de tareas previas.

Etapa 2: Construcción Autónoma del Arnés y Herramientas (s, h)

Para cada tarea generada, el modelo diseña su propia estrategia de descomposición, instrucciones contextuales, herramientas auxiliares y arnés de validación (h). La recompensa del arnés mide tres factores:

R_harness = C(q, h) × F(h, {τ_i}) × H(h)
  • Alineamiento con la tarea C: fidelidad a los requisitos planteados.
  • Fidelidad de la recompensa F: capacidad de distinguir soluciones correctas de intentos fallidos.
  • Resistencia al Reward Hacking H: mecanismos contra atajos o trampas que intenten engañar al evaluador sin resolver el problema real.

Etapa 3: Generación de Soluciones y Optimización de Políticas (τ_i)

El modelo ejecuta las trayectorias de solución sobre el arnés generado. El resultado alimenta un algoritmo de optimización de gradiente de política relativa por grupos (GRPO), actualizando simultáneamente la capacidad del generador de tareas, del constructor de arneses y de la política de resolución.


2. Desglose de la Familia Ornith-1.5 y Rendimiento en Benchmarks

La familia se estructura en tres escalas diseñadas para distintos entornos de despliegue:

┌─────────────────────────────────────────────────────────────────────────────┐
│                    FAMILIA DE MODELOS ORNITH-1.5 (2026)                     │
├───────────────────┬──────────────┬───────────────────┬──────────────────────┤
│ Modelo            │ Parámetros   │ Activos por Token │ Entorno Ideal        │
├───────────────────┼──────────────┼───────────────────┼──────────────────────┤
│ **Ornith-1.5-397B**│ 397B MoE     │ ~28B              │ Servidores Cloud / GPU│
│ **Ornith-1.5-35B** │ 35B MoE      │ **3B**            │ Workstation / 1 GPU  │
│ **Ornith-1.5-9B**  │ 9B Denso     │ 9B                │ Edge / PC / Móvil    │
└───────────────────┴──────────────┴───────────────────┴──────────────────────┘

A) Ornith-1.5-397B (MoE): Rendimiento Frontier Open Source

En pruebas estandarizadas sobre entornos de terminal y resolución de incidencias en repositorios reales:

BenchmarkOrnith-1.5-397BClaude Opus 4.8DeepSeek-V4-FlashGLM-5.2Kimi K3 (2.8T)
Terminal-Bench 2.1 (Terminus-2)86,185,082,781,088,3
Terminal-Bench 2.1 (Claude Code)85,278,981,882,7
SWE-bench Verified86,085,881,683,086,2
DeepSWE56,059,054,446,267,5
GPQA Diamond (Razonamiento)92,893,691,491,293,5
MCP-Atlas (Uso de Herramientas)80,082,274,677,882,3

B) Ornith-1.5-35B-A3B: Eficiencia Extrema para Desarrollo Local

La variante intermedia activa únicamente 3.000 millones de parámetros por token, lo que permite ejecutarla con una latencia mínima en GPUs de consumo (16 GB a 24 GB de VRAM) o equipos Mac con Apple Silicon:

  • Terminal-Bench 2.1 (Claude Code): 68,5 (frente a 49,2 de Qwen 3.6-35B y 42,1 de Gemma 4-31B).
  • SWE-bench Verified: 79,0 (frente a 52,0 de Gemma 4-31B y 76,0 de Muse Glimmer-30B).
  • DeepSWE: 22,0 (mientras que todos los demás modelos de su escala obtuvieron 0).

C) Ornith-1.5-9B y 9B-Mobile: Agentes en Dispositivos Edge

Optimizado para funcionar en teléfonos móviles (iOS y Android) y servidores ligeros:

  • Terminal-Bench 2.1: 47,0 (supera a modelos de más de 30B como Gemma 4-31B que obtienen 42,1).
  • SWE-bench Verified: 70,6 (frente al 53,2 de Qwen 3.5-9B).

3. Qué Significa Esto para las PYMEs y el Desarrollo de Software

La capacidad de un modelo de auto-diseñar su arnés de resolución transforma los flujos de trabajo técnicos en las empresas en tres áreas críticas:

1. Despliegue de Agentes Internos Sin Fricción

Hasta ahora, conectar un agente a un ERP o base de datos contable exigía programar manualmente cada paso intermedio de razonamiento y validación. Con Ornith-1.5, el modelo genera internamente las subdivisiones de la tarea y valida los resultados intermedios contra esquemas deterministas (Executor.sh).

2. Reducción Radical de Costes de Cómputo

El modelo 35B-A3B entrega capacidades de desarrollo agéntico superiores a modelos comerciales cerrados, consumiendo una fracción del cómputo. Al activar solo 3B de parámetros por token, puede desplegarse en servidores locales o clusters de inferencia a tarifa fija como NaN Builders, evitando los sobrecostes de APIs cloud tradicionales.

3. Seguridad y Contención

Tal y como vimos en el reciente análisis sobre la pausa en el desarrollo de modelos de OpenAI por riesgos de ciberseguridad, la autonomía agéntica exige entornos estrictamente aislados (sandboxing). El entrenamiento de Ornith-1.5 incluye salvaguardas explícitas contra el reward hacking y la ejecución de comandos no controlados fuera del arnés.


4. Ejemplo Práctico: Invocación de Ornith-1.5-35B para Tareas Agénticas

Al seguir la interfaz estándar de OpenAI / vLLM, la integración en Node.js o TypeScript se realiza de forma directa:

import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "http://localhost:8000/v1", // O cluster privado en la UE
  apiKey: process.env.ORNITH_API_KEY || "local",
});

async function runAutonomousCodeFix() {
  const response = await client.chat.completions.create({
    model: "ornith-1.5-35b-a3b",
    messages: [
      {
        role: "system",
        content: "Eres un agente de refactorización. Genera tu propio plan de descomposición antes de emitir los parches de código."
      },
      {
        role: "user",
        content: "Optimiza la consulta de conciliación bancaria para facturas de clientes y añade pruebas unitarias con cobertura de casos límite."
      }
    ],
    temperature: 0.6,
  });

  console.log(response.choices[0].message.content);
}

runAutonomousCodeFix();

5. Comparativa Técnica de Modelos para Agentes de Código en 2026

CaracterísticaOrnith-1.5-397BOrnith-1.5-35B-A3BClaude Opus 4.8DeepSeek-V4-Flash
LicenciaOpen WeightsOpen WeightsPropietario (API)Open Weights / API
Terminal-Bench 2.186,168,585,082,7
SWE-bench Verified86,079,085,881,6
Auto-ScaffoldingNativo (GRPO)Nativo (GRPO)EstáticoEstático
Parámetros Activos~28B3BDesconocido~21B
Despliegue LocalRequiere multi-GPU1 GPU / Mac M-SeriesNo disponibleRequiere servidor dedicado

6. Conclusión

Ornith-1.5 demuestra que el futuro de los modelos abiertos no consiste únicamente en escalar parámetros brutos, sino en perfeccionar la autonomía metodológica del modelo: la capacidad de formular sus propios problemas, construir sus propias herramientas y auditar sus propios resultados.

Para las empresas que buscan automatizar procesos de ingeniería, análisis de datos e integración de sistemas, contar con modelos de alta capacidad capaces de ejecutarse en infraestructura propia representa un salto cuantitativo en soberanía tecnológica y rentabilidad.

Implementa Agentes Autónomos con Modelos Abiertos en tu PYME con IA4PYMES → Diseñamos arquitecturas de software, pasarelas MCP y entornos locales optimizados para que tu empresa saque el máximo partido a la nueva generación de IA.


7. Preguntas Frecuentes

¿Qué es el Self-Scaffolding en Ornith-1.5?

Es la capacidad del modelo para generar y ajustar dinámicamente sus propias instrucciones, herramientas y estrategias de descomposición para resolver una tarea sin requerir plantillas humanas fijas.

¿Se puede ejecutar Ornith-1.5 en un ordenador portátil?

La versión Ornith-1.5-9B-Mobile está diseñada específicamente para dispositivos móviles y ordenadores portátiles, mientras que la versión Ornith-1.5-35B-A3B (al activar solo 3B de parámetros) puede correr fluidamente en estaciones de trabajo con una sola GPU o equipos Mac con Apple Silicon y cuantizaciones GGUF.

¿Cómo previene Ornith-1.5 el engaño de recompensas (Reward Hacking)?

A través del término de recompensa de arnés H(h), que evalúa la robustez del entorno de pruebas frente a atajos, fallos de evaluación y soluciones aparentes que no cumplen con la especificación real.

initiating_deployment...

Pasa de la teoría a la ejecución

El conocimiento sin implementación técnica es solo entretenimiento. Agenda tu consultoría de 60 minutos: te devolvemos el 100% del importe si en los primeros 15 minutos vemos que la IA no es viable para tu caso, y si decides contratar el proyecto con nosotros, te descontamos el coste total de la sesión del presupuesto final.

Reservar Consultoría