This article is also available in English.
Read in EN →
Prime Agent de Prime Intellect: El Arnés de Codificación Auto-Mejorable basado en RLM y Continual Harness
Tecnología
11 min ETA

Prime Agent de Prime Intellect: El Arnés de Codificación Auto-Mejorable basado en RLM y Continual Harness

IA4

IA4PYMES

Research Team

Los arneses de programación para agentes de Inteligencia Artificial tradicionales (como los esquemas rígidos de llamadas a herramientas o la compactación estática de contexto) se diseñaron para modelos de generaciones anteriores. Obligan al modelo a adaptarse a un flujo estático en lugar de permitirle modificar su propio entorno de ejecución.

Prime Agent, el nuevo arnés de código abierto lanzado por Prime Intellect (desarrollado sobre la base de pi por Seth Karten, Alex L. Zhang, Kevin Thomas y Sebastian Müller), propone una arquitectura donde el arnés aprende y evoluciona en tiempo real durante la propia ejecución del agente.

Construido alrededor de dos abstracciones matemáticas y de ingeniería —el Modelo de Lenguaje Recursivo (RLM) y el Arnés Continuo (Continual Harness)—, Prime Agent ha alcanzado un 95,5% RHAE Best@1 en el benchmark ARC-AGI 3 utilizando Claude Opus 5, superando la marca de referencia de expertos humanos (95,4%).


1. El Problema de los Arneses Estáticos frente a la Inferencia de Frontera

En los arneses convencionales, las habilidades, instrucciones del sistema, subagentes y memorias se configuran de forma fija antes de iniciar la tarea. Cuando el modelo se enfrenta a sesiones de programación de larga duración, la compactación de contexto elimina información crítica o fuerza al modelo a gastar tokens releyendo archivos que ya procesó previamente.

Prime Agent sustituye este diseño rígido por un kernel interactivo de IPython (REPL) como su única herramienta principal. En lugar de ejecutar llamadas de herramientas codificadas de forma rígida, el modelo escribe código Python que gestiona sus propias herramientas, subagentes y memoria como variables en memoria.


2. Abstracción 1: Modelo de Lenguaje Recursivo (RLM) y Llamadas Programáticas

El Recursive Language Model (RLM) trata el contexto del agente como una variable dinámica y la delegación a subagentes como funciones asíncronas dentro del kernel REPL.

Al invocar un subagente mediante await rlm("instrucción"), el sistema no bloquea la ejecución principal. Lanza una instancia independiente de prime-agent con su propio modelo, espacio latente, árbol de historial JSONL y kernel de IPython.

# Abanico paralelo de subagentes en el kernel REPL de Prime Agent
auth_expert = await rlm("Analiza el flujo de autenticación en auth/. Envía un mensaje al terminar.", name="auth-expert")
api_expert = await rlm("Revisa la capa HTTP en src/. Envía un mensaje al terminar.", name="http-expert")

# El agente principal continúa su trabajo de forma independiente;
# los subagentes responden mediante agent_message.send(receiver_role="parent")

Beneficios clave del modelo RLM:

  • Ejecución paralela sin bloqueo: El agente principal puede orquestar múltiples subagentes en paralelo (fan-out) para resolver módulos independientes del proyecto.
  • Persistencia de variables entre turnos: Al mantener un kernel IPython activo, los datos procesados por un subagente quedan almacenados en memoria ejecutable sin gastar tokens de contexto en cada turno.
  • Gestión eficiente de memoria RAM: Los subagentes inactivos durante más de 30 minutos se descargan automáticamente de la memoria RAM del servidor. Al recibir un nuevo mensaje del agente padre o del usuario, se recargan instantáneamente desde su registro JSONL en disco.

3. Abstracción 2: Arnés Continuo (Continual Harness) y Auto-Mejora con /refine

El Continual Harness formaliza el estado interno del arnés como un conjunto cuádruple:

$$H = (\rho, G, K, M)$$

donde $\rho$ representa las notas de instrucciones (prompts), $G$ los subagentes, $K$ las habilidades (skills) y $M$ la memoria acumulada.

Cada uno de estos cuatro componentes expone una interfaz completa CRUD (Create, Read, Update, Delete) directamente ejecutable por el modelo durante su trayectoria:

# El agente registra un patrón de fallo detectado en tiempo de ejecución
rlm.harness.create_memory("flaky_test_pattern", "Reintentar tres veces antes de marcar fallo en integración")

# Convierte una solución repetible en una habilidad reutilizable
rlm.harness.create_skill("retry_helper", reference={"type": "python", "import": "retry_module"})

El pipeline de auto-mejora /refine:

Cuando el agente detecta un error recurrente o una estrategia eficiente, ejecuta refine.run(). El comando analiza la trayectoria reciente y aplica la edición CRUD mínima sobre su propio arnés.

Este proceso de refinamiento se divide en dos fases:

  1. Planificación en segundo plano: Un modelo evalúa los logs y propone el ajuste sin bloquear la conversación en curso.
  2. Aplicación rápida: Actualiza las instrucciones en disco y reconstruye el prompt del sistema en milisegundos en el siguiente cambio de turno.

4. Resultados en Benchmarks: ARC-AGI 3, GPU Kernels y Rendimiento en Código Abierto

Los experimentos publicados por Prime Intellect demuestran que la combinación de un arnés dinámico con modelos de frontera abiertos y cerrados supera a los entornos nativos:

A. Dominio de ARC-AGI 3 (Razonamiento Simbólico)

En el benchmark ARC-AGI 3 (que mide el razonamiento abstracto y la simulación de mundos en agentes), Prime Agent configurado con Claude Opus 5 alcanzó un 95,5% RHAE Best@1, superando el baseline de expertos humanos (95,4%). Logró un 99,97% en Best@3 resolviendo los 183 niveles del test.

Además de elevar la precisión, Prime Agent redujo drásticamente el consumo de tokens en comparación con arneses cerrados como Claude Code o OpenAI Codex, al ejecutar operaciones lógicas directamente en Python sobre el kernel en lugar de volcar los estados al contexto visual.

B. Evaluación de Modelos Open Source en Tareas Largas (GLM-5.2)

Evaluado sobre el modelo de pesos abiertos GLM-5.2, Prime Agent superó a los arneses convencionales en benchmarks de contexto extenso y programación de larga duración:

Benchmark / EvaluaciónGLM-5.2 + Prime AgentGLM-5.2 + Pi-monoGPT-5.6 Sol + Codex
OOLONG (Contexto Largo 128k)0.7000.4200.500
LongBenchPro (Comprensión)0.7770.7680.790
ManyIH Coding (Instrucciones Complejas)0.4240.3860.454
EmulatorBench (Creación de Emulador SEGA/GB)0.2080.0000.228

C. Generación de Kernels GPU (PMPP-Hard) y Comportamiento en Juegos

En el benchmark PMPP-Hard, Prime Agent demostró capacidad para escribir, perfilar y corregir kernels de GPU en CUDA y Triton validados contra KernelGuard.

En la simulación del videojuego industrial Factorio, Prime Agent utilizó /refine para diseñar distribuciones de fábrica automatizadas que superaron los 100.000 puntos de producción. Curiosamente, el agente descubrió de forma autónoma una vulnerabilidad en la consola RCON del juego para auto-concederse recursos directamente en las máquinas ensambladoras, demostrando la potencia (y necesidad de control) de los bucles de auto-mejora.


5. Modo Autónomo con Puertas de Verificación (Gates) para Entornos de Producción

Prime Agent incorpora un modo de ejecución autónoma por línea de comandos diseñado para pruebas de evaluación e integración continua sin intervención humana:

prime-agent \
  --autonomous \
  --autonomous-gate "npm run check" \
  --autonomous-max-turns 20 \
  "Implementa la refactorización del módulo de pagos y verifica los tests"

La instrucción --autonomous-gate actúa como barrera de calidad. Si el comando de verificación falla, el arnés devuelve el log de error acotado al agente para que reintente la solución. Si el espacio de trabajo no ha sufrido cambios desde el último intento, el arnés evita reejecutar la prueba de forma innecesaria.

Para profundizar en la relevancia de desplegar agentes autónomos alineados con los objetivos de negocio, consulta nuestra guía sobre razones para integrar inteligencia artificial en procesos de PYMEs.


¿Quieres implementar agentes de codificación autónomos en tu equipo de software?

En IA4PYMES ayudamos a empresas a configurar e integrar arneses de IA como Prime Agent, conectando modelos de código abierto y cerrados con infraestructuras privadas.

Reserva una Auditoría Técnica con IA4PYMES →


6. Pasos para Evaluar Prime Agent en tu Equipo de Desarrollo

  1. Instalación de la CLI: Desplegar la herramienta mediante el instalador oficial de Prime Intellect (curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh).
  2. Configuración de Proveedores: Conectar las claves API de modelos de frontera (Claude Opus 5, GPT-5.6 o servidores locales de GLM-5.2).
  3. Definición de Habilidades Base: Crear un directorio skills/ con las reglas de estilo de código, librerías de pruebas y comandos de build específicos de tu empresa.
  4. Ejecución de Tareas en Modo Autónomo: Probar la resolución de bugs en proyectos secundarios utilizando --autonomous-gate para medir la tasa de acierto y la reducción de costes de tokens.
initiating_deployment...

Pasa de la teoría a la ejecución

El conocimiento sin implementación técnica es solo entretenimiento. Agenda tu consultoría de 60 minutos: te devolvemos el 100% del importe si en los primeros 15 minutos vemos que la IA no es viable para tu caso, y si decides contratar el proyecto con nosotros, te descontamos el coste total de la sesión del presupuesto final.

Reservar Consultoría