NVIDIA AVO logra 100% en ARC-AGI-3: el modelo no es todo, el harness puede cambiar el rendimiento del agente

NVIDIA publicó el 21 de agosto de 2026 los resultados de Agentic Variation Operators (AVO), una arquitectura para agentes autónomos de largo horizonte. Utilizando Claude Opus 5 dentro del sistema completo AVO, NVIDIA obtuvo 100.00 RHAE en los 25 entornos del set público de ARC-AGI-3 y completó sus 183 niveles. El resultado no corresponde a los sets privado o semiprivado de la competencia, pero demuestra una idea especialmente importante para empresas y desarrolladores: evaluar un modelo no es lo mismo que evaluar un agente; memoria, herramientas, supervisión, feedback y recuperación pueden cambiar radicalmente lo que ese modelo consigue hacer.

Cómo diseñar una arquitectura de agentes de IA donde memoria, herramientas, feedback y supervisión mejoren el modelo

NVIDIA Research · AVO · ARC-AGI-3

NVIDIA AVO logra 100% en el set público de ARC-AGI-3 : por qué el modelo no es todo

Un modelo de frontera puede ser extraordinariamente capaz. Sin embargo, memoria, herramientas, supervisión, contexto y recuperación determinan cuánto de esa capacidad puede convertir un agente en progreso real.

AVO ARC-AGI-3 Agent Harness Persistent Memory Supervision Long-Horizon Agents

La arquitectura de agentes de IA puede marcar una diferencia tan importante como el propio modelo. Esa es una de las principales conclusiones que NVIDIA destaca después de evaluar su sistema Agentic Variation Operators (AVO).

El 21 de agosto de 2026, NVIDIA publicó resultados donde AVO, utilizando Claude Opus 5, alcanzó una puntuación 100.00 RHAE en los 25 entornos del set público de ARC-AGI-3 y completó sus 183 niveles.

El resultado no significa que NVIDIA haya resuelto los sets privados de la competencia ni debe interpretarse como una demostración de AGI. De hecho, ARC Prize advierte expresamente que el conjunto público es una herramienta de demostración y que sus puntuaciones no forman parte del leaderboard oficial de progreso hacia AGI.

La lección útil para empresas: elegir entre GPT, Claude, Gemini u otro modelo es solo una parte del diseño. El sistema que gestiona memoria, contexto, herramientas, feedback, supervisión y recuperación puede determinar si el agente realmente completa trabajos prolongados.

Qué consiguió NVIDIA AVO en ARC-AGI-3

NVIDIA conectó la misma arquitectura AVO que había utilizado para optimización de kernels de GPU a un problema completamente diferente: entornos interactivos donde el agente no recibe instrucciones, reglas explícitas ni un objetivo descrito.

Utilizando Claude Opus 5 como modelo subyacente, AVO completó los 25 entornos del set público y los 183 niveles disponibles. Además, consiguió una puntuación de 100.00 en la métrica RHAE.

100.00 RHAE en el set público
25 entornos completados
183 niveles completados
6,624 acciones de entorno

Para referencia, NVIDIA informa que VISTA completó esos mismos 183 niveles con Claude Opus 5 utilizando 7,542 acciones. AVO utilizó aproximadamente un 12% menos en esa comparación.

No es una ablación controlada: NVIDIA aclara que AVO y VISTA utilizan diferencias en backend, observación, memoria, contexto y otros componentes. Por ello, el 12% no debe atribuirse exclusivamente a una sola característica.

Qué es ARC-AGI-3 y por qué es una prueba interesante para agentes

ARC-AGI-3 es un benchmark interactivo diseñado para evaluar sistemas capaces de entrar en entornos desconocidos, explorar, aprender reglas mediante experiencia y adaptar su estrategia.

A diferencia de una prueba estática de preguntas y respuestas, aquí el agente necesita actuar. Después observa qué ocurrió, interpreta la nueva información y decide qué hacer a continuación.

EXPLORE

Explorar

El sistema entra en un entorno sin recibir instrucciones sobre las reglas o el objetivo.

LEARN

Aprender

Cada acción produce evidencia que ayuda a construir una comprensión más útil del entorno.

ADAPT

Adaptarse

El agente debe revisar hipótesis, recuperarse de errores y continuar progresando durante varios pasos.

Precisamente por eso el benchmark resulta relevante para estudiar arquitecturas agentic. El modelo no solo necesita encontrar una respuesta: debe sostener un proceso de aprendizaje y acción.

El 100% público no significa 100% en la competencia ARC-AGI-3

Esta precisión es importante. NVIDIA especifica que los resultados corresponden a los 25 entornos del set público. No son resultados del conjunto semiprivado ni del conjunto completamente privado utilizado para la competencia.

ARC Prize también explica que no utiliza resultados del set público en su leaderboard oficial. El motivo es que los desarrolladores pueden estudiar esos entornos, configurar sistemas específicamente para ellos o introducir conocimiento adicional en un harness.

Por ello: el resultado es muy interesante para estudiar arquitectura de agentes, pero no debería comunicarse como “NVIDIA resolvió ARC-AGI-3” ni como evidencia de que un modelo haya alcanzado inteligencia general.

La aportación más útil del experimento está en otra parte: mostrar que el rendimiento observable pertenece al sistema completo, no únicamente al modelo conectado debajo.

Qué es un harness de agentes de IA

Un modelo de lenguaje recibe contexto y genera una salida. Un agent harness convierte esa capacidad en un sistema capaz de realizar trabajo durante varios pasos.

NVIDIA describe el harness como la infraestructura que determina cómo recibe contexto el modelo, qué tools puede utilizar, cómo mantiene estado, cómo interpreta feedback, cómo recupera errores y cómo continúa avanzando durante tareas prolongadas.

Modelo + harness = comportamiento del agente
MODELO
razonamiento y generación
+
HARNESS
memoria + tools + contexto + feedback
=
AGENTE
progreso sostenido

Esta distinción explica por qué dos sistemas que utilizan el mismo modelo pueden mostrar resultados muy distintos.

Qué es NVIDIA Agentic Variation Operators

AVO comenzó como un proyecto de NVIDIA para utilizar agentes autónomos en búsqueda evolutiva y optimización de software.

En lugar de limitar el modelo a generar un candidato dentro de un pipeline fijo, AVO convierte al propio agente en un operador de variación. El sistema decide qué inspeccionar, qué modificar, qué probar y qué conservar.

Además, AVO puede inspeccionar código, editarlo, ejecutar comandos, consultar documentación y verificar resultados mediante ejecución. Su característica principal es mantener trabajo autónomo durante horizontes mucho mayores que una única conversación.

Decide qué investigar

No depende de una secuencia completamente prescrita. Puede elegir nuevas direcciones según la evidencia disponible.

Ejecuta y verifica

Las hipótesis pueden probarse mediante herramientas, comandos, evaluaciones o interacción con el entorno.

Acumula progreso

Memoria y supervisión ayudan a conservar conocimiento y evitar que cada nueva etapa comience desde cero.

El loop que permite a AVO trabajar durante horizontes largos

Aunque GPU optimization y ARC-AGI-3 son problemas muy distintos, NVIDIA observó un patrón computacional parecido.

1
Formar una hipótesis El agente utiliza evidencia incompleta para decidir qué explicación o estrategia explorar.
2
Ejecutar una acción Utiliza herramientas o la interfaz del entorno para comprobar esa hipótesis.
3
Observar feedback Analiza el resultado real y conserva información relevante.
4
Modificar estrategia Corrige supuestos, cambia dirección y continúa avanzando.

En términos empresariales, este patrón aparece en muchos procesos: investigar un incidente, depurar software, analizar datos, optimizar campañas o resolver problemas operativos.

La memoria persistente evita que el agente tenga que reconstruir todo

Un problema importante de los agentes de largo horizonte es que el contexto de un modelo no representa necesariamente toda la vida de la tarea.

AVO utiliza memoria persistente para conservar implementaciones, resultados de evaluaciones, información de compiladores, perfiles de rendimiento y razonamiento acumulado.

Qué puede sobrevivir entre iteraciones

HIPÓTESIS Qué estrategias ya fueron exploradas
RESULTADOS Qué funcionó, qué falló y qué evidencia apareció
ESTADO Desde qué punto debe continuar el agente

De este modo, una sesión nueva puede continuar desde el estado acumulado en lugar de reconstruir repetidamente el problema completo.

AVO añade un supervisor para detectar estancamiento

Memoria por sí sola no garantiza progreso. Un agente puede repetir estrategias improductivas o quedarse atrapado explorando pequeñas variaciones de la misma idea.

NVIDIA incorpora un supervisor que observa la trayectoria general. Cuando detecta estancamiento o ciclos repetitivos, puede redirigir al agente principal hacia estrategias alternativas.

Agente principal

  • Inspecciona contexto
  • Decide qué cambiar
  • Ejecuta herramientas
  • Evalúa resultados

Supervisor

  • Observa la trayectoria
  • Detecta estancamiento
  • Identifica ciclos improductivos
  • Sugiere nuevas direcciones

Esto se parece más a un sistema de trabajo que a una llamada aislada a un LLM. El rendimiento surge de cómo interactúan diferentes componentes.

Antes de ARC-AGI-3, AVO trabajó siete días optimizando kernels

NVIDIA ya había probado AVO en un escenario especialmente exigente: optimización de kernels de atención para GPU.

Durante ese experimento, AVO operó continuamente durante siete días, exploró más de 500 direcciones de optimización y produjo 40 versiones de kernels que fueron incorporadas al proceso.

7 días de operación autónoma
500+ direcciones exploradas
40 versiones comprometidas
10.5% hasta sobre FlashAttention-4

En sistemas NVIDIA DGX B200, los kernels multihead attention resultantes superaron cuDNN hasta un 3.5% y FlashAttention-4 hasta un 10.5% en las configuraciones evaluadas.

Más tarde, el agente adaptó el kernel evolucionado a grouped-query attention en aproximadamente 30 minutos adicionales de trabajo autónomo.

Lo interesante es que NVIDIA reutilizó el mismo sistema en otro dominio

Optimizar kernels y resolver entornos interactivos parecen tareas completamente diferentes. Sin embargo, NVIDIA utilizó la misma arquitectura general AVO y cambió principalmente la interfaz específica del entorno y la evaluación.

En GPU optimization, el feedback llega desde compiladores, tests, profilers y benchmarks de rendimiento. En ARC-AGI-3, aparece mediante transiciones del entorno y consecuencias de las acciones.

ElementoGPU optimizationARC-AGI-3
Objetivo Mejorar rendimiento del kernel. Descubrir reglas y completar niveles.
Acciones Editar, compilar y ejecutar código. Interactuar con el entorno.
Feedback Tests, profiler y rendimiento. Cambios observados después de cada acción.
Necesidad común Preservar conocimiento entre iteraciones. Preservar conocimiento entre niveles.

El dominio cambia, aunque el loop esencial permanece: formular hipótesis, actuar, observar, actualizar estado y continuar.

Evaluar un modelo no es lo mismo que evaluar un agente

Esta es probablemente la conclusión más importante del trabajo. Un benchmark de modelo intenta medir la capacidad del modelo bajo una configuración concreta.

En cambio, un agente añade memoria, herramientas, instrucciones, observación, supervisión, recuperación, contexto y múltiples ciclos de ejecución.

ModeloAgente completo
Recibe una entrada. Puede ejecutar un proceso de varios pasos.
Genera una salida. Puede actuar y observar consecuencias.
Depende del contexto disponible. Puede administrar memoria externa.
No define por sí mismo toda la arquitectura. Combina modelo, harness, tools, políticas y feedback.

Por ello, comparar solamente “GPT vs Claude vs Gemini” puede ser insuficiente para decidir qué sistema funcionará mejor en un proceso empresarial prolongado.

¿Claude Opus 5 pasó realmente de 30% a 100% gracias a AVO?

El titular de NVIDIA destaca una referencia aproximada del 30% para Claude Opus 5 publicada por ARC Prize y la compara con el 100.00 obtenido por el sistema AVO.

Sin embargo, NVIDIA advierte que no debe interpretarse como una medición directa de cuánto rendimiento añadió AVO. Los experimentos utilizan configuraciones, reasoning settings y sistemas de evaluación diferentes.

Interpretación correcta: los resultados muestran que conocer únicamente el benchmark del modelo no permite predecir automáticamente el rendimiento de un agente completo. No demuestran que el harness por sí solo “añada 70 puntos”.

Esta diferencia es especialmente importante cuando una empresa analiza demos o benchmarks antes de elegir tecnología.

AVO también fue probado con GPT-5.6 Sol

El resultado completo de los 25 entornos públicos utilizó Claude Opus 5. Sin embargo, NVIDIA también emparejó AVO con GPT-5.6 Sol en un subconjunto de juegos considerados desafiantes.

NVIDIA informa que, en esas pruebas limitadas, Sol alcanzó niveles equivalentes más rápido en tiempo de reloj en varios casos, mientras Opus utilizó menos acciones del entorno en comparaciones de niveles equivalentes.

La empresa presenta esos datos como resultados preliminares. Por ello, no deben utilizarse como una comparativa general entre GPT-5.6 Sol y Claude Opus 5.

Lo importante: AVO está diseñado para funcionar alrededor de diferentes modelos de frontera. Eso permite pensar en el modelo como un componente intercambiable dentro de una arquitectura más amplia.

Qué significa AVO para empresas que están construyendo agentes

Una empresa rara vez necesita resolver ARC-AGI-3. Sin embargo, los principios utilizados por AVO aparecen constantemente en procesos empresariales.

Soporte avanzado

Un incidente complejo puede requerir consultar datos, probar hipótesis y escalar solamente cuando sea necesario.

Investigación

El agente necesita consultar múltiples fuentes, guardar hallazgos y revisar conclusiones.

Desarrollo

Programar implica editar, ejecutar tests, observar errores y modificar la solución.

Operaciones

Algunos procesos requieren varios sistemas y decisiones dependientes de resultados anteriores.

Análisis de datos

Una investigación puede exigir iteraciones sucesivas entre consultas, herramientas y conclusiones.

Agentes empresariales

La arquitectura debe decidir qué recordar, qué herramienta utilizar y cómo recuperarse de fallos.

Arquitectura práctica para construir mejores agentes de IA

No es necesario copiar exactamente AVO para aplicar sus lecciones. Una arquitectura empresarial puede utilizar los mismos principios fundamentales con diferentes frameworks y proveedores.

1

Define el objetivo del agente

Antes de escoger un modelo, determina qué resultado debe producir y cómo sabrás si realmente terminó la tarea.

2

Selecciona el modelo

Evalúa capacidad, costo, velocidad y compatibilidad. No asumas que el modelo más grande siempre será la mejor opción.

3

Diseña el harness

Define cómo recibe contexto, cómo decide utilizar tools y qué ocurre después de cada resultado.

4

Añade memoria útil

Guarda estado, resultados y decisiones que eviten repetir trabajo o perder progreso.

5

Conecta feedback verificable

Siempre que sea posible, utiliza datos reales, tests, herramientas o evaluaciones para comprobar resultados.

6

Diseña recuperación

Define qué debe ocurrir cuando una tool falla, una hipótesis es incorrecta o el agente queda estancado.

7

Añade supervisión

Procesos largos pueden necesitar una capa que identifique loops improductivos y obligue al sistema a cambiar de estrategia.

8

Mide el sistema completo

Evalúa éxito, costo, latencia, acciones, tools, errores y calidad del resultado final.

Dos agentes con el mismo modelo pueden comportarse de forma muy distinta

Imagina dos agentes empresariales que utilizan exactamente el mismo modelo de frontera.

CaracterísticaAgente AAgente B
Memoria Solo historial reciente. Estado persistente estructurado.
Tools Todas disponibles siempre. Tools según la etapa del workflow.
Feedback Confía en su propia respuesta. Verifica con datos o ejecución real.
Errores Reintenta sin estrategia definida. Clasifica error y utiliza rutas de recuperación.
Supervisión No existe. Detecta estancamiento.

Aunque ambos tengan la misma inteligencia base, el segundo sistema puede mantener mejor el progreso durante procesos largos.

MCP y APIs son parte del harness, pero conectarlas no basta

Model Context Protocol facilita que los agentes utilicen herramientas y fuentes externas. Sin embargo, una conexión MCP por sí sola no crea una arquitectura robusta.

El harness todavía necesita decidir cuándo utilizar cada herramienta, qué información enviar, qué resultado conservar y qué hacer cuando una llamada falla.

Tool disponible

El agente técnicamente puede ejecutar la función.

Tool bien integrada

El harness sabe cuándo utilizarla, cómo validar el resultado y cómo continuar después de la ejecución.

Por eso, una arquitectura de agentes de IA debe evaluar tanto el catálogo de herramientas como la lógica que las coordina.

Qué deberías medir al comparar arquitecturas de agentes

Si el objetivo es seleccionar una arquitectura para producción, comparar solamente benchmarks de modelos proporciona información incompleta.

Rendimiento

  • Tasa de tareas completadas
  • Número de acciones necesarias
  • Latencia total
  • Costo por resultado exitoso
  • Calidad del resultado final

Robustez

  • Recuperación después de errores
  • Capacidad para conservar estado
  • Loops improductivos
  • Uso correcto de herramientas
  • Necesidad de intervención humana

Errores frecuentes al construir agentes de IA

Escoger modelo antes del proceso

Comprar capacidad sin definir primero la tarea puede producir una arquitectura innecesariamente costosa.

Confundir contexto con memoria

Aumentar la ventana de contexto no sustituye automáticamente un sistema de memoria bien diseñado.

Agregar todas las tools

Más herramientas no siempre generan mejores agentes. También aumentan complejidad y posibilidades de error.

No validar acciones

Un agente necesita feedback externo para saber si una estrategia realmente produjo el resultado esperado.

No detectar loops

Un sistema puede consumir tiempo y tokens repitiendo estrategias que ya demostraron no funcionar.

Medir solo el modelo

Un benchmark aislado no representa necesariamente la capacidad del sistema completo.

Preguntas frecuentes sobre NVIDIA AVO y ARC-AGI-3

¿Qué es NVIDIA AVO?

Agentic Variation Operators es una arquitectura de agentes desarrollada por NVIDIA para sostener trabajo autónomo de largo horizonte mediante memoria persistente, herramientas, feedback, ejecución y supervisión.

¿AVO obtuvo realmente 100% en ARC-AGI-3?

NVIDIA reporta 100.00 RHAE en los 25 entornos del set público, completando sus 183 niveles. El resultado no corresponde a los conjuntos semiprivado o privado de la competencia.

¿Qué modelo utilizó NVIDIA para el resultado completo?

El resultado sobre los 25 entornos públicos utilizó Claude Opus 5 como modelo dentro del sistema AVO.

¿AVO también funciona con modelos de OpenAI?

NVIDIA realizó pruebas limitadas emparejando AVO con GPT-5.6 Sol en un subconjunto de juegos. La compañía considera esos resultados preliminares y no una comparación completa entre modelos.

¿Qué significa RHAE?

Relative Human Action Efficiency es la métrica utilizada por ARC-AGI-3 para combinar finalización de tareas con eficiencia de acciones respecto a baselines humanos.

Más dudas sobre arquitectura y harness de agentes

¿Qué es un agent harness?

Es la capa de sistema que conecta el modelo con contexto, memoria, herramientas, ejecución, feedback y recuperación durante un workflow agentic.

¿Un mejor harness puede hacer mejor a un modelo?

Puede permitir utilizar sus capacidades de forma más efectiva. Sin embargo, NVIDIA advierte que sus resultados no aíslan cuantitativamente cuánto aporta cada componente individual.

¿Una ventana de contexto grande elimina la necesidad de memoria?

No necesariamente. AVO utiliza memoria persistente para conservar estado útil más allá de un único contexto del modelo.

¿Para qué sirve un supervisor en un agente?

Puede observar el progreso general, detectar estancamiento y redirigir el proceso hacia otras estrategias cuando aparecen ciclos improductivos.

¿AVO es únicamente un agente para programación?

Surgió en trabajos de software y optimización de GPU, aunque NVIDIA utilizó la misma arquitectura general para interactuar con los entornos de ARC-AGI-3.

¿El resultado demuestra que AVO es AGI?

No. Los resultados corresponden al set público de ARC-AGI-3. ARC Prize no utiliza puntuaciones del conjunto público en el leaderboard oficial de la competencia.

Conclusión: el modelo importa, pero el modelo no es el agente

Los resultados de NVIDIA AVO ofrecen una lección que puede ser más importante que el propio 100.00 obtenido en el set público: las capacidades de largo horizonte surgen del sistema completo.

El modelo aporta razonamiento. Sin embargo, la memoria determina qué conocimiento sobrevive; las herramientas determinan qué acciones pueden ejecutarse; el feedback permite comprobar hipótesis y la recuperación evita que un error termine la tarea.

Asimismo, la supervisión puede detectar cuando el proceso deja de avanzar y necesita explorar otra estrategia.

Por ello, una empresa que esté construyendo agentes no debería comenzar únicamente preguntando qué modelo utilizar. La pregunta más útil es qué arquitectura permitirá convertir las capacidades de ese modelo en trabajo repetible, verificable y sostenible durante varios pasos.

Para organizaciones de México y Latinoamérica que conecten agentes con CRM, APIs, MCP, datos internos y automatizaciones, esta diferencia será cada vez más importante: comprar inteligencia no es lo mismo que diseñar un buen agente.

Fuentes oficiales

¿Quieres construir un agente que haga más que responder preguntas?

En Zadrig Technology podemos ayudarte a diseñar agentes de IA conectados con APIs, MCP, CRM, automatizaciones y datos, estructurando memoria, herramientas y workflows para que el sistema pueda completar procesos empresariales de varios pasos.

Diseñar mi arquitectura de agentes →

Leave A Comment