NVIDIA AVO logra 100% en ARC-AGI-3: el modelo no es todo, el harness puede cambiar el rendimiento del agente
NVIDIA publicó el 21 de agosto de 2026 los resultados de Agentic Variation Operators (AVO), una arquitectura para agentes autónomos de largo horizonte. Utilizando Claude Opus 5 dentro del sistema completo AVO, NVIDIA obtuvo 100.00 RHAE en los 25 entornos del set público de ARC-AGI-3 y completó sus 183 niveles. El resultado no corresponde a los sets privado o semiprivado de la competencia, pero demuestra una idea especialmente importante para empresas y desarrolladores: evaluar un modelo no es lo mismo que evaluar un agente; memoria, herramientas, supervisión, feedback y recuperación pueden cambiar radicalmente lo que ese modelo consigue hacer.
Cómo diseñar una arquitectura de agentes de IA donde memoria, herramientas, feedback y supervisión mejoren el modelo
NVIDIA AVO logra 100% en el set público de ARC-AGI-3 : por qué el modelo no es todo
Un modelo de frontera puede ser extraordinariamente capaz. Sin embargo, memoria, herramientas, supervisión, contexto y recuperación determinan cuánto de esa capacidad puede convertir un agente en progreso real.
La arquitectura de agentes de IA puede marcar una diferencia tan importante como el propio modelo. Esa es una de las principales conclusiones que NVIDIA destaca después de evaluar su sistema Agentic Variation Operators (AVO).
El 21 de agosto de 2026, NVIDIA publicó resultados donde AVO, utilizando Claude Opus 5, alcanzó una puntuación 100.00 RHAE en los 25 entornos del set público de ARC-AGI-3 y completó sus 183 niveles.
El resultado no significa que NVIDIA haya resuelto los sets privados de la competencia ni debe interpretarse como una demostración de AGI. De hecho, ARC Prize advierte expresamente que el conjunto público es una herramienta de demostración y que sus puntuaciones no forman parte del leaderboard oficial de progreso hacia AGI.
Qué consiguió NVIDIA AVO en ARC-AGI-3
NVIDIA conectó la misma arquitectura AVO que había utilizado para optimización de kernels de GPU a un problema completamente diferente: entornos interactivos donde el agente no recibe instrucciones, reglas explícitas ni un objetivo descrito.
Utilizando Claude Opus 5 como modelo subyacente, AVO completó los 25 entornos del set público y los 183 niveles disponibles. Además, consiguió una puntuación de 100.00 en la métrica RHAE.
Para referencia, NVIDIA informa que VISTA completó esos mismos 183 niveles con Claude Opus 5 utilizando 7,542 acciones. AVO utilizó aproximadamente un 12% menos en esa comparación.
Qué es ARC-AGI-3 y por qué es una prueba interesante para agentes
ARC-AGI-3 es un benchmark interactivo diseñado para evaluar sistemas capaces de entrar en entornos desconocidos, explorar, aprender reglas mediante experiencia y adaptar su estrategia.
A diferencia de una prueba estática de preguntas y respuestas, aquí el agente necesita actuar. Después observa qué ocurrió, interpreta la nueva información y decide qué hacer a continuación.
Explorar
El sistema entra en un entorno sin recibir instrucciones sobre las reglas o el objetivo.
Aprender
Cada acción produce evidencia que ayuda a construir una comprensión más útil del entorno.
Adaptarse
El agente debe revisar hipótesis, recuperarse de errores y continuar progresando durante varios pasos.
Precisamente por eso el benchmark resulta relevante para estudiar arquitecturas agentic. El modelo no solo necesita encontrar una respuesta: debe sostener un proceso de aprendizaje y acción.
El 100% público no significa 100% en la competencia ARC-AGI-3
Esta precisión es importante. NVIDIA especifica que los resultados corresponden a los 25 entornos del set público. No son resultados del conjunto semiprivado ni del conjunto completamente privado utilizado para la competencia.
ARC Prize también explica que no utiliza resultados del set público en su leaderboard oficial. El motivo es que los desarrolladores pueden estudiar esos entornos, configurar sistemas específicamente para ellos o introducir conocimiento adicional en un harness.
La aportación más útil del experimento está en otra parte: mostrar que el rendimiento observable pertenece al sistema completo, no únicamente al modelo conectado debajo.
Qué es un harness de agentes de IA
Un modelo de lenguaje recibe contexto y genera una salida. Un agent harness convierte esa capacidad en un sistema capaz de realizar trabajo durante varios pasos.
NVIDIA describe el harness como la infraestructura que determina cómo recibe contexto el modelo, qué tools puede utilizar, cómo mantiene estado, cómo interpreta feedback, cómo recupera errores y cómo continúa avanzando durante tareas prolongadas.
razonamiento y generación
memoria + tools + contexto + feedback
progreso sostenido
Esta distinción explica por qué dos sistemas que utilizan el mismo modelo pueden mostrar resultados muy distintos.
Qué es NVIDIA Agentic Variation Operators
AVO comenzó como un proyecto de NVIDIA para utilizar agentes autónomos en búsqueda evolutiva y optimización de software.
En lugar de limitar el modelo a generar un candidato dentro de un pipeline fijo, AVO convierte al propio agente en un operador de variación. El sistema decide qué inspeccionar, qué modificar, qué probar y qué conservar.
Además, AVO puede inspeccionar código, editarlo, ejecutar comandos, consultar documentación y verificar resultados mediante ejecución. Su característica principal es mantener trabajo autónomo durante horizontes mucho mayores que una única conversación.
Decide qué investigar
No depende de una secuencia completamente prescrita. Puede elegir nuevas direcciones según la evidencia disponible.
Ejecuta y verifica
Las hipótesis pueden probarse mediante herramientas, comandos, evaluaciones o interacción con el entorno.
Acumula progreso
Memoria y supervisión ayudan a conservar conocimiento y evitar que cada nueva etapa comience desde cero.
El loop que permite a AVO trabajar durante horizontes largos
Aunque GPU optimization y ARC-AGI-3 son problemas muy distintos, NVIDIA observó un patrón computacional parecido.
En términos empresariales, este patrón aparece en muchos procesos: investigar un incidente, depurar software, analizar datos, optimizar campañas o resolver problemas operativos.
La memoria persistente evita que el agente tenga que reconstruir todo
Un problema importante de los agentes de largo horizonte es que el contexto de un modelo no representa necesariamente toda la vida de la tarea.
AVO utiliza memoria persistente para conservar implementaciones, resultados de evaluaciones, información de compiladores, perfiles de rendimiento y razonamiento acumulado.
Qué puede sobrevivir entre iteraciones
De este modo, una sesión nueva puede continuar desde el estado acumulado en lugar de reconstruir repetidamente el problema completo.
AVO añade un supervisor para detectar estancamiento
Memoria por sí sola no garantiza progreso. Un agente puede repetir estrategias improductivas o quedarse atrapado explorando pequeñas variaciones de la misma idea.
NVIDIA incorpora un supervisor que observa la trayectoria general. Cuando detecta estancamiento o ciclos repetitivos, puede redirigir al agente principal hacia estrategias alternativas.
Agente principal
- Inspecciona contexto
- Decide qué cambiar
- Ejecuta herramientas
- Evalúa resultados
Supervisor
- Observa la trayectoria
- Detecta estancamiento
- Identifica ciclos improductivos
- Sugiere nuevas direcciones
Esto se parece más a un sistema de trabajo que a una llamada aislada a un LLM. El rendimiento surge de cómo interactúan diferentes componentes.
Antes de ARC-AGI-3, AVO trabajó siete días optimizando kernels
NVIDIA ya había probado AVO en un escenario especialmente exigente: optimización de kernels de atención para GPU.
Durante ese experimento, AVO operó continuamente durante siete días, exploró más de 500 direcciones de optimización y produjo 40 versiones de kernels que fueron incorporadas al proceso.
En sistemas NVIDIA DGX B200, los kernels multihead attention resultantes superaron cuDNN hasta un 3.5% y FlashAttention-4 hasta un 10.5% en las configuraciones evaluadas.
Más tarde, el agente adaptó el kernel evolucionado a grouped-query attention en aproximadamente 30 minutos adicionales de trabajo autónomo.
Lo interesante es que NVIDIA reutilizó el mismo sistema en otro dominio
Optimizar kernels y resolver entornos interactivos parecen tareas completamente diferentes. Sin embargo, NVIDIA utilizó la misma arquitectura general AVO y cambió principalmente la interfaz específica del entorno y la evaluación.
En GPU optimization, el feedback llega desde compiladores, tests, profilers y benchmarks de rendimiento. En ARC-AGI-3, aparece mediante transiciones del entorno y consecuencias de las acciones.
| Elemento | GPU optimization | ARC-AGI-3 |
|---|---|---|
| Objetivo | Mejorar rendimiento del kernel. | Descubrir reglas y completar niveles. |
| Acciones | Editar, compilar y ejecutar código. | Interactuar con el entorno. |
| Feedback | Tests, profiler y rendimiento. | Cambios observados después de cada acción. |
| Necesidad común | Preservar conocimiento entre iteraciones. | Preservar conocimiento entre niveles. |
El dominio cambia, aunque el loop esencial permanece: formular hipótesis, actuar, observar, actualizar estado y continuar.
Evaluar un modelo no es lo mismo que evaluar un agente
Esta es probablemente la conclusión más importante del trabajo. Un benchmark de modelo intenta medir la capacidad del modelo bajo una configuración concreta.
En cambio, un agente añade memoria, herramientas, instrucciones, observación, supervisión, recuperación, contexto y múltiples ciclos de ejecución.
| Modelo | Agente completo |
|---|---|
| Recibe una entrada. | Puede ejecutar un proceso de varios pasos. |
| Genera una salida. | Puede actuar y observar consecuencias. |
| Depende del contexto disponible. | Puede administrar memoria externa. |
| No define por sí mismo toda la arquitectura. | Combina modelo, harness, tools, políticas y feedback. |
Por ello, comparar solamente “GPT vs Claude vs Gemini” puede ser insuficiente para decidir qué sistema funcionará mejor en un proceso empresarial prolongado.
¿Claude Opus 5 pasó realmente de 30% a 100% gracias a AVO?
El titular de NVIDIA destaca una referencia aproximada del 30% para Claude Opus 5 publicada por ARC Prize y la compara con el 100.00 obtenido por el sistema AVO.
Sin embargo, NVIDIA advierte que no debe interpretarse como una medición directa de cuánto rendimiento añadió AVO. Los experimentos utilizan configuraciones, reasoning settings y sistemas de evaluación diferentes.
Esta diferencia es especialmente importante cuando una empresa analiza demos o benchmarks antes de elegir tecnología.
AVO también fue probado con GPT-5.6 Sol
El resultado completo de los 25 entornos públicos utilizó Claude Opus 5. Sin embargo, NVIDIA también emparejó AVO con GPT-5.6 Sol en un subconjunto de juegos considerados desafiantes.
NVIDIA informa que, en esas pruebas limitadas, Sol alcanzó niveles equivalentes más rápido en tiempo de reloj en varios casos, mientras Opus utilizó menos acciones del entorno en comparaciones de niveles equivalentes.
La empresa presenta esos datos como resultados preliminares. Por ello, no deben utilizarse como una comparativa general entre GPT-5.6 Sol y Claude Opus 5.
Qué significa AVO para empresas que están construyendo agentes
Una empresa rara vez necesita resolver ARC-AGI-3. Sin embargo, los principios utilizados por AVO aparecen constantemente en procesos empresariales.
Soporte avanzado
Un incidente complejo puede requerir consultar datos, probar hipótesis y escalar solamente cuando sea necesario.
Investigación
El agente necesita consultar múltiples fuentes, guardar hallazgos y revisar conclusiones.
Desarrollo
Programar implica editar, ejecutar tests, observar errores y modificar la solución.
Operaciones
Algunos procesos requieren varios sistemas y decisiones dependientes de resultados anteriores.
Análisis de datos
Una investigación puede exigir iteraciones sucesivas entre consultas, herramientas y conclusiones.
Agentes empresariales
La arquitectura debe decidir qué recordar, qué herramienta utilizar y cómo recuperarse de fallos.
Arquitectura práctica para construir mejores agentes de IA
No es necesario copiar exactamente AVO para aplicar sus lecciones. Una arquitectura empresarial puede utilizar los mismos principios fundamentales con diferentes frameworks y proveedores.
Define el objetivo del agente
Antes de escoger un modelo, determina qué resultado debe producir y cómo sabrás si realmente terminó la tarea.
Selecciona el modelo
Evalúa capacidad, costo, velocidad y compatibilidad. No asumas que el modelo más grande siempre será la mejor opción.
Diseña el harness
Define cómo recibe contexto, cómo decide utilizar tools y qué ocurre después de cada resultado.
Añade memoria útil
Guarda estado, resultados y decisiones que eviten repetir trabajo o perder progreso.
Conecta feedback verificable
Siempre que sea posible, utiliza datos reales, tests, herramientas o evaluaciones para comprobar resultados.
Diseña recuperación
Define qué debe ocurrir cuando una tool falla, una hipótesis es incorrecta o el agente queda estancado.
Añade supervisión
Procesos largos pueden necesitar una capa que identifique loops improductivos y obligue al sistema a cambiar de estrategia.
Mide el sistema completo
Evalúa éxito, costo, latencia, acciones, tools, errores y calidad del resultado final.
Dos agentes con el mismo modelo pueden comportarse de forma muy distinta
Imagina dos agentes empresariales que utilizan exactamente el mismo modelo de frontera.
| Característica | Agente A | Agente B |
|---|---|---|
| Memoria | Solo historial reciente. | Estado persistente estructurado. |
| Tools | Todas disponibles siempre. | Tools según la etapa del workflow. |
| Feedback | Confía en su propia respuesta. | Verifica con datos o ejecución real. |
| Errores | Reintenta sin estrategia definida. | Clasifica error y utiliza rutas de recuperación. |
| Supervisión | No existe. | Detecta estancamiento. |
Aunque ambos tengan la misma inteligencia base, el segundo sistema puede mantener mejor el progreso durante procesos largos.
MCP y APIs son parte del harness, pero conectarlas no basta
Model Context Protocol facilita que los agentes utilicen herramientas y fuentes externas. Sin embargo, una conexión MCP por sí sola no crea una arquitectura robusta.
El harness todavía necesita decidir cuándo utilizar cada herramienta, qué información enviar, qué resultado conservar y qué hacer cuando una llamada falla.
Tool disponible
El agente técnicamente puede ejecutar la función.
Tool bien integrada
El harness sabe cuándo utilizarla, cómo validar el resultado y cómo continuar después de la ejecución.
Por eso, una arquitectura de agentes de IA debe evaluar tanto el catálogo de herramientas como la lógica que las coordina.
Qué deberías medir al comparar arquitecturas de agentes
Si el objetivo es seleccionar una arquitectura para producción, comparar solamente benchmarks de modelos proporciona información incompleta.
Rendimiento
- Tasa de tareas completadas
- Número de acciones necesarias
- Latencia total
- Costo por resultado exitoso
- Calidad del resultado final
Robustez
- Recuperación después de errores
- Capacidad para conservar estado
- Loops improductivos
- Uso correcto de herramientas
- Necesidad de intervención humana
Errores frecuentes al construir agentes de IA
Escoger modelo antes del proceso
Comprar capacidad sin definir primero la tarea puede producir una arquitectura innecesariamente costosa.
Confundir contexto con memoria
Aumentar la ventana de contexto no sustituye automáticamente un sistema de memoria bien diseñado.
Agregar todas las tools
Más herramientas no siempre generan mejores agentes. También aumentan complejidad y posibilidades de error.
No validar acciones
Un agente necesita feedback externo para saber si una estrategia realmente produjo el resultado esperado.
No detectar loops
Un sistema puede consumir tiempo y tokens repitiendo estrategias que ya demostraron no funcionar.
Medir solo el modelo
Un benchmark aislado no representa necesariamente la capacidad del sistema completo.
Preguntas frecuentes sobre NVIDIA AVO y ARC-AGI-3
¿Qué es NVIDIA AVO?
Agentic Variation Operators es una arquitectura de agentes desarrollada por NVIDIA para sostener trabajo autónomo de largo horizonte mediante memoria persistente, herramientas, feedback, ejecución y supervisión.
¿AVO obtuvo realmente 100% en ARC-AGI-3?
NVIDIA reporta 100.00 RHAE en los 25 entornos del set público, completando sus 183 niveles. El resultado no corresponde a los conjuntos semiprivado o privado de la competencia.
¿Qué modelo utilizó NVIDIA para el resultado completo?
El resultado sobre los 25 entornos públicos utilizó Claude Opus 5 como modelo dentro del sistema AVO.
¿AVO también funciona con modelos de OpenAI?
NVIDIA realizó pruebas limitadas emparejando AVO con GPT-5.6 Sol en un subconjunto de juegos. La compañía considera esos resultados preliminares y no una comparación completa entre modelos.
¿Qué significa RHAE?
Relative Human Action Efficiency es la métrica utilizada por ARC-AGI-3 para combinar finalización de tareas con eficiencia de acciones respecto a baselines humanos.
Más dudas sobre arquitectura y harness de agentes
¿Qué es un agent harness?
Es la capa de sistema que conecta el modelo con contexto, memoria, herramientas, ejecución, feedback y recuperación durante un workflow agentic.
¿Un mejor harness puede hacer mejor a un modelo?
Puede permitir utilizar sus capacidades de forma más efectiva. Sin embargo, NVIDIA advierte que sus resultados no aíslan cuantitativamente cuánto aporta cada componente individual.
¿Una ventana de contexto grande elimina la necesidad de memoria?
No necesariamente. AVO utiliza memoria persistente para conservar estado útil más allá de un único contexto del modelo.
¿Para qué sirve un supervisor en un agente?
Puede observar el progreso general, detectar estancamiento y redirigir el proceso hacia otras estrategias cuando aparecen ciclos improductivos.
¿AVO es únicamente un agente para programación?
Surgió en trabajos de software y optimización de GPU, aunque NVIDIA utilizó la misma arquitectura general para interactuar con los entornos de ARC-AGI-3.
¿El resultado demuestra que AVO es AGI?
No. Los resultados corresponden al set público de ARC-AGI-3. ARC Prize no utiliza puntuaciones del conjunto público en el leaderboard oficial de la competencia.
Conclusión: el modelo importa, pero el modelo no es el agente
Los resultados de NVIDIA AVO ofrecen una lección que puede ser más importante que el propio 100.00 obtenido en el set público: las capacidades de largo horizonte surgen del sistema completo.
El modelo aporta razonamiento. Sin embargo, la memoria determina qué conocimiento sobrevive; las herramientas determinan qué acciones pueden ejecutarse; el feedback permite comprobar hipótesis y la recuperación evita que un error termine la tarea.
Asimismo, la supervisión puede detectar cuando el proceso deja de avanzar y necesita explorar otra estrategia.
Por ello, una empresa que esté construyendo agentes no debería comenzar únicamente preguntando qué modelo utilizar. La pregunta más útil es qué arquitectura permitirá convertir las capacidades de ese modelo en trabajo repetible, verificable y sostenible durante varios pasos.
Para organizaciones de México y Latinoamérica que conecten agentes con CRM, APIs, MCP, datos internos y automatizaciones, esta diferencia será cada vez más importante: comprar inteligencia no es lo mismo que diseñar un buen agente.
Fuentes oficiales
¿Quieres construir un agente que haga más que responder preguntas?
En Zadrig Technology podemos ayudarte a diseñar agentes de IA conectados con APIs, MCP, CRM, automatizaciones y datos, estructurando memoria, herramientas y workflows para que el sistema pueda completar procesos empresariales de varios pasos.
Diseñar mi arquitectura de agentes →
