Субота, 22 Серпня 2026
UA / EN

Новини AI, стартапи, гайди по ШІ


ТЕХНОЛОГІЇ ТА ПРОДУКТИ

Nvidia AVO подолав ARC-AGI-3 на 100%: чи означає це прорив до AGI?

Nvidia AVO подолав ARC-AGI-3 на 100%: чи означає це прорив до AGI?

Дослідницький підрозділ Nvidia представив AI-агента для кодингу під назвою AVO, який показав рекордний результат на бенчмарку ARC-AGI-3 — 100% проходження, тобто всі 183 рівні у 25 публічних середовищах. Це перший випадок, коли будь-яка система повністю “закрила” цей тест на абстрактне міркування.

Що таке ARC-AGI-3 і чому цей тест важливий

ARC-AGI-3 — це бенчмарк для перевірки здатності систем штучного інтелекту розв’язувати нові, раніше не бачені завдання без явних інструкцій чи підказок. На відміну від класичних тестів на пам’ять чи мовні навички, ARC-AGI перевіряє саме абстрактне мислення — те, що вважається одним із ключових індикаторів на шляху до AGI (загального штучного інтелекту).

Nvidia AVO — це нова модель ШІ чи щось інше?

Важливе уточнення: AVO — не окрема мовна модель, а агентний “harness” — система оркестрації, яка дає моделі інструменти, пам’ять та можливість виконувати зворотний зв’язок протягом довгих сесій. AVO постійно інспектує, планує, впроваджує та оцінює власні дії, спираючись на пам’ять і результати виконання.

Чому це показує різницю між моделлю та “оболонкою” (harness)

Ключовий момент цієї новини — без додаткової оболонки одна з провідних мовних моделей на ринку, Claude Opus 5, самостійно показала на ARC-AGI-3 лише близько 30%. Загорнута ж у harness від Nvidia, та сама категорія моделей досягла 100%. Це підкреслює тезу: саме архітектура агента, а не сира модель, часто вирішує успіх складних довгих завдань.

Чи означає 100% на ARC-AGI-3 досягнення AGI?

Однозначної відповіді немає. Частина спільноти ШІ-дослідників сприймає результат як важливий сигнал прискорення прогресу, інша — застерігає від поспішних висновків, вказуючи, що бенчмарк вимірює вузький тип абстрактного мислення, а не загальний інтелект у повному розумінні. Очікується, що дискусія навколо цього результату підштовхне розробку складнішої версії тесту — ARC-AGI-4.

Що це означає для розробників і бізнесу вже зараз

Результат AVO демонструє практичний висновок для компаній, які будують продукти на базі ШІ: інвестиції в якісний agent harness — управління довгими сесіями, пам’яттю та інструментами — можуть дати приріст продуктивності, порівнянний із переходом на іншу, потужнішу модель.

Часті запитання

Що таке Nvidia AVO?

Це дослідницький агент Nvidia для автономного виконання довгих завдань з кодування, побудований поверх існуючих мовних моделей, а не окрема модель ШІ.

Скільки рівнів пройшов AVO в ARC-AGI-3?

Усі 183 рівні у 25 публічних середовищах тесту — 100% результат.

Чим harness відрізняється від моделі ШІ?

Модель — це “мозок”, що генерує відповіді. Harness — це система навколо моделі: інструменти, пам’ять, планування та зворотний зв’язок, які дозволяють виконувати складні багатоетапні завдання.

Чи це означає, що AGI вже досягнуто?

Ні. Це сильний результат на конкретному бенчмарку, але дослідники сходяться на тому, що це не еквівалент повноцінного загального інтелекту.

Залишити коментар

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *