#AI: модель не главное, решает harness 🔭
😐
Ранее писали как гонка уходит от "чья модель умнее" к "чей агент помнит". Nvidia показала что сама модель вообще не самое главное.
Исследователи Nvidia
собрали агента AVO и прогнали его через ARC-AGI-3 - это 2D-игры без правил, где надо самому понять как играть и выиграть.
Внутри AVO крутится Claude Opus 5. Голая модель на этом тесте выбивает 30%. Та же модель в обвязке AVO - 100%, все 183 уровня. В мозгах ничего не меняли, поменяли только то что вокруг.
Обвязка (harness) - это всё вокруг модели: тулзы, память, контекст и рантайм. По сути то что превращает модель в агента.
Что дало результат:
🟢Нормальная работа с памятью
🟢Отдельный агент-надзиратель
🟢Циклы проверки и фидбек
Главный трюк - надзиратель. Работает как босс над основным агентом: видит что тот застрял или полез в тупик - пинает назад на курс. На длинных задачах без него никак.
Заметили не только в Nvidia:
🟠OpenAI: покрутили 2 настройки обвязки - скор утроился
🟠Databricks: выбор обвязки может удвоить косты, важнее выбора модели
🗒 Топовые модели уже плюс-минус равны, дальше идёт демпинг. Moat переезжает с самой модели в контур вокруг неё - тулзы, память, проверка. Как собрать свою обвязку под задачи разбираем в
ИИ-клубе.
Slavik |
Updates |
Инстаграм |
ИИ Клуб