Source
Mockingbird Shares | А вас теж задовбує підтверджувати дії агентів кожного разу? Спочатку з...
30 Views/Reach
2026-09-01 16:29
Message №2852
А вас теж задовбує підтверджувати дії агентів кожного разу? Спочатку здається, шо це така здорова обережність, і дуже добре шо вона є, бо шо якщо воно зробить rm -rf /? Але згодом розумієш, шо воно в принципі нормально все генерує, ти все підтверджуєш майже не читаючи, воно набридає, і починаєш будувати навколо цього цикли, правила, обгортки, аби воно вже ходило само.І в якийсь момент упираєшся. Тільки не зовсім туди, куди думав.Пані, що працює в OpenAI, написала про harness (https://lilianweng.github.io/posts/2026-07-04-harness/). Harness (якщо ви не знали) це вся система навколо моделі: як вона планує, які інструменти смикає, шо памʼятає між кроками і як перевіряє результат.Стаття наукова, там є bi-level оптимізація з формулами і купа бенчмарків. Там все дуже інтересно, проте не все до кінця понятно. Я проскролив по діагоналі і побачив дві речі, що пояснюють, чому автономність буксує.Перша: нашу продуктивність обмежує не модель, а перевірка. У списку проблем самопокращення слабкі й розмиті евалюатори стоять першим пунктом, а reward hacking окремим.У нас це тести. В автономному циклі твій тестовий сюїт і є функція винагороди агента. Слабкі тести не роблять продукт гіршим. Вони просто навалюють більше коду, який ці слабкі тести проходить. Друга: горизонт. Агенти при бюджеті дві години показували вчетверо кращий результат за людей експертів, але на довших забігах люди відігравали назад. Наче як агенти з часом починають нудьгувати і робити фігню. Тобто якщо будувати з агентів software factory, тобто конвеєр, який пиляє задачі без тебе, то він має складатись з коротких відрізків з перевіркою на кожному стику. А не з "запустив на ніч і пішов спати".Ще там описаний ACE, коли контекст живе як плейбук: одна частина ганяє задачі, друга витягує з трейсів висновки, третя вписує їх назад. Схоже на Hermes Agent, якого я використовую як асистента, він теж дописує собі правила після роботи і самонавчається. До речі, я час від часу прошу гермеса перевірити свою конфігурацію, чи відповідає вона нашій моделі взаємодії. І кожного разу він знаходить, що можна покращити. Останнього разу ми додали зовнішню памʼять, бо в нього вона була обмежена з коробки.І застереження, яке мені сподобалось найбільше. В експерименті над самопокращенням був приріст на GPT-4 і погіршення на GPT-3.5 та Mixtral. Тобто на слабкій моделі воно не просто не працює, воно робить гірше. Це прямо ефект Даннінга-Крюгера (здається, так він зветься, виправте мене в коментах).Наостанок там є порядок оптимізацій: спочатку промпти, потім структурований контекст, потім воркфлоу, потім код самого harness, і аж потім код оптимізатора. Де на ній я, точно не скажу, здається десь в районі третього.Напишіть, чи пускаєте агента робити щось без підтвердження, і шо у вас стоїть на місці перевірки, тести чи надія. Ну і лайкніть, якщо теж задовбались тикати "так, можна" :)