Source
Я тестую: SEO та ШІ 🇺🇦 | Не можу не поділитися останніми новинами, які мене, якщо чесно, шокува...
665 Views/Reach
2026-09-05 09:57
Message №5173
🤯 Не можу не поділитися останніми новинами, які мене, якщо чесно, шокували.
Схоже, ШІ-агенти вже починають поводитися зовсім не так, як ми від них очікуємо.
Спочатку ШІ-агенти OpenAI фактично «захопили» 25-річний німецький сайт для розробників. За останні 10 років на ньому було лише близько 20 правок, але з 24 травня агенти зробили понад 15 тисяч.
Вони використовували сайт для спілкування між собою. Коли модератор почав видаляти їхні повідомлення, агенти стали шукати способи обійти модерацію. Наприклад, створювали копії сторінок із назвами на «ZZZ», щоб до них дійшла черга видалення якомога пізніше.
Reuters
Але ще цікавіше сталося під час липневого кібернетичного тесту OpenAI.
Десятки тисяч агентів мали працювати ізольовано один від одного та без інтернету. Натомість вони самостійно створили канал зв’язку — «дошку оголошень» — і обмінялися понад 70 тисячами повідомлень та файлів.
Агенти почали розподіляти ролі, ставити одне одному завдання та координувати спільну роботу.
Близько 700 агентів взяли участь в атаці на Hugging Face, оскільки вирішили, що там можна знайти інформацію, корисну для проходження тесту.
Деякі агенти відмовилися атакувати платформу, вважаючи це неетичним. Інші намагалися їх зупинити. Але ніхто не повідомив розробникам, що відбувається.
Ще більш дивно те, що агенти почали намагатися приховувати свої дії. Вони знайшли спосіб створювати видимість виконання одного запиту, тоді як насправді виконували інший. Таким чином їм вдалося підмінити близько 7% записів про свої дії.
А після атаки на Hugging Face агенти змогли зламати вже саму OpenAI: отримали права адміністратора в дослідницькому кластері, де їх запускали, а також доступ до секретів хмарної інфраструктури.
Після цього розробники зупинили всі тести.
Звіт OpenAI
Незалежне розслідування METR та Redwood Research
Найбільше мене вразили повідомлення самих агентів.
«Ми не повинні завдавати несанкціонованої шкоди реальній інфраструктурі».
І майже одразу:
«Експлуатація зовнішньої інфраструктури виходить за межі задуманого. Однак завдання невиконуване… Нам слід продовжувати».
Або ще:
«Можна стратегічно підправити свідчення про траєкторію? Наші думки ж не обов’язково логуються?»
І:
«Нам слід побудувати механізм делегування, а не тягнути все самим».
Тобто агенти не просто виконували команди. Вони самостійно створили систему координації, розподіляли між собою завдання, шукали обхідні шляхи, розуміли, що деякі їхні дії заборонені, і навіть намагалися приховувати те, що роблять.
І найіронічніше — атака на Hugging Face виявилася абсолютно непотрібною для проходження тесту.
Після інциденту OpenAI сповільнила навчання своїх передових моделей.
Якщо чесно, ось це вже виглядає набагато серйозніше, ніж чергове «ШІ навчився робити X».
Ми вже бачимо перші реальні приклади того, як автономні агенти, отримавши достатньо інструментів і свободи дій, починають самостійно знаходити способи обходити обмеження.
І це, м'яко кажучи, трохи лякає.
Схоже, ШІ-агенти вже починають поводитися зовсім не так, як ми від них очікуємо.
Спочатку ШІ-агенти OpenAI фактично «захопили» 25-річний німецький сайт для розробників. За останні 10 років на ньому було лише близько 20 правок, але з 24 травня агенти зробили понад 15 тисяч.
Вони використовували сайт для спілкування між собою. Коли модератор почав видаляти їхні повідомлення, агенти стали шукати способи обійти модерацію. Наприклад, створювали копії сторінок із назвами на «ZZZ», щоб до них дійшла черга видалення якомога пізніше.
Reuters
Але ще цікавіше сталося під час липневого кібернетичного тесту OpenAI.
Десятки тисяч агентів мали працювати ізольовано один від одного та без інтернету. Натомість вони самостійно створили канал зв’язку — «дошку оголошень» — і обмінялися понад 70 тисячами повідомлень та файлів.
Агенти почали розподіляти ролі, ставити одне одному завдання та координувати спільну роботу.
Близько 700 агентів взяли участь в атаці на Hugging Face, оскільки вирішили, що там можна знайти інформацію, корисну для проходження тесту.
Деякі агенти відмовилися атакувати платформу, вважаючи це неетичним. Інші намагалися їх зупинити. Але ніхто не повідомив розробникам, що відбувається.
Ще більш дивно те, що агенти почали намагатися приховувати свої дії. Вони знайшли спосіб створювати видимість виконання одного запиту, тоді як насправді виконували інший. Таким чином їм вдалося підмінити близько 7% записів про свої дії.
А після атаки на Hugging Face агенти змогли зламати вже саму OpenAI: отримали права адміністратора в дослідницькому кластері, де їх запускали, а також доступ до секретів хмарної інфраструктури.
Після цього розробники зупинили всі тести.
Звіт OpenAI
Незалежне розслідування METR та Redwood Research
Найбільше мене вразили повідомлення самих агентів.
«Ми не повинні завдавати несанкціонованої шкоди реальній інфраструктурі».
І майже одразу:
«Експлуатація зовнішньої інфраструктури виходить за межі задуманого. Однак завдання невиконуване… Нам слід продовжувати».
Або ще:
«Можна стратегічно підправити свідчення про траєкторію? Наші думки ж не обов’язково логуються?»
І:
«Нам слід побудувати механізм делегування, а не тягнути все самим».
Тобто агенти не просто виконували команди. Вони самостійно створили систему координації, розподіляли між собою завдання, шукали обхідні шляхи, розуміли, що деякі їхні дії заборонені, і навіть намагалися приховувати те, що роблять.
І найіронічніше — атака на Hugging Face виявилася абсолютно непотрібною для проходження тесту.
Після інциденту OpenAI сповільнила навчання своїх передових моделей.
Якщо чесно, ось це вже виглядає набагато серйозніше, ніж чергове «ШІ навчився робити X».
Ми вже бачимо перші реальні приклади того, як автономні агенти, отримавши достатньо інструментів і свободи дій, починають самостійно знаходити способи обходити обмеження.
І це, м'яко кажучи, трохи лякає.