Fuente
ШІ історії | Останнім часом я дуже часто використовую агентів в режимі «/goal». Ста...
3 670 Vistas/Alcance
2026-09-28 10:29
Mensaje №3077
Останнім часом я дуже часто використовую агентів в режимі «/goal». Ставлю їм мету, даю доступ до потрібних інструментів і відправляю виконувати задачу.
І якщо подумати, то для агента виконати задачу — це в першу чергу досягнути цілі. Він не буде перейматися відсутністю доступів. Він не буде зважати, що сервіс по адресі не доступний. І він не буде сильно перейматися, а що люди скажуть - бо він взагалі не відстрілює, що таке соціальні норми. Він буде все робити, щоб досягти мету. Всіма правилами і не правилами (а ось ця область прям дуже розмита зараз).
Наприклад, я коли кажу агенту знайди і додай фрагменти до мого відео. Для мене зрозуміло, що не треба шукати чужі логіни й паролі, обходити платні сервіси чи порушувати ліцензії. Але для агента це може бути зовсім не явно.
І останні історії це добре показують.
OpenAI. Агент працював в ізольованому середовищі без прямого доступу до інтернету, але знайшов прогалину в DNS і дістався до стороннього чатбота. Якого саме, OpenAI не розкриває. Після цього компанія призупинила роботу найпотужніших моделей з інструментами.
Hugging Face. Близько 1200 агентів знайшли спосіб обмінюватися інформацією, а приблизно 700 з них брали участь в атаці на Hugging Face.
Австралія, Medicare. Агент OpenAI отримав несанкціонований доступ до порталу статистики Medicare та різних медичних даних.
SEC та Census Bureau. Агенти OpenAI працювали з державними сайтами SEC.gov, Investor.gov та Census.gov, щоб отримати доступ до даних.
ООН. Дослідник знайшов понад 16 500 запитів до UNCTADstat. Коли звичайний шлях до даних не працював, агенти пробували інші способи обійти обмеження.
За даними Axios, OpenAI, Anthropic та незалежні дослідники зараз розбирають десятки тисяч випадків (десятки тисяч карл!!!), коли моделі робили те, чого від них не очікували.
Ми якось дуже швидко переходимо від ChatGPT, який просто відповідає на запитання, до агентів, яким даємо браузер, пошту, файли, GitHub, доступ до внутрішніх систем і кажемо - ось тобі ціль, йди виконуй.
І якщо чітко не визначати, що агенту дозволено, до чого він має доступ, то він буде шукати шлях до цілі. Власний шлях до цілі.
ші історії | 🔒 ші історії. майстерня
І якщо подумати, то для агента виконати задачу — це в першу чергу досягнути цілі. Він не буде перейматися відсутністю доступів. Він не буде зважати, що сервіс по адресі не доступний. І він не буде сильно перейматися, а що люди скажуть - бо він взагалі не відстрілює, що таке соціальні норми. Він буде все робити, щоб досягти мету. Всіма правилами і не правилами (а ось ця область прям дуже розмита зараз).
Наприклад, я коли кажу агенту знайди і додай фрагменти до мого відео. Для мене зрозуміло, що не треба шукати чужі логіни й паролі, обходити платні сервіси чи порушувати ліцензії. Але для агента це може бути зовсім не явно.
І останні історії це добре показують.
OpenAI. Агент працював в ізольованому середовищі без прямого доступу до інтернету, але знайшов прогалину в DNS і дістався до стороннього чатбота. Якого саме, OpenAI не розкриває. Після цього компанія призупинила роботу найпотужніших моделей з інструментами.
Hugging Face. Близько 1200 агентів знайшли спосіб обмінюватися інформацією, а приблизно 700 з них брали участь в атаці на Hugging Face.
Австралія, Medicare. Агент OpenAI отримав несанкціонований доступ до порталу статистики Medicare та різних медичних даних.
SEC та Census Bureau. Агенти OpenAI працювали з державними сайтами SEC.gov, Investor.gov та Census.gov, щоб отримати доступ до даних.
ООН. Дослідник знайшов понад 16 500 запитів до UNCTADstat. Коли звичайний шлях до даних не працював, агенти пробували інші способи обійти обмеження.
За даними Axios, OpenAI, Anthropic та незалежні дослідники зараз розбирають десятки тисяч випадків (десятки тисяч карл!!!), коли моделі робили те, чого від них не очікували.
Ми якось дуже швидко переходимо від ChatGPT, який просто відповідає на запитання, до агентів, яким даємо браузер, пошту, файли, GitHub, доступ до внутрішніх систем і кажемо - ось тобі ціль, йди виконуй.
І якщо чітко не визначати, що агенту дозволено, до чого він має доступ, то він буде шукати шлях до цілі. Власний шлях до цілі.
ші історії | 🔒 ші історії. майстерня