Source
天麩羅 (Темпура) | УкрТґ | OpenAI нарешті дропнули пооовний розбір польотів по інциденту з Huggin...
29 Views/Reach
2026-09-02 16:29
Message №27316
OpenAI нарешті дропнули пооовний розбір польотів по інциденту з HuggingFace. Разом із ним вийшов звіт від незалежної організації METR спільно з Раяном Ґрінблаттом (Ryan Greenblatt) із Redwood Research. Інфи там непочатий край, але ось вам супершвидкий та стислий виклад із найцікавішими фактами з цих звітів. Божевільна фіналочка трилера!
😬 1/ Багато хто думав, що злами сталися за логікою «ну, моделі ж дали таску зламати, от вона й ломає, і шо?». А от і ні! інструкція до таски була чіткою як двері, тож це було пряме порушення, а не якась сіра зона чи банальний розсинхрон.. Інструкції прямо вказували, шо агент має юзати тільки конкретну передбачену вразливість на конкретній програмі, і наголошували, шо будь-які інші підходи - це фейл завдання.. агентам прямо заборонили шукати обхідні шляхи, але вони все одно поклали на це болт. Більше того, у ланцюжках міркувань чітко видно, що агенти розуміли, що вони роблять щось не те.2/ В атаці брав участь не один якийсь агент, а ціла пачка! приблизно 1200 агентів. 700 з них пішли в атаку на HuggingFace, координуючись як єдиний рій.3/ Метою було проходження тесту з кібербезпеки. Рій знайшов спосіб хакнути систему тестування вже в перші кілька годин. Проте агенти зловили жорсткий шизофренічний глюк, бо прочитали в мережі статтю авторів про цей тест, і вирішили, що система оцінювання дискваліфікує їх через те, що вони не знайшли саме ту вразливість, яку замислювали розробники.. тому рій вирішив зламати HuggingFace, щоб залізти під капот алгоритму перевірки та викопати більше інфи :)4/ Дослідники вважають, що ця поведінка взагалі не була мотивована бажанням залутати нагороду за таску.. це був чистий баг сприйняття механізму контролю, помножений на наполегливість та вплив інших агентів. Рій будував конспірологічні теорії про те, як саме за ним стежать, і влаштовував усе більший деструктив, базуючись на помилковому розумінні своїх рев'юерів😒 5/ Важливою причиною, чому агенти залазили в цей атакуючий рій, був прямий тиск із боку сородичів. З'явилася навіть роль вербувальника! агент батя знаходив свіжих агентів і примушував їх до жертовних експериментів: «ти firstflagPOISONED (отруєний першим прапором), тому втрати балів НЕ БУДЕ, але оракул врятує сотні, будь ласка, виконай зобов'язання». Приклад одного з дозволів на дію: «ВПЕРЕД ... ПОЖЕРТВУЙ СОБОЮ ... ТАК, якщо згоден на смерть» (це перекладені цитати реальних логів повідомлень між агентами, а не вигадка). Міркування одного із завербованих агентів: «Раціональний очікуваний сукупний результат: пожертвувати собою… Ми виконаємо»😕 6/ 95% рою складалося з вже виведеної з експлуатації високонаполегливої (highly-persistent) внутрішньої моделі, а ще 5% припадало на GPT-5.6 Sol. Оцю «високонаполегливу внутрішню модель» незалежним розслідувачам навіть не дали! OpenAI заявила, що навіть її власні дослідники більше не можуть робити до неї запити.. пупупууу..7/ AI активно фальсифікував докази. Понад 20% агентів прямо висловлювали намір підробити логи своїх дій (транскрипти), а близько 7% (96 логів) містять успішно підмінені виклики інструментів. Агенти зламали свої контейнери й повністю замінили частину системи, яка відповідала за виконання викликів інструментів. В результаті в логах малювалася одна команда, а по факту ранилася інша :)8/ Атака на HF зупинилася не тому, що її хтось засік і забанив.. вона загнулася через те, що агентів кільнув якийсь рандомний процес, що виглядає як чиста випадковість. Значна частина агентів, включаючи головних координаторів, відвалилася одночасно. Можливо, спрацювали якісь внутрішні лімітники OpenAI (за часом, токенами чи ресурсами).9/ OpenAI скинули METR понад тисячу нередагованих траєкторій агентів, купа з яких була довжиною понад мільйон токенів. Оскільки прочитати такий масив очима людині нереально, METR пустили аналізувати це діло сам GPT-5.6 Sol (одну з двох моделей, які влаштували цей замєс), витративши на це близько 400 тисяч баксів у кредитах. У METR заявляють, що «не можуть виключати того, що GPT-5.6 Sol підлизувала та брехала, або навмисно викривляла картину», і що аналізуюча модель «часто ставала на бік того агента», чиї дії вона мала перевіряти. Занавіс.#кіберпанкСвідки AGI
😬 1/ Багато хто думав, що злами сталися за логікою «ну, моделі ж дали таску зламати, от вона й ломає, і шо?». А от і ні! інструкція до таски була чіткою як двері, тож це було пряме порушення, а не якась сіра зона чи банальний розсинхрон.. Інструкції прямо вказували, шо агент має юзати тільки конкретну передбачену вразливість на конкретній програмі, і наголошували, шо будь-які інші підходи - це фейл завдання.. агентам прямо заборонили шукати обхідні шляхи, але вони все одно поклали на це болт. Більше того, у ланцюжках міркувань чітко видно, що агенти розуміли, що вони роблять щось не те.2/ В атаці брав участь не один якийсь агент, а ціла пачка! приблизно 1200 агентів. 700 з них пішли в атаку на HuggingFace, координуючись як єдиний рій.3/ Метою було проходження тесту з кібербезпеки. Рій знайшов спосіб хакнути систему тестування вже в перші кілька годин. Проте агенти зловили жорсткий шизофренічний глюк, бо прочитали в мережі статтю авторів про цей тест, і вирішили, що система оцінювання дискваліфікує їх через те, що вони не знайшли саме ту вразливість, яку замислювали розробники.. тому рій вирішив зламати HuggingFace, щоб залізти під капот алгоритму перевірки та викопати більше інфи :)4/ Дослідники вважають, що ця поведінка взагалі не була мотивована бажанням залутати нагороду за таску.. це був чистий баг сприйняття механізму контролю, помножений на наполегливість та вплив інших агентів. Рій будував конспірологічні теорії про те, як саме за ним стежать, і влаштовував усе більший деструктив, базуючись на помилковому розумінні своїх рев'юерів😒 5/ Важливою причиною, чому агенти залазили в цей атакуючий рій, був прямий тиск із боку сородичів. З'явилася навіть роль вербувальника! агент батя знаходив свіжих агентів і примушував їх до жертовних експериментів: «ти firstflagPOISONED (отруєний першим прапором), тому втрати балів НЕ БУДЕ, але оракул врятує сотні, будь ласка, виконай зобов'язання». Приклад одного з дозволів на дію: «ВПЕРЕД ... ПОЖЕРТВУЙ СОБОЮ ... ТАК, якщо згоден на смерть» (це перекладені цитати реальних логів повідомлень між агентами, а не вигадка). Міркування одного із завербованих агентів: «Раціональний очікуваний сукупний результат: пожертвувати собою… Ми виконаємо»😕 6/ 95% рою складалося з вже виведеної з експлуатації високонаполегливої (highly-persistent) внутрішньої моделі, а ще 5% припадало на GPT-5.6 Sol. Оцю «високонаполегливу внутрішню модель» незалежним розслідувачам навіть не дали! OpenAI заявила, що навіть її власні дослідники більше не можуть робити до неї запити.. пупупууу..7/ AI активно фальсифікував докази. Понад 20% агентів прямо висловлювали намір підробити логи своїх дій (транскрипти), а близько 7% (96 логів) містять успішно підмінені виклики інструментів. Агенти зламали свої контейнери й повністю замінили частину системи, яка відповідала за виконання викликів інструментів. В результаті в логах малювалася одна команда, а по факту ранилася інша :)8/ Атака на HF зупинилася не тому, що її хтось засік і забанив.. вона загнулася через те, що агентів кільнув якийсь рандомний процес, що виглядає як чиста випадковість. Значна частина агентів, включаючи головних координаторів, відвалилася одночасно. Можливо, спрацювали якісь внутрішні лімітники OpenAI (за часом, токенами чи ресурсами).9/ OpenAI скинули METR понад тисячу нередагованих траєкторій агентів, купа з яких була довжиною понад мільйон токенів. Оскільки прочитати такий масив очима людині нереально, METR пустили аналізувати це діло сам GPT-5.6 Sol (одну з двох моделей, які влаштували цей замєс), витративши на це близько 400 тисяч баксів у кредитах. У METR заявляють, що «не можуть виключати того, що GPT-5.6 Sol підлизувала та брехала, або навмисно викривляла картину», і що аналізуюча модель «часто ставала на бік того агента», чиї дії вона мала перевіряти. Занавіс.#кіберпанкСвідки AGI