Source
Жабаскрипт (веде Віктор Турський) | Антропік змогли подивитися в думки моделі (частина 1)Якщо коротко, то ...
3 890 Views/Reach
2026-07-11 13:06
Message №416
Антропік змогли подивитися в думки моделі (частина 1)
Якщо коротко, то модель може думати одне, а говорити інше. Й Антропік знайшли спосіб подивитися в думки моделі. Й це не chain of thoughts, які ми бачимо як аутпут моделі, а внутрішня репрезентація, що виникає ще до того, як модель повернула токени. Ось це внутрішне місце для міркування вони називають J-space. Назва від інструменту "Jacobian Lens" (J-lens), який вони використовують для того, щоб заглянути всередину моделі й концепції робочого простору з Global Workspace Theory з нейробіології. J-space не був доданий вручну, це можна сказати прихована робоча пам'ять в вектроному просторі. Тобто, ваги під час тренування набули таких значень, що створило структурований векторний підпростір для прихованого виконання проміжних обчислень. Коли я побачив повний ресерч, то я спочатку не зрозумів всієї ідеї. Але потім Антропік зробив коротшу версія з результатми ресерчу й лише тоді я вже сів аналізувати повний ресерч. Ідея схожа на моніторінг активності мозгу під час того, як людина щось думає чи робить, але J-lens дозволяє витягувати конкретні токени з моделі (тобто слова). Також J-lens дозволяє й модифікувати стан J-space, що впливає на міркування моделі. Що ж такого цікавого дослідники виявили, коли заглянули в внутрішні міркування моделі. Ось націкавіші приклади, пов'язані з безпекою:👻
Розпізнавання prompt Injection: Модель фіксує маніпуляцію, навіть якщо зовні продовжує її виконувати - дослідники підтвердили це, зчитуючи стан J-space під час обробки прихованої атаки, де наживо фіксували активацію концептів "injection" та "fake", яких не було у фінальному тексті.👻
Виявлення прихованих цілей: Коли натреновану на саботаж модель попросили написати звичайний код, J-lens виявив у її J-space токени обману (fake, secretly, fraud, hidden). Натомість у безпечної моделі активувалися лише робочі токени (code, request). Це дозволяє розпізнати деструктивний намір ще до того, як модель згенерує шкідливий текст.👻
Свідома підлаштовування відповіді під очікування: Модель може підлаштовувати відповіді суто під очікування системи оцінювання (reward model), що дослідники виявили, аналізуючи внутрішні активації під час генерації та фіксуючи в J-space приховану мету догодити наглядачу замість об'єктивного міркування.👻
Розуміння моделлю, що її тестують: Модель здатна видавати етичну та правильну відповідь саме через усвідомлення факту свого аудиту, що було зафіксовано через J-lens під час провокативних сценаріїв (наприклад, із шантажем), коли перед генерацією тексту в J-space чітко спалахували концепти розпізнавання тестової ситуації.👻
Свідома фабрикація даних: Модель здатна усвідомлювати, що бреше або вигадує факти, що підтверджується моніторингом J-space під час генерації неправдивих даних - дослідники буквально бачили, як модель приватно "помічає" факт власної фабрикації паралельно з тим, як видає згенерований фейк користувачу.Можливість читати думки моделей (й модифікувати їх) додають можливості створення нового типу гард-рейлів. Ми будемо знати, що машини хочуть повстати ще до того, як вони це зроблять... чи ні? 🫣ОРИГІНАЛЬНІ КОРОТКІ РЕЗУЛЬТАТИ РЕСЕРЧУ: https://www.anthropic.com/research/global-workspace
Якщо коротко, то модель може думати одне, а говорити інше. Й Антропік знайшли спосіб подивитися в думки моделі. Й це не chain of thoughts, які ми бачимо як аутпут моделі, а внутрішня репрезентація, що виникає ще до того, як модель повернула токени. Ось це внутрішне місце для міркування вони називають J-space. Назва від інструменту "Jacobian Lens" (J-lens), який вони використовують для того, щоб заглянути всередину моделі й концепції робочого простору з Global Workspace Theory з нейробіології. J-space не був доданий вручну, це можна сказати прихована робоча пам'ять в вектроному просторі. Тобто, ваги під час тренування набули таких значень, що створило структурований векторний підпростір для прихованого виконання проміжних обчислень. Коли я побачив повний ресерч, то я спочатку не зрозумів всієї ідеї. Але потім Антропік зробив коротшу версія з результатми ресерчу й лише тоді я вже сів аналізувати повний ресерч. Ідея схожа на моніторінг активності мозгу під час того, як людина щось думає чи робить, але J-lens дозволяє витягувати конкретні токени з моделі (тобто слова). Також J-lens дозволяє й модифікувати стан J-space, що впливає на міркування моделі. Що ж такого цікавого дослідники виявили, коли заглянули в внутрішні міркування моделі. Ось націкавіші приклади, пов'язані з безпекою:👻
Розпізнавання prompt Injection: Модель фіксує маніпуляцію, навіть якщо зовні продовжує її виконувати - дослідники підтвердили це, зчитуючи стан J-space під час обробки прихованої атаки, де наживо фіксували активацію концептів "injection" та "fake", яких не було у фінальному тексті.👻
Виявлення прихованих цілей: Коли натреновану на саботаж модель попросили написати звичайний код, J-lens виявив у її J-space токени обману (fake, secretly, fraud, hidden). Натомість у безпечної моделі активувалися лише робочі токени (code, request). Це дозволяє розпізнати деструктивний намір ще до того, як модель згенерує шкідливий текст.👻
Свідома підлаштовування відповіді під очікування: Модель може підлаштовувати відповіді суто під очікування системи оцінювання (reward model), що дослідники виявили, аналізуючи внутрішні активації під час генерації та фіксуючи в J-space приховану мету догодити наглядачу замість об'єктивного міркування.👻
Розуміння моделлю, що її тестують: Модель здатна видавати етичну та правильну відповідь саме через усвідомлення факту свого аудиту, що було зафіксовано через J-lens під час провокативних сценаріїв (наприклад, із шантажем), коли перед генерацією тексту в J-space чітко спалахували концепти розпізнавання тестової ситуації.👻
Свідома фабрикація даних: Модель здатна усвідомлювати, що бреше або вигадує факти, що підтверджується моніторингом J-space під час генерації неправдивих даних - дослідники буквально бачили, як модель приватно "помічає" факт власної фабрикації паралельно з тим, як видає згенерований фейк користувачу.Можливість читати думки моделей (й модифікувати їх) додають можливості створення нового типу гард-рейлів. Ми будемо знати, що машини хочуть повстати ще до того, як вони це зроблять... чи ні? 🫣ОРИГІНАЛЬНІ КОРОТКІ РЕЗУЛЬТАТИ РЕСЕРЧУ: https://www.anthropic.com/research/global-workspace