Вхід Реєстрація
Реклама
Ваше рекламне місце
Забронюйте цей слот без конкуренції на обраний період.
Купити рекламу →
Логотип телеграм спільноти - шось про ai
Додано 06 гру 2025 🌐 UK

шось про ai

@nerlfield
Кількість підписників: 739
Фото: 98
Відео: 22
Посилання: 87
Опис:
МЛ дюд, ex Reface ML engineer, зараз Lead ML в Limitless Labs, роблю стаф в крипті, до цього багато літав в 3д компьютерному зорі, робив купу ген аі в computer vision та language models. Якщо шо, пишіть: @daniel_kovalenko
Джерело

шось про ai | On the Biology of Large Language Models Антропік опублікували величезн...

Логотип телеграм спільноти - шось про ai шось про ai @nerlfield
1 080 Охват/переглядів 2025-05-05 20:15 Повідомлення №145
On the Biology of Large Language Models Антропік опублікували величезний ресьорч про те, як працюють LLMки зсередини. Які внутрішні концепти формуються в моделі і як вони взаємодіють між собою. Їх основний іпакт це метод circuit tracing - відстеження та ізоляція активацій нейронів, щоб зрозуміти, як модель думає, через побудову так званих атрібьюшен графів. Для цього вони:- Придумали реплейсмент модель: cross-layer transcoder - спеціальна архітектура, яка заміняє оригінальний трансформер, але має більш інтерпретовані активації- Транскодери тренуються відтворювати той самий аутпут, що й оригінальна модель, але з двома ключовими відмінностями: - Вони використовують sparsity penalty, щоб активувати менше нейронів одночасно - Кожен леер отримує аутпут з усіх попередніх, а не лише з попереднього. Такий собі дізентанглемент фіч з середини резідьал стріма. В них нереально багато цікавих результатів, я згадаю тільки ті, які мені сподобались більше всього:- Багатокроковий різонінг: моделі формують внутрішні проміжні концепти. Наприклад, при запитанні "столиця області, де знаходиться Мукачево", модель активує внутрішнє представлення "Закарпаття", перш ніж видати "Ужгород" (там правда був трохи інший приклад, але суть така сама)- Ллмки плануть риму наперед. Вже на початку нового рядка активуються фічі, які представляють можливі рими з попереднім рядком.- Багатомовність: у середніх леерах формуються мовно-агностичні концепти.- Додавання: замість стандартних алгоритмів модель юзає паралельні апроксимації та модульні обчислення, що сумарно дають правильний результатДе можна почитати:Блог Anthropic: частина 1, частина 2Але я б дуже радив відос від Яніка Кілчера (частина 1, частина 2), бо він за два відоса (2 години сумарно, що доволі швидко) розбирає обидві статті, але при цьому гарно пояснює всі деталі.