Iniciar sesión Registro
Anuncios
Tu espacio publicitario
Reserva este slot exclusivo para el periodo elegido.
Comprar publicidad →
Logotipo de la comunidad de telegram - шось про ai
Añadido 06 dic. 2025 🌐 UK

шось про ai

@nerlfield
Número de suscriptores: 739
Fotos: 98
Videos: 22
Enlaces: 87
Descripción:
МЛ дюд, ex Reface ML engineer, зараз Lead ML в Limitless Labs, роблю стаф в крипті, до цього багато літав в 3д компьютерному зорі, робив купу ген аі в computer vision та language models. Якщо шо, пишіть: @daniel_kovalenko
Fuente

шось про ai | On the Biology of Large Language Models Антропік опублікували величезн...

Logotipo de la comunidad de telegram - шось про ai шось про ai @nerlfield
1 080 Vistas/Alcance 2025-05-05 20:15 Mensaje №145
On the Biology of Large Language Models Антропік опублікували величезний ресьорч про те, як працюють LLMки зсередини. Які внутрішні концепти формуються в моделі і як вони взаємодіють між собою. Їх основний іпакт це метод circuit tracing - відстеження та ізоляція активацій нейронів, щоб зрозуміти, як модель думає, через побудову так званих атрібьюшен графів. Для цього вони:- Придумали реплейсмент модель: cross-layer transcoder - спеціальна архітектура, яка заміняє оригінальний трансформер, але має більш інтерпретовані активації- Транскодери тренуються відтворювати той самий аутпут, що й оригінальна модель, але з двома ключовими відмінностями: - Вони використовують sparsity penalty, щоб активувати менше нейронів одночасно - Кожен леер отримує аутпут з усіх попередніх, а не лише з попереднього. Такий собі дізентанглемент фіч з середини резідьал стріма. В них нереально багато цікавих результатів, я згадаю тільки ті, які мені сподобались більше всього:- Багатокроковий різонінг: моделі формують внутрішні проміжні концепти. Наприклад, при запитанні "столиця області, де знаходиться Мукачево", модель активує внутрішнє представлення "Закарпаття", перш ніж видати "Ужгород" (там правда був трохи інший приклад, але суть така сама)- Ллмки плануть риму наперед. Вже на початку нового рядка активуються фічі, які представляють можливі рими з попереднім рядком.- Багатомовність: у середніх леерах формуються мовно-агностичні концепти.- Додавання: замість стандартних алгоритмів модель юзає паралельні апроксимації та модульні обчислення, що сумарно дають правильний результатДе можна почитати:Блог Anthropic: частина 1, частина 2Але я б дуже радив відос від Яніка Кілчера (частина 1, частина 2), бо він за два відоса (2 години сумарно, що доволі швидко) розбирає обидві статті, але при цьому гарно пояснює всі деталі.