Вхід Реєстрація
Реклама
Ваше рекламне місце
Забронюйте цей слот без конкуренції на обраний період.
Купити рекламу →
Логотип телеграм спільноти - Programming Mentor
Додано 06 гру 2025 🌐 UK

Programming Mentor

@programmingmentor
Кількість підписників: 4 040
Фото: 190
Відео: 1
Посилання: 430
Опис:
Ти живеш, поки вчишся
Джерело

Programming Mentor | Про нові моделіНещодавно головні гравці на ринку трохи наспамили нових...

Логотип телеграм спільноти - Programming Mentor Programming Mentor @programmingmentor
2 060 Охват/переглядів 2026-07-28 18:50 Повідомлення №637
Про нові моделі

Нещодавно головні гравці на ринку трохи наспамили нових моделей, і бенчмарки по ним вийшли суперечливі - Anthropics заявляє що Opus 5 навіть розумніший за Fable 5, OpenAI переконує що їх GPT 5.6 sol найкращий, а тут ще й китайці з Kimi 3 неочікувано побили всіх по фронтенду (до виходу Opus 5), та й взагалі сильну модель зробили для програмування. Але якщо взяти до уваги не абсолютний інтелект, а співвідношення інтелекту і вартості, то виявляється, що на першому місці взагалі Grok 4.5 (дивимося тут у праву верхню частину).

То що з цим всім робити? Яку модель обирати, кому заносити гроші за токени?

Насправді не все так однозначно, як показують бенчмарки, треба все тестити і підбирати під ваші задачі та, звичайно, бюджети. Це, сподіваюся, всім зрозуміло і так.

А от далеко не кожен знає, що кожна модель по суті має свій специфічний підхід до того, як з неї витягнути найкращий результат? І саме від цього буде залежати, як вона буде справлятися з задачею.

Наприклад, у OpenAI є окремий розділ на сайті, де рекомендації по промптингу наведені по версіям моделей https://developers.openai.com/api/docs/guides/latest-model?model=gpt-5.6
Там просто переключаєте версії і читаєте рекомендації.

Аналогічно у Anthropic, там просто моделі переключаєте у навігації з лівої сторони
https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-fable-5

Із цікавого - для нових моделей варто переходити від покрокового опису послідовності дій то більш чіткого пояснення того, що ви хочете отримати в результаті. Це як зміна у формулюванні задачі для джуніора та сеньйора - першому ви детально пояснюєте що треба і за чим, а другому - просто говорите що хочете отримати, звертаючи увагу лише на важливі деталі.

Далі обидва вендори, кожен своїми словами, радять по суті одне й те саме: прибрати зайве з промптів. OpenAI навіть наводить цифри зі своїх внутрішніх прогонів evals для кодинг-агента – зменшені системні промпти дали приблизно +10–15% до оцінок, при цьому мінус 41–66% токенів і мінус 33–67% вартості. Anthropic формулює аналогічно: скіли та інструкції, написані під попередні моделі, часто виявляються надто прескриптивними і погіршують результат – їх треба перечитати й повикидати те, що модель тепер робить краще без вас.

Тобто ваша бібліотека промптів і скілів – це не актив назавжди. Це те, що доведеться ревізувати з кожним релізом. Привіт, для тих, хто складав промпти у “бібліотеки”.

Я, до речі, цього ніколи не заохочував і завжди радив конструювати під задачу, особливо гарно працює мета-промптинг.

Зверніть також увагу, що модель видає результат, який дуже залежить від налаштувань міркувань (reasoning, effort - low / medium / high / xhigh і т.п.) У багатьох моделей тепер якість результату буде від цього сильно залежати, ви маєте цей рівень підбирати уважно.

Третє – межі автономії. Загальна рекомендація - заздалегідь визначати, що агент може робити сам (читати файли, дивитися логи, правити код у скоупі, ганяти тести), а що потребує підтвердження (зовнішні записи, деструктивні дії, розширення скоупу). Якщо накидати по всьому промпту «спитай спочатку», «не чіпай», «дочекайся апруву» – модель почне зупинятися там, де не треба, і ви самі собі зробите гірше.

Четверте, і особисто для мене найцікавіше, бо я багато пишу про verification gap. Anthropic рекомендує явну інструкцію: перед тим як звітувати про прогрес, звірити кожне твердження з реальним результатом виклику інструмента, а неперевірене – прямо називати неперевіреним. За їхніми тестами це майже повністю прибирає вигадані звіти про виконану роботу, навіть на задачах, спеціально сконструйованих щоб їх спровокувати. Тобто частина проблеми «агент сказав що зробив, а насправді ні» лікується не лише тулінгом і хуками, а одним абзацом у промпті.