Джерело
ШІнновації | HarnessTax: прихована плата за оболонку кодинг-агентівКоманда Arena пр...
150 Охват/переглядів
2026-09-19 14:35
Повідомлення №119
HarnessTax: прихована плата за оболонку кодинг-агентів
Команда Arena протестувала 21 комбінацію «модель — харнес» (оболонка агента) на трьох харнесах — Claude Code, Codex CLI та Pi — використовуючи бенчмарки SWE-bench Lite і Terminal-Bench 2.0. На кожному бенчмарку бралося 30 випадкових задач, по три спроби на задачу, з обмеженням у 100 ходів агента й однаковим прайс-листом API станом на 1 вересня 2026 року.
Головний висновок: вибір харнесу майже не впливає на частку успішно вирішених задач, але суттєво впливає на вартість. Середній ефект харнесу на успішність — у межах ±2% на SWE-bench Lite і близько ±5% на Terminal-Bench 2.0, тоді як різниця у витратах сягає кратних значень. Claude Code у середньому коштує приблизно вдвічі дорожче за Pi й у 1.6 раза дорожче за Codex на SWE-bench Lite.
Мінімалістичний відкритий харнес Pi, що надає лише чотири інструменти (read, write, edit, bash), виходить в лідери на обох бенчмарках. Причина розриву у витратах частково в тому, що середній стартовий контекст Claude Code більш ніж у 10 разів перевищує контекст Pi через довші інструкції та більші схеми інструментів — при майже однаковій кількості ходів.
Третій висновок: модель не обов'язково найкраще працює у «рідному» харнесі свого провайдера. У дев'яти з дванадцяти порівнянь найвищу успішність показав альтернативний харнес.
Команда Arena протестувала 21 комбінацію «модель — харнес» (оболонка агента) на трьох харнесах — Claude Code, Codex CLI та Pi — використовуючи бенчмарки SWE-bench Lite і Terminal-Bench 2.0. На кожному бенчмарку бралося 30 випадкових задач, по три спроби на задачу, з обмеженням у 100 ходів агента й однаковим прайс-листом API станом на 1 вересня 2026 року.
Головний висновок: вибір харнесу майже не впливає на частку успішно вирішених задач, але суттєво впливає на вартість. Середній ефект харнесу на успішність — у межах ±2% на SWE-bench Lite і близько ±5% на Terminal-Bench 2.0, тоді як різниця у витратах сягає кратних значень. Claude Code у середньому коштує приблизно вдвічі дорожче за Pi й у 1.6 раза дорожче за Codex на SWE-bench Lite.
Мінімалістичний відкритий харнес Pi, що надає лише чотири інструменти (read, write, edit, bash), виходить в лідери на обох бенчмарках. Причина розриву у витратах частково в тому, що середній стартовий контекст Claude Code більш ніж у 10 разів перевищує контекст Pi через довші інструкції та більші схеми інструментів — при майже однаковій кількості ходів.
Третій висновок: модель не обов'язково найкраще працює у «рідному» харнесі свого провайдера. У дев'яти з дванадцяти порівнянь найвищу успішність показав альтернативний харнес.