Джерело
All about QA - Все про тестування ПЗ | GPT-6 Astra - що цікавого для QA/Automation інженера:• Код і робота з ...
258 Охват/переглядів
2026-09-04 16:34
Повідомлення №1405
GPT-6 Astra - що цікавого для QA/Automation інженера:• Код і робота з проєктами. Terminal-Bench 4.0: 57,9% проти 37,3% у Sol. Astra краще розбирається у великих кодових базах, дебажить, запускає/перевіряє код і потребує менше ітерацій для отримання робочого результату. • QA прямо в браузері. Astra суттєво сильніша у computer-use: може працювати із сайтом, проходити UI-flow, знаходити проблеми та виконувати frontend QA. OSWorld: 72,6% vs 65,7%, ScreenSpot-Pro: 92,7% vs 76,9%. • Складні баги та системний аналіз. Вона краще тримає довгі ланцюжки залежностей і контекст. На тесті довгого контексту 512K–1M: 96,3% vs 73,8%. Це важливо, коли даєш документацію + API + код + логи + вимоги й просиш знайти причину проблеми. • Менше вигадує. На внутрішньому тесті OpenAI на хибні твердження про власні можливості — 4,2% проти 12,2% у Sol. • Краще виконує багатокрокові завдання. AutomationBench: 41,4% проти 18,1% — тут різниця вже більш ніж удвічі. • Значно сильніше абстрактне reasoning. Найбільш разючий результат — ARC-AGI-3: 99,9% проти 7,8% у Sol. Водночас не варто переносити один benchmark буквально на всі повсякденні запити.