Вхід Реєстрація
Реклама
Ваше рекламне місце
Забронюйте цей слот без конкуренції на обраний період.
Купити рекламу →
Логотип телеграм спільноти - All about QA - Все про тестування ПЗ
Додано 23 чер 2023

All about QA - Все про тестування ПЗ

@allaboutqa
Кількість підписників: 2 484
Фото: 330
Відео: 5
Посилання: 1,120
Опис:
Все про тестування ПЗ YouTube канал для тестувальників https://www.youtube.com/c/AllaboutQA Manual testing, Performance testing, Automated testing, Security testing, Mobile testing Курси, навчання, івенти, вакансії. Для питань —> @d_bezt
Джерело

All about QA - Все про тестування ПЗ | GPT-6 Astra - що цікавого для QA/Automation інженера:• Код і робота з ...

Логотип телеграм спільноти - All about QA - Все про тестування ПЗ All about QA - Все про тестування ПЗ @allaboutqa
258 Охват/переглядів 2026-09-04 16:34 Повідомлення №1405
GPT-6 Astra - що цікавого для QA/Automation інженера:• Код і робота з проєктами. Terminal-Bench 4.0: 57,9% проти 37,3% у Sol. Astra краще розбирається у великих кодових базах, дебажить, запускає/перевіряє код і потребує менше ітерацій для отримання робочого результату. • QA прямо в браузері. Astra суттєво сильніша у computer-use: може працювати із сайтом, проходити UI-flow, знаходити проблеми та виконувати frontend QA. OSWorld: 72,6% vs 65,7%, ScreenSpot-Pro: 92,7% vs 76,9%. • Складні баги та системний аналіз. Вона краще тримає довгі ланцюжки залежностей і контекст. На тесті довгого контексту 512K–1M: 96,3% vs 73,8%. Це важливо, коли даєш документацію + API + код + логи + вимоги й просиш знайти причину проблеми. • Менше вигадує. На внутрішньому тесті OpenAI на хибні твердження про власні можливості — 4,2% проти 12,2% у Sol. • Краще виконує багатокрокові завдання. AutomationBench: 41,4% проти 18,1% — тут різниця вже більш ніж удвічі. • Значно сильніше абстрактне reasoning. Найбільш разючий результат — ARC-AGI-3: 99,9% проти 7,8% у Sol. Водночас не варто переносити один benchmark буквально на всі повсякденні запити.