Login Sign Up
Advert
Your ad spot
Reserve this exclusive slot for the selected period.
Buy advertising →
Telegram community logo - All about QA - Все про тестування ПЗ
Added 23 Jun 2023

All about QA - Все про тестування ПЗ

@allaboutqa
Number of subscribers: 2 484
Photos: 330
Videos: 5
Links: 1,120
Description:
Все про тестування ПЗ YouTube канал для тестувальників https://www.youtube.com/c/AllaboutQA Manual testing, Performance testing, Automated testing, Security testing, Mobile testing Курси, навчання, івенти, вакансії. Для питань —> @d_bezt
Source

All about QA - Все про тестування ПЗ | GPT-6 Astra - що цікавого для QA/Automation інженера:• Код і робота з ...

Telegram community logo - All about QA - Все про тестування ПЗ All about QA - Все про тестування ПЗ @allaboutqa
258 Views/Reach 2026-09-04 16:34 Message №1405
GPT-6 Astra - що цікавого для QA/Automation інженера:• Код і робота з проєктами. Terminal-Bench 4.0: 57,9% проти 37,3% у Sol. Astra краще розбирається у великих кодових базах, дебажить, запускає/перевіряє код і потребує менше ітерацій для отримання робочого результату. • QA прямо в браузері. Astra суттєво сильніша у computer-use: може працювати із сайтом, проходити UI-flow, знаходити проблеми та виконувати frontend QA. OSWorld: 72,6% vs 65,7%, ScreenSpot-Pro: 92,7% vs 76,9%. • Складні баги та системний аналіз. Вона краще тримає довгі ланцюжки залежностей і контекст. На тесті довгого контексту 512K–1M: 96,3% vs 73,8%. Це важливо, коли даєш документацію + API + код + логи + вимоги й просиш знайти причину проблеми. • Менше вигадує. На внутрішньому тесті OpenAI на хибні твердження про власні можливості — 4,2% проти 12,2% у Sol. • Краще виконує багатокрокові завдання. AutomationBench: 41,4% проти 18,1% — тут різниця вже більш ніж удвічі. • Значно сильніше абстрактне reasoning. Найбільш разючий результат — ARC-AGI-3: 99,9% проти 7,8% у Sol. Водночас не варто переносити один benchmark буквально на всі повсякденні запити.