Iniciar sesión Registro
Anuncios
Tu espacio publicitario
Reserva este slot exclusivo para el periodo elegido.
Comprar publicidad →
Logotipo de la comunidad de telegram - All about QA - Все про тестування ПЗ
Añadido 23 jun. 2023

All about QA - Все про тестування ПЗ

@allaboutqa
Número de suscriptores: 2 484
Fotos: 330
Videos: 5
Enlaces: 1,120
Descripción:
Все про тестування ПЗ YouTube канал для тестувальників https://www.youtube.com/c/AllaboutQA Manual testing, Performance testing, Automated testing, Security testing, Mobile testing Курси, навчання, івенти, вакансії. Для питань —> @d_bezt
Fuente

All about QA - Все про тестування ПЗ | GPT-6 Astra - що цікавого для QA/Automation інженера:• Код і робота з ...

Logotipo de la comunidad de telegram - All about QA - Все про тестування ПЗ All about QA - Все про тестування ПЗ @allaboutqa
258 Vistas/Alcance 2026-09-04 16:34 Mensaje №1405
GPT-6 Astra - що цікавого для QA/Automation інженера:• Код і робота з проєктами. Terminal-Bench 4.0: 57,9% проти 37,3% у Sol. Astra краще розбирається у великих кодових базах, дебажить, запускає/перевіряє код і потребує менше ітерацій для отримання робочого результату. • QA прямо в браузері. Astra суттєво сильніша у computer-use: може працювати із сайтом, проходити UI-flow, знаходити проблеми та виконувати frontend QA. OSWorld: 72,6% vs 65,7%, ScreenSpot-Pro: 92,7% vs 76,9%. • Складні баги та системний аналіз. Вона краще тримає довгі ланцюжки залежностей і контекст. На тесті довгого контексту 512K–1M: 96,3% vs 73,8%. Це важливо, коли даєш документацію + API + код + логи + вимоги й просиш знайти причину проблеми. • Менше вигадує. На внутрішньому тесті OpenAI на хибні твердження про власні можливості — 4,2% проти 12,2% у Sol. • Краще виконує багатокрокові завдання. AutomationBench: 41,4% проти 18,1% — тут різниця вже більш ніж удвічі. • Значно сильніше абстрактне reasoning. Найбільш разючий результат — ARC-AGI-3: 99,9% проти 7,8% у Sol. Водночас не варто переносити один benchmark буквально на всі повсякденні запити.