OpenAI презентує ШІ-агента Operator, який може робити все в інтернеті за вас Компанія OpenAI представила новий інструмент під назвою Operator, який здатен працювати у веббраузері. Ця розробка базується на технології, відомій як Computer-Using Agent (CUA), що дозволяє штучному інтелекту взаємодіяти з графічними інтерфейсами (GUI) так само, як це роблять люди. Завдяки цьому Operator виконує цифрові завдання без необхідності доступу до спеціалізованих API операційної системи чи вебсервісів, пише Channel Tech. Operator побудований на моделі GPT-4o, яка поєднує в собі потужні можливості комп’ютерного зору та розширені навички аналізу, отримані через навчання із підкріпленням. Агента навчили розбивати складні завдання на поетапні плани та адаптивно коригувати свої дії у разі виникнення труднощів. Представники OpenAI заявили, що це черговий прорив у розвитку штучного інтелекту. Водночас вони попереджають, що Operator все ще перебуває на ранній стадії розробки, тому його функціональність не завжди буде стабільною. Наприклад, ефективність агента суттєво залежить від деталізації завдань, які задає користувач. Якщо Operator стикається зі складнощами, він передає управління користувачеві. Аналогічно, коли вебсайт вимагає введення конфіденційної інформації, як-от паролі, агент блокує дію для забезпечення безпеки. OpenAI підкреслює, що інструмент створений із врахуванням етичних стандартів: він відмовляє у виконанні шкідливих запитів та блокує заборонений контент. Наразі Operator доступний користувачам підписки ChatGPT Pro, яка коштує $200 на місяць. Крім того, OpenAI співпрацює з компаніями, такими як Instacart, щоб інтегрувати агента на їхніх платформах. Однак для тестування цієї інтеграції також потрібна Pro-підписка. Operator долучається до зростаючого списку ШІ-агентів, здатних взаємодіяти з веббраузером чи операційною системою. Наприклад, Anthropic презентувала модель Claude 3.5 Sonnet у жовтні, а Google нещодавно випустила свою модель Gemini 2.0 разом із Project Mariner.
OpenAI готує до запуску ШІ-агент Operator, який зможе за вас виконувати різні завдання на комп’ютері OpenAI має незабаром представити інноваційний інструмент під назвою Operator, здатний самостійно керувати комп’ютером користувача і виконувати завдання. Про це пише Channel Tech. Operator — це "агентна" система, яка може автономно виконувати різні завдання, включно з написанням коду чи бронюванням подорожей. За даними джерел, OpenAI планує презентувати Operator вже у січні. Підтвердженням цієї інформації стали свідчення розробника ПЗ Тібора Блахо, який раніше неодноразово точно передавав дані про майбутні продукти у сфері штучного інтелекту. Тібор Блахо виявив приховані функції у клієнті ChatGPT для macOS, серед яких є налаштування для "перемикання Operator" та "примусового завершення Operator". Окрім цього, OpenAI, за його словами, вже має на своєму сайті згадки про Operator, які поки що недоступні для широкого загалу. Також у витоках фігурують таблиці з порівнянням продуктивності Operator із конкурентними ШІ-системами. Якщо дані правдиві, Operator демонструє результати нижчі за людські, але перевершує інших агентів у певних завданнях. На OSWorld, платформі для моделювання реального середовища роботи комп’ютера, ШІ-модель OpenAI CUA (імовірно основа Operator) набрала 38,1%. Це більше, ніж у конкурента Anthropic, але суттєво менше, ніж у людей (72,4%). На тесті WebVoyager, який оцінює здатність ШІ працювати з вебсайтами, OpenAI CUA перевершила людські результати, але не змогла досягти рівня людей на іншому вебтесті — WebArena. Система також показала низькі результати у завданнях, які люди виконують легко. Наприклад, створення криптогаманця вдалось Operator лише у 10% випадків, а запуск віртуальної машини — у 60%. OpenAI витратила значний час на розробку Operator, приділяючи особливу увагу тестам на безпеку. Відомо, що система успішно проходить тести на стійкість до "зловмисних дій" і пошуку конфіденційних даних.
LinkedIn запускає ШІ-функцію Job Match, щоб скоротити кількість невдалих заявок на вакансії Багато кандидатів постають перед труднощами в пошуку роботи навіть на етапі потрапляння на співбесіду. LinkedIn вважає, що одна з причин цього — надмірна кількість заявок від людей, які не відповідають вимогам вакансій. Щоб розв’язати цю проблему, компанія запускає нову функцію “Job Match”, яка працює на основі штучного інтелекту. Про це пише Channel Tech. “Job Match” створено для того, щоб допомогти користувачам зрозуміти, наскільки вони підходять для конкретної вакансії. Завдяки штучному інтелекту функція аналізує досвід кандидата та порівнює його з вимогами, зазначеними в описі вакансії. Рохан Раджів, менеджер продукту LinkedIn, пояснив, що ця технологія виходить за рамки стандартного пошуку за ключовими словами. Вона здатна оцінювати як загальну кваліфікацію кандидата, так і відповідність його навичок конкретним вимогам роботодавця. За словами Раджіва, мета функції — допомогти користувачам знаходити роботу, яка максимально відповідає їхньому досвіду, і уникати заявок на вакансії, які не відповідають їхнім кваліфікаціям. “Job Match” доступна всім користувачам платформи, але підписники LinkedIn Premium отримають додаткові переваги. Вони зможуть побачити більш детальну інформацію про рівень своєї відповідності вакансії. Крім того, ця функція має допомогти рекрутерам, адже LinkedIn планує забезпечити більш точний підбір кандидатів. Це зменшить ризик, що кваліфіковані спеціалісти будуть непоміченими через великий потік заявок.
Новий ШІ-інструмент від Adobe може редагувати 10 000 зображень в один клік Adobe представила ШІ-інструменти, які автоматизують складні завдання. Головною новинкою стала функція Firefly Bulk Create, яка дозволяє змінювати розмір до 10 000 зображень або замінювати їхні фони одним кліком. Наразі цей інструмент доступний в бета-версії, повідомляє Vector. Інструмент складається з двох основних функцій: - Remove Background видаляє або замінює фони у зображеннях, додаючи задані кольори чи зображення. Цей інструмент підтримує PNG та JPEG, а у майбутньому з’явиться підтримка PSD. - Resize автоматично змінює розміри зображень під популярні формати для соцмереж, як-от TikTok, Instagram і Facebook. Однак є деякі недоліки з більш складними форматами. Також Adobe запускає нові інструменти для розробників: - Dubbing and Lip Sync — переклад відео 14 мовами; - Інструмент для InDesign — автоматичне форматування тексту й зображень; - Цифрові аватари — для створення відео й презентацій за текстовими описами. Adobe повідомила, що за використання цих інструментів користувачам доведеться платити. Для цього пропонуються спеціальні генеративні кредити, які можна придбати у межах преміумпланів Firefly.
Бот OpenAI паралізував роботу українського сервісу 3D-моделей Бот OpenAI спричинив збій в роботі українського сервісу Triplegangers, який спеціалізується на створенні та продажу 3D-моделей людей. Інцидент стався, коли бот почав агресивно сканувати весь контент сайту, надсилаючи десятки тисяч запитів через понад 600 IP-адрес, повідомляє TechCrunch. Сервіс, який має базу з 65 000 продуктів (кожен включає щонайменше три фотографії та детальні описи), не витримав навантаження та припинив роботу. Хоча на сайті була сторінка з умовами користування, що забороняє ботам брати зображення без дозволу, цього виявилося недостатньо. Для захисту від подібних атак необхідно правильно налаштувати файл robots.txt зі спеціальними тегами для ботів OpenAI. Компанія, яка має офіси в Україні та США, зазнала подвійних збитків: через простій сайту та через надмірне навантаження на сервери AWS, що призвело до додаткових витрат. Керівництво Triplegangers не змогло зв'язатися з OpenAI для з'ясування ситуації та вимоги видалити можливо викрадені дані. Ситуація особливо критична, оскільки компанія працює з 3D-сканами реальних людей, що підпадає під суворі правила захисту персональних даних, зокрема європейський GDPR. Проблему вдалося вирішити лише після налаштування правильного robots.txt файлу та встановлення захисту Cloudflare, яка блокує не лише бот OpenAI, але й інші подібні сканери. За даними компанії DoubleVerify, у 2024 році кількість недійсного трафіку від ШІ-ботів зросла на 86%. Більшість власників сайтів навіть не підозрюють, що їхній контент сканується ШІ-ботами, тому необхідно постійно моніторити активність на серверах для виявлення подібних загроз. Експерти наголошують, що ШІ-компанії повинні просити дозволу на сканування даних, а не просто брати їх без згоди.
Google запускає Daily Listen – ШІ-подкасти на основі вашої стрічки Discover Google продовжує використовувати дані про інтереси своїх користувачів для залучення їх уваги. Нова експериментальна функція Search Labs під назвою Daily Listen дозволяє автоматично створювати подкасти на основі вашої стрічки Discover. Про це пише Channel Tech. Discover — це персоналізована стрічка на мобільних пристроях, яка наповнюється статтями та відео, що відповідають вашим інтересам, згідно з пошуковими запитами та іншою активністю. Нова функція нагадує інструмент NotebookLM, який Google представила минулого року. NotebookLM може перетворювати завантажені матеріали на подкасти з двома ведучими, які навіть імітують живе спілкування. Функція Daily Listen створює подкаст тривалістю близько 5 хвилин, у якому викладається короткий огляд новин та тем, які вас зазвичай цікавлять. Щоб випробувати цю можливість, потрібно увійти до Search Labs, натиснувши на піктограму колби у верхньому лівому куті додатка Google. Після активації функції на Android або iOS ви знайдете картку Daily Listen під пошуковим рядком у додатку Google. Після натискання на картку генерується подкаст. На екрані відображаються текстовий транскрипт і аудіоконтролери, які дозволяють перемотувати, зупиняти або відтворювати епізод. Аудіо також містить індикатори, що показують, де починається і закінчується кожна частина подкасту. Користувачі можуть оцінити подкаст за допомогою “палець вгору” або “палець вниз”, щоб надати Google зворотний зв’язок. Додатково під подкастом можна знайти групу пов’язаних матеріалів, які дозволяють детальніше ознайомитися з темами, про які йшлося в аудіо. Функція Daily Listen вже працює у США. Однак її поява на пристроях користувачів може зайняти деякий час.
Google DeepMind створює команду для розробки "світових моделей" штучного інтелекту Google DeepMind оголосила про формування нової команди дослідників штучного інтелекту для розробки так званих світових моделей — технології, здатної імітувати фізичне середовище, повідомляє Speka. Ініціативу очолить Тім Брукс, колишній співкерівник проєкту Sora від OpenAI, який приєднався до DeepMind у жовтні 2024 року. Команда зосередиться на створенні генеративних моделей, що допомагатимуть у симуляціях для відеоігор, навчання роботів і розвитку інших систем штучного інтелекту. "Світові моделі" є перспективним напрямом у сфері штучного інтелекту. Вони можуть слугувати платформою для створення реалістичних середовищ для навчання автономних агентів, планування дій роботів, а також інтерактивних розваг. Google також позиціонує цей проєкт як ключовий крок у досягненні штучного загального інтелекту (AGI) — технології, що дозволить машинам виконувати будь-які завдання, доступні людині. Нова команда DeepMind працюватиме разом із флагманськими проєктами Google AI, як-от моделі Gemini AI, відеогенератор Veo та світова модель Genie, що вже імітує 3D-середовища у реальному часі.
OpenAI провалила запуск обіцяного інструменту для захисту авторських прав OpenAI обіцяла до 2025 року створити спеціальний інструмент Media Manager. За задумом, він мав виявляти захищені авторським правом тексти, зображення, відео та аудіо з різних джерел і враховувати побажання авторів щодо їхнього використання. Це мало заспокоїти критиків компанії та захистити OpenAI від судових позовів через порушення прав інтелектуальної власності, повідомляє Vector. За словами колишнього працівника компанії, над цим інструментом майже ніхто не працював. Тим часом проти OpenAI подали позови письменники, художники та медіакомпанії, які звинувачують компанію у незаконному використанні їхніх робіт. Серед них — письменниця Сара Сільверман та газета The New York Times. У компанії заявляють, що створити хороший ШІ без використання матеріалів, захищених авторським правом, неможливо. Але автори творів вважають, що OpenAI має питати в них дозволу. OpenAI сподівається, що суд дозволить компанії використовувати чужі матеріали без дозволу, як раніше дозволив це Google для проєкту Google Books. Поки що компанія не говорить, коли з’явиться обіцяний інструмент Media Manager.
OpenAI запустила свій пошуковик ChatGPT Search Компанія OpenAI представила свою пошукову систему ChatGPT Search, яка працює безпосередньо в чат-боті. Це рішення дозволить користувачам отримувати інформацію прямо під час діалогу з ШІ, не покидаючи межі платформи, повідомляє AIN.UA. Пошуковик зʼявився в полі для запитів. ChatGPT сам вирішить активувати режим або ж можна вибрати вручну, натиснувши значок Search. Відповіді міститимуть посилання на першоджерела. Натиснувши кнопку Sources під відповіддю, відкриватиметься бічна панель зі списком посилань. ChatGPT Search буде використовувати сторонні пошукові системи та контент від партнерів. Модель базується на технології GPT-4o. OpenAI стверджує, що користувачі можуть “шукати більш природним та інтуїтивним способом” і ставити додаткові питання “так само, як під час розмови”. Нова функція пошуку доступна на всіх платформах ChatGPT: iOS, Android і настільних програмах для macOS і Windows. Однак вона поки доступна лише для користувачів ChatGPT Plus і Team. Для корпоративних та освітніх клієнтів вона стане доступною протягом наступних тижнів, а для безплатних користувачів — наступних місяців. Цей крок ставить OpenAI в пряму конкуренцію з гігантами Google та Microsoft, а також з новими гравцями на ринку, такими як Perplexity, яку підтримують Джефф Безос та Nvidia.
Google готується представити Project Jarvis для автоматизації вебзавдань Google може вже у грудні презентувати свою версію концепції великої моделі дій під кодовою назвою “Project Jarvis”. Нова розробка здатна виконувати завдання на кшталт збору інформації, купівлі товарів чи бронювання квитків, використовуючи веббраузер. Про це стало відомо з розмов із трьома джерелами, які мають безпосереднє знання про проєкт, пише The Information. Згідно з інформацією, Jarvis працюватиме на основі майбутньої версії штучного інтелекту Google Gemini та використовуватиметься виключно з веббраузером Chrome. Інструмент призначений для того, щоб допомогти користувачам автоматизувати щоденні завдання в Інтернеті, виконуючи дії на вебсторінках — від інтерпретації знімків екрана до кліків і введення тексту. Наразі між діями Jarvis проходить кілька секунд. Не тільки Google активно розвиває інструменти автоматизації. Microsoft працює над проєктом Copilot Vision, який дозволить обговорювати вебсторінки, що переглядаються, а Apple Intelligence може незабаром виконувати дії в різних додатках. Anthropic вже презентував бета-версію Claude, яка може керувати комп’ютером, хоча інструмент ще далекий від досконалості. Також OpenAI активно розробляє аналогічний інструмент.