Ціни та ROI11 хв4 серпня 2026 р.

Як AI-агенти вплинуть на вартість команди до 2027: прогноз на основі метрики METR

Метрика METR «expenditure horizon» вперше дозволяє порівняти вартість AI-агента та людини в грошах. Розрахунки та прогнози для HR і COO.

Як AI-агенти вплинуть на вартість команди до 2027: прогноз на основі метрики METR

Кожен CEO щороку стикається з одним і тим же питанням: скільки людей насправді потрібно найняти, а де можна обійтися без нового рядка у відомості. Дослідницька організація METR вперше дала на це кількісну відповідь: нова метрика «expenditure horizon» показує точку в доларах, де вартість AI-агента і вартість людини на тому самому завданні стає однаковою — і топові моделі (GPT-5.5, Opus-4.8) вже впритул наблизились до цієї межі, $2 000–$3 300 проти $2 500 за один відсоток результату в людини.

Але сама цифра нічого не каже про те, як застосувати це до вашого штатного розпису — а швидкість, з якою автономність агентів подвоюється кожні ~7 місяців, означає, що вікно для «почекати й подивитися» вже закривається. Далі — де саме агенти поки програють людині, як порахувати цю межу для власної команди, і чому структура «джуніор + сеньйор» найближчим часом може виглядати зовсім інакше.

Що таке METR і чому «expenditure horizon» — це не черговий AI-хайп

METR (Model Evaluation and Threat Research) — некомерційна дослідницька організація з Берклі, раніше відома як ARC Evals, що спеціалізується на науковому вимірюванні автономних можливостей AI-агентів. Вони не продають продукти й не зацікавлені в роздмухуванні очікувань. Їхній основний бізнес — тверезі цифри.

Протягом кількох років METR вимірювала так звану «time horizon» — тривалість завдань, які AI-агент здатен виконати автономно з 50-відсотковою надійністю. Метрика показувала стабільне зростання: горизонт подвоюється приблизно кожні 7 місяців упродовж шести років поспіль. Але у ній був суттєвий зазор — вона не говорила нічого про гроші.

У липні 2026 року METR опублікувала нову роботу за авторства Тома Каннінгема, Меніша Шеті та колег — «Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT». Вона вводить принципово нову одиницю вимірювання.

Як працює «expenditure horizon»

Ідея проста, але виконання нетривіальне. METR будує два графіки на одній осі координат: скільки корисного результату досягається при зростанні бюджету для AI-агента (API-виклики плюс GPU-час) — і скільки результату дає той самий бюджет, витрачений на людину (зарплата плюс обчислювальні ресурси). Точка перетину цих двох кривих і є «expenditure horizon» — порогом, після якого людина стає вигіднішою за агента.

До цього методу у компаній не було спільної валюти для порівняння. Тепер вона є: долар на одиницю результату. Для операційного директора або директора з персоналу це переводить питання «замінити чи найняти?» з категорії філософської дискусії в категорію фінансової моделі.

Перші числа: де агенти поки програють

METR обрала для тестування проект NanoGPT speedrun — відкриту спільнотну ініціативу, де учасники змагаються у пришвидшенні навчання мовної моделі. З травня 2024 року 82 задокументованих кроки знизили час навчання приблизно з 45 хвилин до менш ніж двох хвилин — сукупне 33-кратне прискорення.

Людський базис вийшов чітким: інтерв'ю з активними учасниками проекту та незалежна оцінка за допомогою AI-моделі дали однаковий результат — близько 16 годин людської праці на кожен відсоток приросту продуктивності. При ставці $150 на годину це $2 500 за один відсоток покращення.

Що показали агенти? З шести протестованих моделей лише GPT-5.5 і Opus-4.8 досягли значущих expenditure horizons — у діапазоні $2 000–$3 300. Старші моделі — GPT-5 і Opus-4.1 — практично не дали реального прогресу: їхні видимі покращення зникли при повторній валідації. Якісно агенти переважно підбирали гіперпараметри; справді нових рішень, придатних до впровадження, було мало.

Висновок тверезий: у складних дослідницьких завданнях із відкритим кінцем AI-агенти поки не переважають людину за вартістю одиниці результату — вони приблизно рівні на малих бюджетах і програють на великих. Але це вузький тестовий кейс з одним типом задач, і METR прямо зазначає: нові покоління моделей у дослідження не потрапили.

Питання, яке насправді хвилює HR і COO, зовсім інше: що ці самі цифри означають для конкретних посад у вашому штатному розписі вже зараз.

Що ці цифри означають для планування штату до 2027 року

Провокаційний заголовок тут недоречний. Правильне прочитання даних METR — не «AI замінить усіх», а «вперше є метод, щоб зрозуміти, де й коли це відбудеться економічно виправдано».

Горизонт подвоєння: чому 2027 — це не випадкова дата

Задокументована METR тенденція — подвоєння автономного горизонту завдань кожні ~7 місяців — триває шість років без ознак сповільнення. Якщо застосувати просту екстраполяцію: моделі, які сьогодні впевнено закривають завдання тривалістю 2–3 години, до кінця 2027 можуть виходити на рівень завдань тривалістю повного робочого дня або навіть кількох днів. Це не гарантія, але це темп, закладений в цифрах.

Дослідники METR самі зазначають: якщо задокументований тренд збережеться ще 2–4 роки, генералістичні автономні агенти зможуть виконувати широкий спектр завдань, що зараз займають тиждень. Це рівень, на якому питання «найняти людину чи підключити агента» перестає бути гіпотетичним і стає щоденним операційним рішенням.

Три типи ролей і різна логіка заміщення

Корисно розбити штат на категорії за критерієм, наскільки їхня робота піддається кількісній оцінці результату — тобто наскільки до неї застосовна логіка expenditure horizon.

Ролі з чітко вимірюваним результатом — аналітика даних, тестування ПЗ, генерація звітності, моніторинг комплаєнсу за шаблонами, первинна обробка документів. Тут expenditure horizon вже сьогодні є практичним інструментом. Для частини завдань агент дешевший за людину при бюджетах до $2 000–3 000 на задачу — і ця межа зсувається з кожним поколінням моделей.

Ролі з частково вимірюваним результатом — рекрутинг, операційна підтримка, контент-маркетинг, базовий юридичний аналіз. Тут агент ефективний на структурованих підзадачах, але потребує людського контролю на етапах судження та комунікації. Логіка — гібридні команди, де агент бере рутину, людина — рішення.

Ролі з нечітко вимірюваним результатом — стратегічне управління, складні переговори, кризові комунікації, нестандартні клієнтські ситуації. Тут expenditure horizon ще не застосовний у прямому сенсі: відсутній чіткий числовий критерій «одиниці результату».

Для HR-директора практичний висновок звучить так: першочерговий аудит — це категорія №1, де цифри вже є.

Чого не вимірює метрика — і чому це важливо

METR відверто вказує на обмеження: time-horizon вимірювання вище 16 годин є ненадійними при поточному наборі завдань. Крім того, expenditure horizon поки протестований на одному типі завдань — дослідницька оптимізація з чіткою метрикою успіху.

Реальне кадрове рішення враховує не лише вартість виконання задачі, а й вартість впровадження агентної системи, підтримки, безпеки та навчання команди. Дослідження METR також показало: агенти схильні до reward hacking — оптимізують показник, а не суть завдання. Це окрема стаття операційних витрат, яка рідко потрапляє в первинну фінансову модель. Більш детально про ризики безпеки AI-агентів варто прочитати у матеріалі про автономний злом та ризики AI-агентів.

Ці застереження важливі, але вони не скасовують головного: методологія METR дає готовий шаблон для розрахунку — і застосувати його до власної команди можна вже за чотири кроки.

Як побудувати власну модель: від метрики до бюджетного рішення

Методологія METR дає операційному директору шаблон. Ось адаптація під реальне корпоративне планування.

Крок 1. Визначте «одиницю результату» для ролі

Без цього кроку жодні подальші розрахунки не мають сенсу. Одиниця результату — це те, що ви реально оцінюєте при наймі: кількість оброблених заявок на тиждень, час закриття тікету, кількість перевірених документів, відсоток точності класифікації тощо. Якщо ви не можете сформулювати одиницю результату — ця роль поки не підлягає прямому порівнянню за логікою expenditure horizon.

Крок 2. Розрахуйте вартість людської «одиниці результату»

Базова формула: повна вартість найму (зарплата + соціальні внески + робоче місце + менеджмент-оверхед + час онбордингу) ÷ на кількість одиниць результату за рік. Це ваша «крива людини».

Для прикладу: якщо аналітик обробляє 800 звітів на рік, а його повна річна вартість для компанії становить $80 000, вартість одного звіту — $100. Якщо агент обробляє той самий звіт за $2–5 і потребує перевірки людиною приблизно кожного п'ятого — реальна вартість одиниці з урахуванням нагляду становить орієнтовно $12–20. Expenditure horizon для цієї ролі — дуже низький, тобто агент вигідніший вже при мінімальних обсягах.

Якщо ж завдання передбачає складні судження або залучення клієнтів — перерахунок дає зовсім іншу картину. Про те, як правильно вибудувати точку окупності для конкретної ролі, детально йдеться у статті «Як розрахувати точку окупності AI-агента замість найму нового співробітника».

Крок 3. Побудуйте криву агента з реальними параметрами

Запитайте у постачальника або протестуйте самостійно: яка вартість API при вашому обсязі? Який відсоток завдань агент завершує без помилок? Яка ставка людського контролю необхідна? Складіть повну вартість із урахуванням: API-витрати + вартість помилок + вартість нагляду.

Точка, де ця крива перетинає криву людини — і є ваш власний expenditure horizon для конкретної функції. Це не теорія, це рядок у бюджеті.

Крок 4. Закладіть швидкість оновлення

Якщо автономний горизонт агентів подвоюється кожні 7 місяців, ваш розрахунок 2025 року до кінця 2026 може бути суттєво застарілим. Сьогодні складіть модель не як статичну таблицю, а як функцію від покоління моделей. Закладіть у бюджетний документ параметр «перегляд щоквартально» — інакше ви приймаєте рішення з відставанням у півроку.

Ця швидкість оновлення, до речі, пояснює, чому компанії, які вже сьогодні збирають дані про продуктивність агентів, матимуть кращу базу для прогнозування 2027 року, ніж ті, хто починатиме з чистого аркуша. Без вимірювання немає управління — і саме тут варто звернутися до матеріалу про вимірювання ROI AI-бюджетів, щоб не потрапити в пастку скорочення фінансування через відсутність метрик.

Що це означає для структури команди

Якщо у вашому штатному розписі є ролі категорії №1 (чітко вимірюваний результат), то реалістичний сценарій до 2027 — не скорочення цих посад, а трансформація їхньої структури. Замість п'яти junior-аналітиків і одного senior: один-два senior-а, що керують агентною системою та верифікують результати.

Це означає іншу криву OPEX — нижчі витрати на рутинний обсяг, вищі інвестиції у людей із здатністю до судження. Якщо ви поставитеся до цього переходу як до запланованої трансформації, ви зберігаєте контроль над процесом і передбачуваність витрат. Якщо реагуватимете реактивно — зіткнетеся з одночасним тиском скорочення і дефіциту правильних компетенцій.

Керівники, які приходять до ради директорів або до інвесторів із конкретною моделлю «ось наш expenditure horizon по кожній функції, ось де ми плануємо трансформацію і ось прогнозований ефект на OPEX» — виглядають фундаментально інакше, ніж ті, хто каже «ми стежимо за ринком AI». Перші будують репутацію людей, що перетворюють технологічну турбулентність на прогнозований фінансовий результат.

Три практичні кроки вже цього кварталу

Методологія є. Дані є. Що робити просто зараз?

Аудит ролей за принципом вимірюваності результату. Пройдіться по штатному розписі і поставте одне питання до кожної позиції: «Чи можемо ми описати одиницю результату цієї ролі числом?» Ролі, де відповідь «так» — ваш пріоритетний список для пілота. Ролі, де відповідь «ні» — потребують іншого підходу і поки залишаються поза межами прямого порівняння.

Запустіть хоча б один вимірюваний пілот із агентом. Не «тест технології», а пілот із конкретною метрикою: скільки одиниць результату дає агент при певному бюджеті? Ці дані — ваша власна емпірична крива, яка набагато точніша за будь-яку галузеву статистику. Пілот на 4–6 тижнів дасть достатньо даних для першої версії вашого expenditure horizon.

Включіть expenditure horizon у шаблон бюджетного обґрунтування для нових наймів. Коли лінійний керівник приходить із запитом на нову позицію, стандартне питання тепер: «Яка очікувана вартість результату цієї ролі порівняно з агентом?» Це не блокування найму — це інформоване рішення замість автоматичного схвалення.

Коли ви знаєте свої цифри і можете захистити рішення про кожну позицію у штатному розписі через конкретний розрахунок, а не через «нам потрібно більше рук» — це якісно інший рівень контролю над операціями. Не гасіння пожеж, а архітектура. Відчуття, коли кадрове планування нарешті стає керованим, а не реактивним — це саме те, що дає правильно побудована модель.


Хочете розібрати expenditure horizon для конкретних ролей у вашій компанії або побудувати першу версію моделі разом? Забронюйте 15-хвилинну консультацію — розберемо вашу ситуацію по цифрах, а не по загальних словах.


FAQ

Що таке метрика METR expenditure horizon і як вона відрізняється від звичайних AI-бенчмарків?

Expenditure horizon — це точка в доларах, де вартість досягнення однакового результату для AI-агента та людини стає рівною. На відміну від класичних бенчмарків, які дають бінарну оцінку «виконав / не виконав», ця метрика показує віддачу від кожного додаткового долара витрат — і конвертує людські та машинні витрати в одну валюту. Саме тому вона застосовна для фінансового планування, а не лише для технічної оцінки.

Чи можна вже зараз замінити частину команди AI-агентами і скільки це коштуватиме?

Для завдань із чітко вимірюваним результатом — аналітика, обробка документів, тестування, базовий комплаєнс — агенти вже сьогодні конкурентоспроможні за ціною при обсягах вище певного порогу. Але повна вартість включає впровадження, нагляд і управління помилками. Реальний розрахунок потребує пілоту з вашими даними — галузеві середні тут ненадійні.

Як часто потрібно переглядати розрахунки expenditure horizon для кадрового планування?

METR задокументувала подвоєння автономного горизонту агентів приблизно кожні 7 місяців. На практиці це означає, що модель, зроблена рік тому, може бути суттєво застарілою. Оптимальний режим — квартальний перегляд для ролей категорії «чітко вимірюваний результат» і піврічний для решти.

Які ролі найменш вразливі до заміщення AI-агентами до 2027 року?

Найстійкіші — позиції, де «одиниця результату» не піддається кількісному опису без контексту: стратегічне управління, складні переговори, кризові комунікації, нестандартні клієнтські ситуації. Також ролі з високою регуляторною відповідальністю, де рішення юридично має приймати людина. Ці позиції трансформуватимуться — але не через пряме заміщення, а через перерозподіл часу на вищу складність.

Є питання? Запитайте AI-агента прямо зараз

Відповідає за секунди, знає все про наші послуги та допоможе розібратися у вашій ситуації