Basis скоротив час на податки вдвічі з GPT-6 Astra
Як Basis автоматизував 50-вкладковий податковий воркбук удвічі швидше — архітектура агента, динамічне мислення і ROI для фінансових команд.

Проблема 50 вкладок, яка переписала правила бухгалтерської автоматизації
Податковий воркбук на 50 вкладок. Завершений удвічі швидше. Не більшою командою і не швидшим бухгалтером — AI-агентом на GPT-6 Astra. Цей єдиний результат бенчмарку, опублікований OpenAI 28 вересня 2026 року, є найчіткішим сигналом того, що економіка підготовки податкової звітності переписується з нуля.
Але справжня цінність цього кейсу — не в заголовній цифрі. Вона в архітектурі за нею: у конкретних рішеннях Basis щодо зусиль мислення, ефективності токенів і дизайну оцінювання, і в тому, що ці рішення означають для будь-якої фінансової чи бухгалтерської команди, яка розглядає схожий крок. Деталі тут повчальніші за результат — і вони попереду.
Basis будує AI-агентів для автоматизації рутинної роботи бухгалтерів — звірки, заповнення воркбуків, пошук у первинних джерелах — щоб фахівці могли зосередитися на аналітиці й консультуванні. Компанію заснували Мітч Трояновський і Метт Харп у 2023 році, і з першого дня вона будується на моделях OpenAI. Коли з'явився GPT-6 Astra, Basis провів пряме порівняння з GPT-5.6 Sol на одному з найскладніших завдань у своєму конвеєрі: заповнення складного багатовкладкового податкового воркбука від початку до кінця.
Результат виявився однозначним. GPT-6 Astra завершив 50-вкладковий воркбук удвічі швидше, ніж GPT-5.6 Sol — і при цьому підвищив внутрішні оцінки Basis приблизно на 20%.
Що насправді побудував Basis: архітектура за результатом 2x
Виграш у швидкості не виник від простої заміни однієї моделі на іншу. Він став наслідком продуманої архітектури, яка використовує конкретні можливості GPT-6 Astra — ті, яких у попередніх моделей або не було, або вони справлялися з ними погано.
Кращі рішення на старті завдання
Одна з найважливіших відмінностей, яку помітив Basis, — це те, як GPT-6 Astra підходить до початку довгого завдання. За словами Трояновського, модель приймає кращі рішення з самого початку, що дозволяє агентам Basis іти прямішим шляхом через роботу і витрачати менше часу на виправлення помилок посередині. У 50-вкладковому воркбуку це критично: рання помилка у структурі підходу множиться на десятки наступних кроків.
GPT-6 Astra також частіше ставить точне уточнювальне запитання, коли відповідь може змінити результат — замість того, щоб зробити припущення і рухатися далі. У податковій сфері, де одне хибне припущення щодо структури юридичної особи або статусу подачі може пройти через весь звіт, така поведінка коштує більше, ніж чиста швидкість.
Модель, яка ставить правильне запитання на другому кроці, рятує вас від перебудови всього на сороковому.
Динамічне мислення: обчислення там, де вони потрібні
Другий архітектурний важіль Basis — динамічне регулювання зусиль мислення. Замість того, щоб запускати GPT-6 Astra на фіксованому рівні протягом усього завдання, Basis налаштовує агента так, щоб він посилював мислення на справді складних кроках — складна міжвкладкова звірка, неоднозначний пошук у первинному джерелі — і знижував його на простіших, механічних.
Ключово те, що GPT-6 Astra може робити ці переходи, зберігаючи кеш. Тобто модель не втрачає контекст при зміні режиму мислення — а це практична вимога для будь-якого тривалого агентного процесу. Трояновський зазначив, що такий підхід знижує і вартість, і час відповіді, роблячи тривалі завдання економічнішими для Basis і його клієнтів.
Саме це відрізняє продакшн-агентну систему від демо. У кількох оцінюваннях GPT-6 Astra досягав кращих результатів, використовуючи значно менше вихідних токенів, ніж попередні моделі — і давав нижчу розрахункову вартість на завдання, попри вищу ціну за токен. Динамічне налаштування мислення Basis підсилює цю ефективність ще більше.
Архітектура оцінювання: оцінюємо процес, а не лише відповідь
Basis оцінює не тільки те, чи агент видав правильний кінцевий результат, а й те, як він до нього дійшов — чи дотримувався встановлених шаблонів, чи звертався до первинних джерел для податкових питань, чи видавав результати, готові до перевірки людиною без суттєвого доопрацювання. Ця різниця важлива: одне й те саме фінальне число може бути результатом надійного процесу або крихкого — і лише перший заслуговує довіри в масштабі.
Саме це Трояновський має на увазі, коли описує продукт як продаж стабільності й надійності, а не просто точності. Бухгалтерські фірми, що розгортають агентів Basis, мають довіряти процесу щоразу — а не просто сподіватися, що відповідь виявиться правильною.
Для команд, які досліджують схожі архітектури, корисним орієнтиром буде RAG vs CAG: яку AI-архітектуру обрати — там розібрано, як дизайн пошуку та контексту впливає на надійність у тривалих завданнях.
Покроково: як відтворити цей підхід у своїй фінансовій команді
Кейс Basis цінний саме тому, що його архітектура переноситься. Не обов'язково бути AI-компанією, щоб застосувати ці принципи. Ось як фінансова або бухгалтерська команда може впровадити схожий підхід.
Крок 1 — Чітко визначте межі завдання
Перш ніж торкатися моделі, опишіть точний обсяг процесу, який хочете автоматизувати. Для Basis це був податковий воркбук партнерства 1065: конкретний тип документа, визначений набір вхідних даних (пробні баланси, K-1, первинні податкові джерела) і чіткий формат виходу. Розмиті визначення завдань породжують розмиту поведінку агента.
Запишіть: які вхідні дані, який результат, які критерії якості і що означає "готово"? Якщо ви не можете відповісти на всі чотири питання — агент теж не зможе.
Крок 2 — Обирайте модель під рівень складності
Не кожне завдання у фінансовому процесі потребує повних можливостей GPT-6 Astra. Використовуйте ієрархію моделей свідомо:
- GPT-6 Astra — для найскладнішої аналітичної роботи: міжвкладкові звірки, неоднозначні пошуки в первинних джерелах, завдання, де рання помилка множиться далі.
- GPT-6 Sol — для складних, але структурованіших завдань, де шлях мислення чіткіший.
- GPT-6 Luna — для великих обсягів повторюваних кроків, де ефективність важливіша за максимальний інтелект.
Маршрутизація завдань до правильної моделі — це сам по собі механізм контролю витрат. Архітектура Basis робить це динамічно в межах одного процесу; ви можете починати зі статичного розподілу між різними типами процесів. Детальніше про стратегію вибору між моделями — у матеріалі GPT-6 Sol і Luna: стратегія AI-моделей.
Крок 3 — Налаштуйте динамічне мислення
У межах одного тривалого завдання налаштуйте агента так, щоб він варіював зусилля мислення залежно від типу кроку. На практиці це означає:
- Визначте, які кроки у вашому процесі справді складні (потребують перехресного звернення до кількох джерел, містять неоднозначність або мають великий вплив на наступні кроки у разі помилки).
- Визначте, які кроки механічні (форматування, перенесення значень між вкладками, застосування відомої формули).
- Встановіть зусилля мислення на "високий" або "максимальний" для перших і на нижчий рівень для других.
GPT-6 Astra підтримує це без втрати кешу між кроками — технічна вимога, яка робить підхід придатним для процесів, що тривають хвилини або години, а не секунди.
Крок 4 — Побудуйте шар оцінювання процесу, а не лише перевірку результату
Цей крок більшість команд пропускає — і саме він визначає, чи можна довіряти автоматизації в масштабі. Побудуйте критерії оцінювання, які перевіряють процес агента:
- Чи звертався він до правильних первинних джерел?
- Чи дотримувався встановленої структури шаблону?
- Чи позначав неоднозначності, а не вирішував їх мовчки?
- Чи відформатований результат для ефективної перевірки людиною?
Автоматизовані судді — менші моделі або правилові перевірки — можуть впоратися з більшою частиною цього оцінювання без участі людини в кожному запуску. Basis використовує такий підхід для підтримки впевненості в реальних розгортаннях.
Крок 5 — Проведіть контрольований бенчмарк перед повним розгортанням
Перш ніж замінювати будь-який людський процес, запустіть агента на репрезентативній вибірці історичних завдань, де ви вже знаєте правильний результат. Виміряйте точність, дотримання процесу і час виконання. Порівняйте з поточним базовим рівнем.
Саме так Basis підійшов до порівняння 50-вкладкового воркбука: контрольований тест із визначеним завданням, двома моделями і чіткою метрикою. Результат дав їм впевненість для розгортання. І дав їм цифру, яку можна показати клієнтам — а це окрема цінність.
Крок 6 — Спроектуйте передачу роботи людині
Агентна автоматизація працює найкраще, коли роль людини зміщується від виконання роботи до її перевірки й затвердження. Спроектуйте вихід агента саме для цього кроку перевірки: чітка структура, позначені невизначеності, посилання на джерела для будь-яких суджень. Мета — зробити роботу рецензента швидшою і впевненішою, а не усунути рецензента.
Фреймворк ROI: що цифри насправді означають для вашого бізнесу
Результат 2x у швидкості — це заголовок. Але розрахунок ROI для фінансової команди має кілька складових, які варто розглядати окремо.
Економія часу і розширення потужності
Якщо податковий воркбук, який раніше займав у старшого бухгалтера вісім годин, тепер займає чотири — агент бере на себе механічні й дослідницькі кроки — це чотири години вивільненої старшої потужності на кожен воркбук. За напружений податковий сезон це накопичується швидко. Команда, яка раніше обробляла 50 складних декларацій за сезон, тепер може взяти значно більше без збільшення штату.
Точніше формулювання: автоматизація не скорочує вашу команду — вона розширює те, що ваша існуюча команда може взяти на себе. Це аргумент потужності, і він резонує з фінансовими керівниками, які управляють обмеженнями по персоналу.
Ефективність токенів і пряма вартість
Вища ціна за токен у GPT-6 Astra — реальна. Але досвід Basis — і власні дані оцінювання OpenAI — показують, що модель виконує завдання, використовуючи значно менше вихідних токенів, ніж попередні моделі: вона приймає кращі рішення раніше і рідше виправляє помилки посередині. Чиста вартість одного завершеного воркбука може бути нижчою, ніж із дешевшою моделлю, яка займає більше часу і робить більше помилок.
Динамічне мислення підсилює це ще більше: використовуючи менше обчислень на механічних кроках, Basis знижує токенну вартість простих частин процесу, не жертвуючи якістю на складних.
Для структурованого підходу до кількісної оцінки цих компромісів перед розгортанням — корисний матеріал AI ROI: як довести цінність бізнесу з практичною методологією.
Інвестиція в оцінювання
Побудова шару оцінювання процесу — суддів, перевірок шаблонів, верифікації посилань на джерела — потребує часу на інженерію на старті. Basis будує цю інфраструктуру з 2023 року. Для команди, яка починає з нуля, закладайте на це бюджет явно. Це не опція, якщо ви хочете розгортань, яким можна довіряти.
Шар оцінювання — це те, що відрізняє інструмент для демо від системи, на яку ви ставите свою репутацію.
Термін окупності залежить від обсягу процесів. Для фірми, яка обробляє сотні складних декларацій на рік, інвестиція в інфраструктуру оцінювання окупається за один податковий сезон. При менших обсягах спочатку може вистачити легшого підходу — ручних вибіркових перевірок частини виходів агента.
Що це означає для керівників фінансів і бухгалтерії
Basis — це компанія, яка вже зараз розгортає автономних агентів для багатоденних податкових і звіркових процесів у реальних бухгалтерських фірмах. Результат із 50-вкладковим воркбуком — не дослідницьке демо, а виробничий бенчмарк системи, яку фірми вже використовують.
Патерн, який встановив Basis — агенти виконують роботу, люди приймають рішення — це архітектура, яка масштабується. Вона не вимагає заміни вашої команди. Вона вимагає переосмислення того, що ваша команда робить: від виконання процесів до їх нагляду, перевірки й консультування.
Для керівників бухгалтерії та фінансів практичне питання вже не в тому, чи це можливо. Кейс Basis відповідає на нього. Питання в тому, наскільки швидко ваша фірма може побудувати інфраструктуру оцінювання, визначення завдань і процеси перевірки людиною, які зроблять агентну автоматизацію надійною у вашому конкретному контексті.
Ті, хто рухається першими, не просто скоротять витрати — вони розширять потужність, візьмуть складнішу роботу і побудують структурну перевагу, яка зростає з кожним покращенням моделі. Саме такі рішення змінюють те, як рада директорів читає ваш квартальний звіт: не як центр витрат, що управляє штатом, а як операцію, яка масштабується розумно.
І на більш особистому рівні: є особливий спокій у тому, щоб знати, що ваші найкритичніші, найвідповідальніші процеси працюють надійно — не тому, що ви постійно за ними стежите, а тому, що система спроектована виявляти власні помилки і виносити їх на вашу перевірку. Саме це продає Basis. Саме це робить можливим GPT-6 Astra.
Для команд, які досліджують, як GPT-6 Astra впроваджується в інших відповідальних сферах, огляд GPT-6 Astra: хто впроваджує першим і чому показує спільні патерни між галузями.
FAQ
Що саме тестував Basis із GPT-6 Astra? Basis порівняв GPT-6 Astra і GPT-5.6 Sol на складному податковому воркбуку з 50 вкладками, вимірюючи час виконання і точність. GPT-6 Astra завершив воркбук удвічі швидше, а внутрішні оцінки Basis покращилися приблизно на 20%.
Чому GPT-6 Astra використовує менше токенів, якщо він потужніший? Тому що приймає кращі рішення на початку завдання, йде прямішим шляхом через роботу і рідше виправляє помилки посередині. Менше помилок — менше кроків відновлення — менше токенів загалом, навіть попри вищу ціну за токен порівняно з попередніми моделями.
Що таке динамічне мислення і чому воно важливе для вартості? Динамічне мислення означає, що модель застосовує більше обчислень до складних кроків і менше — до простих у межах одного завдання. Basis використовує це, щоб знизити вартість і час відповіді в тривалих процесах, не жертвуючи якістю там, де вона потрібна. GPT-6 Astra підтримує це, зберігаючи кеш — що критично для багатокрокових агентних завдань.
Чи потрібно будувати повну систему оцінювання перед розгортанням AI-агентів у фінансах? Не обов'язково в повному масштабі з першого дня. Починайте з ручних вибіркових перевірок частини виходів агента на відомих правильних історичних результатах. Коли обсяг зростає і ви набираєте впевненості в поведінці агента — інвестуйте в автоматизоване оцінювання: судді, перевірки шаблонів, верифікація посилань. Шар оцінювання — це те, що робить систему надійною в масштабі.
Чи підходить цей підхід лише для великих бухгалтерських фірм? Ні. Архітектура — точне визначення завдань, вибір моделі за складністю, динамічне мислення, оцінювання процесу, передача людині — масштабується і для менших команд. Головна змінна — початкова інвестиція в інфраструктуру оцінювання; менші команди можуть починати легше і нарощувати з часом.
Як Basis обробляє випадки, коли агент невпевнений? GPT-6 Astra спроектований ставити точні уточнювальні запитання, коли відповідь може змінити результат, — замість того, щоб робити мовчазні припущення. Шар оцінювання Basis також позначає неоднозначності у виходах агента для перевірки людиною, тож невизначеність виходить назовні явно, а не ховається у фінальній відповіді.
Фірми, які ставляться до цього як до технологічного експерименту, отримають результати розміром з експеримент. Ті, хто ставиться до цього як до операційного переосмислення — переглядає, що роблять їхні люди, будує інфраструктуру для надійних агентів і вимірює правильні речі — отримають той самий результат 2x, що й Basis. Архітектура існує. Бенчмарк опублікований. Єдине питання, що залишилося, — хто будує першим.
Є питання? Запитайте AI-агента прямо зараз
Відповідає за секунди, знає все про наші послуги та допоможе розібратися у вашій ситуації
Читайте також
Розробка AI-агента на замовлення: за що ви платите
Скільки коштує AI-агент на замовлення у 2026 році, що входить у ціну і як порахувати реальний ROI — розбір по рівнях і фазах.
Ціни та ROIDeepSeek-V4: мільйон токенів за копійки
DeepSeek-V4-Pro обробляє мільйон токенів за $0.66 — у рази дешевше за Anthropic і OpenAI. Розбираємо ціни, архітектуру і що це змінює для бізнесу.
Ціни та ROIAI ROI: як довести цінність бізнесу
Seat counts і токени не переконають CFO. Ось покроковий фреймворк вимірювання AI-ROI через реальні бізнес-результати — з формулами та прикладами.
