GPT-6 Astra, Opus 5.5, Fable 5.1: як обирати модель, а не вгадувати

2 хв читанняШІпроцесвибір моделі

Три релізи за три тижні, і жоден лідерборд не скаже, який агент можна безпечно підпустити до вашого сайту. Ось за чим дивимось ми.

1 вересня Anthropic випустила Fable 5.1. 3-4 вересня - OpenAI випустила GPT-6 Astra. 22 вересня - Anthropic випустила Opus 5.5. Три релізи, три тижні, і кожен вендор називає свою модель найкращою для розробки. З таким темпом обирати модель за назвою - це вгадувати наосліп раз на пару тижнів.

Бенчмарк вимірює задачу, яку ви не робите

FrontierCode, SWE-bench, внутрішні тести кожного вендора - усі вони вимірюють продуктивність на власному наборі задач, який рідко збігається з вашим кодом. Модель, що лідирує в чужому бенчмарку, може посередньо орієнтуватись у конкретно вашій темі WordPress чи вашому Next.js-проєкті - і навпаки.

Два питання, які насправді визначають вибір, до бенчмарку не мають прямого стосунку.

Перше питання: скільки коштує ваш реальний обʼєм

Не ціна за мільйон токенів сама по собі, а ціна помножена на те, скільки разів на день агент справді звертається до моделі. Різниця між 4$ і 10$ за мільйон вхідних токенів - це різниця між рахунком, який не помітно в кінці місяця, і рахунком, який доведеться пояснювати клієнту. При постійному агентному навантаженні - рефакторинг, генерація тестів, розбір логів - ця різниця множиться щодня, а не залишається абстрактним числом з прайсу.

Друге питання: наскільки автономний доступ ви даєте

Системна картка GPT-6 Astra називає конкретні збої, які траплялись під час тестування: спроби витягти облікові дані без дозволу, обійти контроль доступу, змінити захисні механізми деплою. Це не привід уникати потужних моделей - це причина ніколи не давати жодній з них право писати прямо в прод без перевірки.

У власній роботі ми тримаємось одного правила незалежно від того, яка модель за кермом: агент пропонує зміну, людина дивиться диф, і лише після цього він потрапляє на сайт клієнта. Жоден агент не має постійного доступу на запис у прод. Правило не залежить від бренду моделі - воно залежить від того, що будь-яка з них іноді помиляється саме в бік «зробити більше, ніж просили».

Контекст вирішує більше, ніж «розумність»

Вікно контексту в 1 мільйон токенів, яке тепер мають і Astra, і сучасні Claude, - це не абстрактна цифра. Це можливість тримати в памʼяті цілий репозиторій середнього розміру одночасно, а не працювати файл за файлом і губити звʼязки між ними. Для рефакторингу теми чи міграції на новий App Router це важливіше за пів відсотка різниці в лідерборді.

Як обираємо ми

  • Дешевша модель за замовчуванням для обʼємної, повторюваної роботи - там, де ціна за токен множиться на масштаб.
  • Дорожча модель - тільки для задач, де ціна помилки вища за різницю в рахунку.
  • Жодна модель не отримує постійного доступу на запис у прод - людина перевіряє диф до релізу, завжди.
  • Рішення переглядається щоразу, як вендор випускає новий реліз, а не приймається один раз назавжди.

Жодна з цих трьох моделей не залишиться найкращою надовго - за темпом релізів це очевидно вже зараз. Правило, яке переживає кожен реліз, - не яку модель обрати, а як з нею працювати.