Opus 5.5 проти GPT-6 Astra: що перевірено, а що ні
3 хв читанняШІClaudeGPT-6 Astra
Пошук видає десяток однакових статей «порівняння» з цифрами, які суперечать самі собі. Розбираємось, які числа взагалі мають джерело.
Перш ніж писати це порівняння, ми його прогуглили - як зробив би будь-хто. Перша сторінка видачі: девʼять статей із майже однаковими заголовками «Opus 5.5 vs GPT-6 Astra: Benchmarks, Pricing», з сайтів на кшталт kingy.ai, myclaw.ai, alphacorp.ai, orcarouter.ai. Дві з них розходяться в оцінці контекстного вікна Astra настільки, що одна називає його «більшим», а інша - фактично меншим за Opus. Це не другорядна розбіжність у порівнянні, де все інше побудоване саме на цифрах.
Тому нижче - тільки те, що простежується до anthropic.com, до системної картки OpenAI або до опублікованого прайсу. Де такого джерела немає, ми так прямо і пишемо.
Три цифри від Anthropic - і одна з них майже нічия не перевага
У власному анонсі Opus 5.5 Anthropic наводить три прямі порівняння з GPT-6 Astra на своїх бенчмарках: Terminal-Bench 4.0 - 66.4% проти 57.9%, FrontierCode - 54.4% проти 53.3%, GDPval-AA v2.1 - 1846 проти 1542 Ело. Це цифри компанії про власний продукт на бенчмарках, які вона сама обрала показати - варто памʼятати це, читаючи їх.
Розрив на Terminal-Bench і GDPval помітний. На FrontierCode - лише 1.1 відсоткового пункту, практично нічия. Якщо стаття обіцяє переконливу перемогу за всіма показниками одразу - вона вже спрощує те, що каже сама Anthropic.
Речення, яке варто прочитати уважно
«За замовчуванням (medium effort) Opus 5.5 обходить GPT-6 Astra на максимальному рівні зусиль (max effort) приблизно за п'яту частину вартості на задачу» - Anthropic
Тут неочевидна деталь: порівнюється не однаковий рівень зусиль моделей, а дешевший режим Opus проти найдорожчого режиму Astra. Чесно щодо реальної експлуатації - саме так модель і використовують за замовчуванням - але нечесно щодо «хто розумніший на максимумі», яке питання ставить заголовок кожної спам-статті.
Ціна й контекст - тут дані незалежні
На відміну від бенчмарків, ціну не потрібно вірити на слово - вона в прайсі обох вендорів. Opus 5.5: 4$ / 20$ за мільйон токенів. GPT-6 Astra: 10$ / 50$. Обидві моделі мають вікно контексту в 1 мільйон токенів - це підтверджено з обох сторін і жодного разу не розходиться, на відміну від того, що писали два перевірені нами сайти-порівняння.
Чому решта порівнянь в інтернеті не варто читати як факт
Один агрегатор, який ми перевірили окремо, показує показники Astra на кшталт ExploitBench 100.0% і ARC-AGI-3 99.9% - без жодного посилання на джерело чи опису методології. Такі рівні кругленькі цифри на нову модель за перший тиждень після релізу - типова ознака тексту, згенерованого під запит «X vs Y», а не результату реального прогону бенчмарку.
Це не привід не читати такі статті взагалі - а привід перевіряти, чи взагалі названо, звідки взято число, перш ніж вставляти його в рішення про те, яку модель підключати до робочого коду.
Підсумок
На трьох бенчмарках, які показала сама Anthropic, Opus 5.5 попереду - десь помітно, десь у межах похибки. Ціна й контекст перевірені незалежно й підтверджують: Opus 5.5 коштує вдвічі з половиною менше за майже те саме вікно контексту. Незалежного, прозорого щодо методології порівняння двох моделей поки що не існує - і будь-яка стаття, яка стверджує інше з точністю до десятої відсотка, найімовірніше, вигадує цю точність, а не міряє її.
