Для задач с понятными тестами и ограниченным бюджетом разумно сначала попробовать GPT-6 Sol. Для длинной работы агента, где ошибка приводит к дорогой переделке, стоит включить Claude Opus 5.5 в короткое сравнение на собственных заданиях. Это отправная точка, а не установленный победитель: по стандартным тарифам прямых API при небольшом контексте Opus стоит вдвое дороже за одинаковое число новых входных и выходных токенов, но реальная цена готовой работы зависит также от повторных попыток и проверки. Цены сверены 23 сентября 2026 года по документации Anthropic и странице GPT-6 Sol. Собственного платного теста этих двух моделей на рабочих задачах мы не проводили.
С чего начать выбор
| Ваша ситуация | Первый шаг | Что может изменить решение |
|---|---|---|
| Много однотипных задач, есть автоматические тесты или чёткие критерии приёмки | Запустите пилот на gpt-6-sol с обычными для вас настройками. | Если исправления и повторы съедают экономию, сопоставьте с claude-opus-5-5 на тех же задачах. |
| Долгая работа по нескольким файлам или документам, результат трудно проверить автоматически | Испытайте обе модели и заранее выделите время на человеческую проверку. | Opus оправдает более высокую ставку лишь тогда, когда заметно сократит переделки или даст больше принятых результатов. |
| В запросе больше 272 тыс. входных токенов | Пересчитайте стоимость Sol по тарифу для длинного контекста. | Для всего запроса Sol изменятся ставки входа, кэша и выхода; простое правило «Opus вдвое дороже» здесь уже неверно. |
Anthropic представляет Opus 5.5 как модель для длительной агентской разработки и работы со знаниями; OpenAI позиционирует Sol для сложного программирования и агентских процессов. Это описание назначения от производителей, а не подтверждение качества на вашем репозитории или ваших документах. Спецификации и назначение: Anthropic, OpenAI.
Сколько стоит одинаковый объём токенов
Ниже — ставки прямых API, Standard, доллары США за 1 млн токенов, проверенные 23 сентября 2026 года. Цены подписок Claude, ChatGPT и Codex устроены иначе: по этой таблице нельзя вычислить, сколько запросов даст конкретный тарифный план.
| Статья расходов | Claude Opus 5.5 | GPT-6 Sol, вход до 272 тыс. | GPT-6 Sol, вход свыше 272 тыс. |
|---|---|---|---|
| Новый вход | $4 | $2 | $4 |
| Чтение кэша | $0,20 | $0,20 | $0,40 |
| Запись кэша | $5 за пятиминутный кэш | $2,50 | $5 |
| Выход | $20 | $10 | $15 |
Источники ставок: страница релиза Anthropic и официальный прайс OpenAI. У Sol порог считается по входным токенам запроса: при превышении 272 тыс. более высокие ставки применяются ко всему запросу, а не только к токенам сверх порога. Условия записи кэша у поставщиков различаются, поэтому одинаковая цена чтения кэша в коротком контексте не означает одинаковый счёт за кэширование. У Sol Batch и Flex стоят половину Standard, Fast — вдвое больше; региональная обработка, если доступна, добавляет 10%, а вызовы отдельных инструментов могут оплачиваться дополнительно. У Opus есть отдельный более дорогой fast mode. Для другой схемы обработки сначала проверьте её тариф, затем считайте.

Например, один гипотетический запрос с 100 тыс. новых входных и 20 тыс. выходных токенов, без кэша и дополнительных платежей, стоил бы $0,40 у Sol (0,1 × $2 + 0,02 × $10) и $0,80 у Opus (0,1 × $4 + 0,02 × $20). Это расчёт при одинаковом числе оплаченных токенов, а не прогноз цены одинаково хорошо решённой задачи. Модели могут сделать разное число шагов и выдать разный объём ответа.
При 300 тыс. новых входных и 20 тыс. выходных токенов тот же способ даёт $1,50 для Sol (0,3 × $4 + 0,02 × $15) и $1,60 для Opus (0,3 × $4 + 0,02 × $20). Здесь длинный контекст существенно уменьшает разницу в цене одного запроса. Если агент регулярно повторно читает историю, в расчёт дополнительно входят попадания в кэш, записи, неудачные запуски и вызовы инструментов. Контекстное окно Opus составляет 1 млн токенов, у Sol — 1 050 000; максимальный выход у обоих — 128 тыс. токенов по Anthropic и OpenAI. Размер окна не гарантирует одинаковую точность работы со всеми его частями.
Что говорят измерения — и чего они не говорят
В Intelligence Index v4.3.2 Artificial Analysis для Opus настройка max с fallback по умолчанию получила 58 баллов при $5,98 за задание индекса. GPT-6 Sol при max получил 48 баллов при $1,06 за такое задание. При medium значения составляют соответственно 51/$1,34 и 40/$0,25. Индекс объединяет десять оценок; балл 58 не означает 58% успешных рабочих задач, а долларовая сумма относится к заданию этого набора, не к среднему счёту пользователя. У Opus в этих результатах включён fallback, и настройки усилия влияют на стоимость. На задаче, которая похожа на конкретный компонент индекса, это полезный ориентир для пилота; переносить цифры на любую разработку или офисную работу нельзя.
Есть ещё распространённая ловушка в сравнительных таблицах. Таблица запуска Anthropic показывает результаты Opus 5.5 рядом с GPT-5.6 Sol и GPT-6 Astra. Столбца GPT-6 Sol там нет. Например, показатель Opus 66,4% на Terminal-Bench 4.0 нельзя выдавать за прямую победу над GPT-6 Sol: в этой строке сравнивается другая версия Sol, а условия оценки также различаются. Для пары из заголовка используйте измерение, где названы обе нужные модели, и сохраняйте его ограничения.
Разница между независимым рейтингом и вашим результатом особенно важна в агентском кодинге. Модель может успешно пройти тесты, но затронуть лишние файлы; может сделать полезное исправление, которое команда не примет из-за объёма ручной проверки. В работе с документами связный текст тоже не равен верным выводам из источников. Поэтому следующий вопрос — не «чей балл выше», а «какую работу мы готовы принять и сколько стоило её получить».
Как проверить модели на своей работе

Возьмите небольшой, но характерный набор заданий: например, исправление с тестом, изменение в нескольких модулях и разбор противоречащих друг другу документов. До запуска запишите для каждого задания, что считается принятым результатом. Для кода это могут быть проходящие тесты, отсутствие побочных изменений и понятный diff; для аналитического текста — прослеживаемость выводов до предоставленных документов и отсутствие выдуманных ссылок. Не заменяйте проверку одним впечатлением от красивого ответа.
Запускайте обе модели с одним и тем же исходным состоянием задачи, доступом к сопоставимым инструментам и одинаковым пределом времени или числа попыток. Сохраните точные ID моделей, уровень усилия, настройки кэша, размер входа и условия вызовов. У gpt-6-sol уровни рассуждения идут от none до max, по умолчанию medium; для встроенных инструментов и вызовов функций OpenAI указывает Responses API. У Opus 5.5 адаптивное рассуждение включено, усилие по умолчанию medium. Пара настроек max отвечает на вопрос о верхнем режиме, а стандартные medium — о типичном старте; смешивать их в одной паре без пометки нельзя. См. описание Sol и обзор моделей Claude.
После каждого задания записывайте не только первый ответ. Нужны число повторов, оплаченные входные и выходные токены по категориям, расходы на инструменты, время до пригодного результата и минуты человеческой проверки. Отмечайте и задания, которые не удалось принять в установленный лимит. Стоимость принятой задачи можно посчитать как сумму всех расходов на пилот, включая неудачные попытки, делённую на число принятых заданий; труд проверяющего полезно показывать отдельной строкой или переводить в деньги по своей внутренней ставке. Сравнивайте эту величину вместе с долей принятых задач и задержкой, а не вместо них.
Если Sol проходит ваши проверки с приемлемыми затратами, более низкая ставка Standard делает его практичным первым выбором. Если Opus чаще доводит сложные задания до приёмки и сокращает дорогую ручную переделку настолько, что перекрывает дополнительные расходы, выбирайте Opus для этого класса работ. Если разница по небольшому пилоту неясна, расширьте набор характерных задач и сохраните обе модели как варианты; чужой индекс не разрешит неопределённость за вас.
Короткие ответы на частые сомнения
У Claude Opus 5.5 результат выше — значит, он лучше для программирования?
Нет общего вывода для любого репозитория. В индексе Artificial Analysis у Opus 5.5 при max и fallback балл выше, чем у Sol при max, но индекс объединяет разные типы заданий. Сравните обе модели на одинаковых изменениях кода и проверьте принятые diff, тесты и стоимость повторов.
Одинакова ли цена при работе через подписку и через API?
Нет. Таблица выше показывает цену токенов прямых API Standard на 23 сентября 2026 года по Anthropic и OpenAI. Доступ в Claude, Claude Code, ChatGPT Work или Codex и их лимиты определяются конкретным продуктом и планом; по API-цене нельзя вывести остаток подписки.



