Решил разобраться, на чём выгоднее гонять статьи, и прогнал семь моделей по одному и тому же брифу. Делюсь цифрами и заодно хочу спросить у зала кое-что, до чего сам не докопался. Но по порядку.
Условия теста
Один бриф на всех: 12 разделов, объём 1200 - 1600 слов, английский. Все модели дёргались через OpenRouter, одним промптом, без доработок и без второго захода. Одна генерация на модель, что выдала, то и пошло в зачёт.
Результаты
- Claude Opus 5 · 88 баллов · $0.116 · 65 c · 1864 слова · тариф 5.00 / 25.00
- Claude Fable 5 · 88 баллов · $0.203 · 50 c · 1594 слова · тариф 10.00 / 50.00
- Kimi K3 · 86 баллов · $0.074 · 212 c · 1837 слов · тариф 3.00 / 15.00
- Kimi K2.5 · 85 баллов · $0.009 · 13 c · 1523 слова · тариф 0.45 / 2.25
- DeepSeek v4 Pro · 83 балла · $0.003 · 100 c · 2024 слова · тариф 0.40 / 0.79
- Claude Sonnet 5 · 80 баллов · $0.041 · 45 c · 1641 слово · тариф 2.00 / 10.00
- Grok 4.6 · 80 баллов · $0.026 · 86 c · 1990 слов · тариф 2.00 / 6.00
Порядок: балл, цена за готовую статью, время генерации, объём, тариф за 1M токенов как input / output. Балл это слепая оценка по стобалльной шкале, про судью ниже отдельно.
Та же семёрка, отсортированная по цене за статью:
- DeepSeek v4 Pro · $0.003 · 83 балла
- Kimi K2.5 · $0.009 · 85 баллов
- Grok 4.6 · $0.026 · 80 баллов
- Claude Sonnet 5 · $0.041 · 80 баллов
- Kimi K3 · $0.074 · 86 баллов
- Claude Opus 5 · $0.116 · 88 баллов
- Claude Fable 5 · $0.203 · 88 баллов
Сверху вниз цена вырастает в 68 раз. Балл вырастает на пять.
Сильные и слабые стороны по каждой:
- Claude Opus 5. Самая чистая вода в тесте, текст читается ровнее всех. Минус один: дорого.
- Claude Fable 5. Лучший язык и конкретика. Самая дорогая в тесте, и она же была судьёй.
- Kimi K3. Живой язык, бриф отработан полностью. Медленная, и reasoning тарифицируется отдельно.
- Kimi K2.5. Тринадцать секунд и конкретика на уровне флагманов. Насыпала вторую таблицу сверх брифа.
- DeepSeek v4 Pro. Сильная конкретика, на английском нет проблемы с обращением на "ты". Слегка раздут объём.
- Claude Sonnet 5. Ровно и по делу. Ярких плюсов нет ни одного.
- Grok 4.6. Конкретная фактура. Заметный перебор по объёму.
ТЗ соблюли все семь, ни одна не потеряла раздел.
Что из этого действительно интересно
Разрыв в цене несопоставим с разрывом в качестве. Между первым местом и DeepSeek разница в три балла из ста и разница в цене почти в сорок раз. Kimi K2.5 берёт 85 баллов за 8 процентов стоимости Opus. Если вы платите за флагман, вы платите не за качество текста, а за последние три балла.
Скорость не коррелирует ни с ценой, ни с качеством. Самая быстрая модель в тесте (13 секунд) стоит почти дешевле всех. Самая медленная (212 секунд) стоит в восемь раз дороже неё. Никакой закономерности.
Объём не выдержал почти никто. Бриф просил 1200 - 1600 слов. Уложились Fable (1594) и K2.5 (1523). Все остальные ушли выше, DeepSeek до 2024 слов, Grok до 1990. Если вы платите за output-токены, лишние 400 слов это лишние деньги на каждой статье.
Честные оговорки, без которых тест не тест
- Судьёй была Fable 5, и она же участвовала. Оценка слепая, тексты обезличены, но участник, оценивающий сам себя, это методологическая дыра, и я о ней знаю. Себе она поставила 88, то есть в один ряд с Opus, а не выше. Верить этому на сто процентов не надо.
- Цены через OpenRouter. У провайдеров напрямую тарифы другие. DeepSeek напрямую, например, тарифицируется по времени суток, и в пик выходит заметно дороже.
- У Sonnet 5 в тесте вводный прайс. Он заканчивается 31 августа, то есть на днях. После этого расчёт по нему поедет.
- Три модели Claude помечают текст водяным знаком. Кому это важно, тот знает зачем.
- Одна генерация на модель. Статистики тут нет, есть срез.
А теперь то, ради чего я это пишу
Все цифры выше это цена за одну генерацию. Но никто же не публикует первый выхлоп. Значит реальная метрика другая: цена за принятый текст, то есть генерация умножить на количество итераций до состояния "годится".
И вот тут вся таблица может перевернуться. DeepSeek за $0.003 с четырьмя переписываниями это $0.012, всё равно в десять раз дешевле Opus с одного захода. А если Opus заходит с первого раза, а дешёвая модель требует шести подходов и ручной правки сверху, то дешёвой она была только на бумаге.
Своих честных цифр по итерациям у меня нет, потому что я тестировал one-shot. Поэтому вопросы в зал:
1. На чём вы реально пишете сейчас, в августе 2026, и почему именно на этом?
2. Сколько итераций у вас уходит до текста, который вы готовы опубликовать? Считаете ли вы вообще эту цифру?
3. Промпт-кэш и batch кто-нибудь использует, или все синхронно по одной статье за раз?
4. Кто на длинной дистанции сидит на одной модели, а кто скачет за релизами?
Отдельно интересно услышать тех, кто гоняет объёмы, а не пару статей в неделю. Там экономика совсем другая.
Для справки
Собрал отдельно справочник по ценам всех основных API на август 2026, с разбором того, как считаются prompt-кэш и batch-скидки и где заявленные минус 50 процентов на самом деле минус 20.
Обновляю его каждый месяц, потому что за один месяц прайсы поменялись у шести провайдеров из семи. Модели переименовывают быстрее, чем успеваешь пересчитать бюджет.