Перейти к содержимому


Фотография

Тест 7 моделей на одной статье: Opus 5, Fable 5, Kimi, DeepSeek, Grok, Sonnet. А на чем пишете вы?

Форум ZiSMO.biz
ai контент ии
0
В этой теме нет ответов

OFFLINE Отправлено

divisor
VIP
  • Онлайн:2ч 57м
1
Решил разобраться, на чём выгоднее гонять статьи, и прогнал семь моделей по одному и тому же брифу. Делюсь цифрами и заодно хочу спросить у зала кое-что, до чего сам не докопался. Но по порядку.
 
Условия теста
 
Один бриф на всех: 12 разделов, объём 1200 - 1600 слов, английский. Все модели дёргались через OpenRouter, одним промптом, без доработок и без второго захода. Одна генерация на модель, что выдала, то и пошло в зачёт.
 
Результаты
 
  • Claude Opus 5 · 88 баллов · $0.116 · 65 c · 1864 слова · тариф 5.00 / 25.00
  • Claude Fable 5 · 88 баллов · $0.203 · 50 c · 1594 слова · тариф 10.00 / 50.00
  • Kimi K3 · 86 баллов · $0.074 · 212 c · 1837 слов · тариф 3.00 / 15.00
  • Kimi K2.5 · 85 баллов · $0.009 · 13 c · 1523 слова · тариф 0.45 / 2.25
  • DeepSeek v4 Pro · 83 балла · $0.003 · 100 c · 2024 слова · тариф 0.40 / 0.79
  • Claude Sonnet 5 · 80 баллов · $0.041 · 45 c · 1641 слово · тариф 2.00 / 10.00
  • Grok 4.6 · 80 баллов · $0.026 · 86 c · 1990 слов · тариф 2.00 / 6.00
 
Порядок: балл, цена за готовую статью, время генерации, объём, тариф за 1M токенов как input / output. Балл это слепая оценка по стобалльной шкале, про судью ниже отдельно.
 
Та же семёрка, отсортированная по цене за статью:
 
  • DeepSeek v4 Pro · $0.003 · 83 балла
  • Kimi K2.5 · $0.009 · 85 баллов
  • Grok 4.6 · $0.026 · 80 баллов
  • Claude Sonnet 5 · $0.041 · 80 баллов
  • Kimi K3 · $0.074 · 86 баллов
  • Claude Opus 5 · $0.116 · 88 баллов
  • Claude Fable 5 · $0.203 · 88 баллов
 
 
Сверху вниз цена вырастает в 68 раз. Балл вырастает на пять.
 
Сильные и слабые стороны по каждой:
 
  • Claude Opus 5. Самая чистая вода в тесте, текст читается ровнее всех. Минус один: дорого.
  • Claude Fable 5. Лучший язык и конкретика. Самая дорогая в тесте, и она же была судьёй.
  • Kimi K3. Живой язык, бриф отработан полностью. Медленная, и reasoning тарифицируется отдельно.
  • Kimi K2.5. Тринадцать секунд и конкретика на уровне флагманов. Насыпала вторую таблицу сверх брифа.
  • DeepSeek v4 Pro. Сильная конкретика, на английском нет проблемы с обращением на "ты". Слегка раздут объём.
  • Claude Sonnet 5. Ровно и по делу. Ярких плюсов нет ни одного.
  • Grok 4.6. Конкретная фактура. Заметный перебор по объёму.
 
 
ТЗ соблюли все семь, ни одна не потеряла раздел.
 
Что из этого действительно интересно
 
Разрыв в цене несопоставим с разрывом в качестве. Между первым местом и DeepSeek разница в три балла из ста и разница в цене почти в сорок раз. Kimi K2.5 берёт 85 баллов за 8 процентов стоимости Opus. Если вы платите за флагман, вы платите не за качество текста, а за последние три балла.
 
Скорость не коррелирует ни с ценой, ни с качеством. Самая быстрая модель в тесте (13 секунд) стоит почти дешевле всех. Самая медленная (212 секунд) стоит в восемь раз дороже неё. Никакой закономерности.
 
Объём не выдержал почти никто. Бриф просил 1200 - 1600 слов. Уложились Fable (1594) и K2.5 (1523). Все остальные ушли выше, DeepSeek до 2024 слов, Grok до 1990. Если вы платите за output-токены, лишние 400 слов это лишние деньги на каждой статье.
 
Честные оговорки, без которых тест не тест
 
  • Судьёй была Fable 5, и она же участвовала. Оценка слепая, тексты обезличены, но участник, оценивающий сам себя, это методологическая дыра, и я о ней знаю. Себе она поставила 88, то есть в один ряд с Opus, а не выше. Верить этому на сто процентов не надо.
  • Цены через OpenRouter. У провайдеров напрямую тарифы другие. DeepSeek напрямую, например, тарифицируется по времени суток, и в пик выходит заметно дороже.
  • У Sonnet 5 в тесте вводный прайс. Он заканчивается 31 августа, то есть на днях. После этого расчёт по нему поедет.
  • Три модели Claude помечают текст водяным знаком. Кому это важно, тот знает зачем.
  • Одна генерация на модель. Статистики тут нет, есть срез.
 
 
А теперь то, ради чего я это пишу
 
Все цифры выше это цена за одну генерацию. Но никто же не публикует первый выхлоп. Значит реальная метрика другая: цена за принятый текст, то есть генерация умножить на количество итераций до состояния "годится".
 
И вот тут вся таблица может перевернуться. DeepSeek за $0.003 с четырьмя переписываниями это $0.012, всё равно в десять раз дешевле Opus с одного захода. А если Opus заходит с первого раза, а дешёвая модель требует шести подходов и ручной правки сверху, то дешёвой она была только на бумаге.
 
Своих честных цифр по итерациям у меня нет, потому что я тестировал one-shot. Поэтому вопросы в зал:
 
1. На чём вы реально пишете сейчас, в августе 2026, и почему именно на этом?
2. Сколько итераций у вас уходит до текста, который вы готовы опубликовать? Считаете ли вы вообще эту цифру?
3. Промпт-кэш и batch кто-нибудь использует, или все синхронно по одной статье за раз?
4. Кто на длинной дистанции сидит на одной модели, а кто скачет за релизами?
 
Отдельно интересно услышать тех, кто гоняет объёмы, а не пару статей в неделю. Там экономика совсем другая.
 
 
Для справки
 
Собрал отдельно справочник по ценам всех основных API на август 2026, с разбором того, как считаются prompt-кэш и batch-скидки и где заявленные минус 50 процентов на самом деле минус 20.
 
Обновляю его каждый месяц, потому что за один месяц прайсы поменялись у шести провайдеров из семи. Модели переименовывают быстрее, чем успеваешь пересчитать бюджет.

Управление доменами и трафиком → 301.ru

Администрация форума не имеет отношения к пользователям форума и к публикуемой ими информации. Пользовательское соглашение
    • 0
  • Наверх


Самое интересное

 



1