Чек-лист

15 нейросетей на бесплатном тарифе: семь задач, 70 баллов, неожиданный последний

Никаких бенчмарков. Я взял 15 моделей на чистом бесплатном тарифе, прогнал через семь реальных задач и выставил оценки. Результат перевернул привычный рейтинг: та модель, за которую я плачу 200 $ и считаю лучшей, оказалась на предпоследнем месте. А выиграла та, о которой спорят меньше всего.

41 мин
Содержание12 глав
  1. 01Что и как я проверял
  2. 02Трое выбыли, не начав
  3. 03Раунд первый: продающий пост
  4. 04Раунд второй: таблица на 5 000 строк
  5. 05Раунд третий: код, где всё перевернулось
  6. 06Claude не ответил на задачу про лампочки
  7. 07Раунды пятый, шестой и седьмой
  8. 08Почему для сложного кода чата не хватит
  9. 09Итоговый рейтинг, и он неожиданный
  10. 10Три возражения по итогам
  11. 11Что этот тест не измеряет
  12. 12Выбирай под задачу, а не по привычке

Что и как я проверял

Проблема простая. Мы все сидим на одном ChatGPT или максимум на двух-трёх привычных инструментах. И даже не знаем, что рядом есть бесплатные альтернативы, которые уже делают эту работу лучше.

А помимо этого большинство людей сидит именно на бесплатных тарифах. И там есть модели, которые очень крутые на платной подписке, а в бесплатной версии вы пользуетесь пустышкой и не знаете этого.

Поэтому цель — сравнить именно бесплатные тарифные планы. В тестировании 15 моделей: от международных до российских. Все на бесплатной подписке, нигде не нужно привязывать карту. Чистый бесплатный тариф.

Правила простые. Я заранее подготовил семь запросов под семь разных задач и не дорабатывал их под конкретные модели. За каждую задачу — от 1 до 10 баллов. Максимум, который можно набрать, — 70.

моделей в тесте
15
все на чистом бесплатном тарифе
задач
7
копирайтинг, данные, код, логика, поиск, пересказ, русский
максимум баллов
70
по 10 за задачу

Трое выбыли, не начав

Оговорюсь сразу насчёт запросов. Кто-то скажет: для конкретной модели нужны уникальные формулировки. Возможно, где-то это действительно так.

Но я как человек, который разработал не один продукт с помощью нейросетей и использует их минимум половину рабочего дня — от контента до вайб-кодинга, — скажу: в своей повседневной работе я использую одни и те же запросы везде, и глобальной разницы за всё время не замечал.

Тестирование специально шло из России, и часть моделей отвалилась ещё на старте. Одна не открылась вообще без серьёзных танцев с бубном — нужно поднимать свой сервер и заходить через него. Другая на бесплатном тарифе разрешает загрузить всего один файл, из-за чего половина раундов для неё невозможна. Третья — полностью российская разработка — после первого раунда начала требовать авторизацию и просто перестала работать.

Три из пятнадцати выбыли до того, как тестирование запустилось.

ПРАВИЛО
Первый фильтр для бесплатного тарифа — не качество ответов, а вопрос, запустится ли модель вообще и сколько файлов даст загрузить.

Раунд первый: продающий пост

Задача — написать продающий пост для онлайн-курса, аудитория предприниматели 25-40 лет, максимум тысяча символов. Формат жёстко ограничен, поэтому у всех должно получиться плюс-минус одинаково.

И вот первый сюрприз. ChatGPT получает 5 из 10. Для неподготовленного читателя вроде и неплохо, но любой знающий человек моментально увидит машинный текст: конструкции вроде «это не, а вот это». Мы все знаем, как выглядит пост от ChatGPT.

Gemini получает 8. Понравился заход вроде «вы тратите по 4 часа в день на то, что я делаю за 15 минут» — сразу конкретно.

Десятку получили две модели: европейская и китайская. У первой хороший заголовок, акцент на болях, в которых узнаёшь себя, конкретика про курс, цифры для доверия. У второй хороший крючок, более выраженная структура, выгода и чистый текст.

А сильнее всего меня удивил Яндекс GPT — 9 из 10. Коротко и по делу, неподготовленному человеку вообще не будет понятно, что это писала нейросеть. Живой язык, непохожий на ChatGPT.

И проблема ChatGPT, мне кажется, не в том, что он плохо пишет. А в том, что мы очень сильно привыкли к тому, как он пишет. Поэтому всё отличное кажется свежим, хотя на самом деле просто задолбал один и тот же текст.

европейская модель10 из 10, боли и конкретика
китайская модель10 из 10, чистый текст и структура
Яндекс GPT9 из 10, самый живой русский
Gemini8 из 10, сильный заход
GigaChat8 из 10, живой язык от первого лица
ChatGPT5 из 10, узнаваемый машинный текст

Раунд второй: таблица на 5 000 строк

Второй раунд — настоящая бойня. Загружаем большую таблицу на 5 000 строк и просим найти три неочевидных инсайта, которые не видны на поверхности: для каждого объяснить влияние на бизнес, гипотезу и конкретные действия.

Огромное количество моделей просто не увидело этот файл — он оказался для них слишком большим.

ChatGPT получает тройку. Ответ понятный, хорошо упакован, но инсайты уровня «следи за остатками» и «тестируй цены» — это не анализ, это здравый смысл. Тройка хотя бы за то, что он загрузил файл, в отличие от предыдущих.

Gemini — восьмёрка. Причинно-следственные связи оказались интересными: он сразу сказал, что рейтинг товара и его продажи практически ни на что не влияют. В одной подкатегории могут быть товары с рейтингом 4,2 и 4,9, а продажи плюс-минус одинаковые.

У Claude начало было сильным — он дал уникальный инсайт про скорость накопления, нашёл 267 товаров с дефицитом из 5 000 и 91 позицию с определённым количеством выкупа. Он действительно нашёл то, чего не нашли другие. Но лимиты закончились до того, как он закончил работать с таблицей, и работу пришлось прервать.

Copilot — тоже восьмёрка. Нашёл связь между трафиком и внешним спросом, увидел сегмент, а не просто товар, сразу выделил кластер как точку роста и подготовил матрицу приоритетов.

большой файл загрузит любая модель
Copilot — тоже восьмёрка
на бесплатном тарифе хватит лимитов дочитать таблицу
У Claude начало было сильным — он дал уникальный инсайт про скорость накопления, нашёл 267 товаров с дефицитом из 5 000 и 91 позицию с определённым количеством выкупа
инсайт и здравый смысл — это одно и то же
Gemini — восьмёрка

Раунд третий: код, где всё перевернулось

Третий раунд особенно важен. Многие хотят попробовать вайб-кодинг, но у них нет возможности платить за дорогие модели — моя подписка обходится в 200 $ в месяц. Если это для тебя пока увлечение, это действительно дорого. А попробовать, я считаю, должен каждый: для оптимизации своей рутины, а возможно и как профессию.

Задача простая: телеграм-бот на Python, который собирает сообщения из чата за день, делает ежедневную сводку и отправляет обратно в чат. Немного строк кода.

И здесь меня, человека, который собрал уже не один продукт, результат по-настоящему удивил.

Perplexity — 9 из 10. Один из самых полных ответов: 32 000 символов, модели данных, миграции, запросы вынесены в отдельные файлы, логирование, контейнер. И всё это на полностью бесплатной подписке. Такое вообще мало кто может.

Copilot — тоже девятка, столько же символов и задача завершена.

Китайская модель — восьмёрка. Выдала самый большой код, 57 000 символов, с полной реализацией всех модулей. Проблема в том, что для бота это избыточно много. Хотя результат впечатляет: значит, можно делать проекты крупнее.

Claude — шестёрка. Начало архитектуры хорошее, модули продуманы, но код обрезан без предупреждения. Опять лимиты: даже такую задачу на бесплатной подписке сделать практически невозможно.

Gemini и ChatGPT получают по 8 баллов, код готов к реализации. Важная оговорка: мы не сравнивали отдельные среды разработки — задача была сравнить генеративные модели внутри их чатов. Подозреваю, что там результат был бы 8-9 баллов как минимум.

01
Одна задача всем
запрос не адаптируется под модель
телеграм-бот со сводкой за день
02
Полнота ответа
на бесплатном тарифе
от 32 000 до 57 000 символов кода
03
Где обрыв
лимиты кончились посередине
код обрезан без предупреждения
04
Граница чата
для сложного нужна среда разработки
файл нельзя редактировать внутри чата

Claude не ответил на задачу про лампочки

Четвёртый раунд — логика. Две задачи: одна простая на арифметику, вторая классическая — три выключателя, три лампочки за дверью, войти можно один раз.

Справились почти все, от ChatGPT до Яндекс GPT.

А самое смешное — что Claude с задачей не справился. Точнее, он бы наверняка справился, но просто решил не давать ответ на бесплатной подписке: видимо, закончились лимиты или были перебои. В итоге Claude единственный, кто не отдал ответ вообще.

Почему я взял именно эту задачу. Есть стандартная история: напиши быстрой модели, что тебе прислали две пары обуви, правая лежит в коробке для левой, а левая в коробке для правой — что делать? Быстрая модель чаще всего ответит, что нужно оформить возврат. Мало какая догадается, что их нужно просто поменять местами. Мы подтвердили, что сейчас с этим стало немного лучше.

логика решена
почти все модели дали верный ответ
нет ответа
Claude не ответил вовсе — лимиты

Раунды пятый, шестой и седьмой

Пятый раунд — поиск. Я много использую модели для этого: одну просто как замену обычному поиску, а часто делаю глубокие исследования, чтобы разобраться в теме. Задача — найти пять актуальных трендов и по каждому дать описание, практическую ценность, пример компании и ссылку на источник.

Gemini снова лидер: конкретные примеры компаний, детальное объяснение причинно-следственных связей. Твёрдая девятка.

Дальше китайская модель — восьмёрка, и это меня удивило: для меня она была забытой хайповой историей, которая вроде ничего не умеет. Но в бесплатных подписках привычные места меняются местами.

ChatGPT дал стандартные тренды — пятёрка, обо всём и ни о чём одновременно. Perplexity — семёрка: единственная модель, которая по природе продукта верифицировала ссылки, но глубина исследования средняя. Ещё одна модель честно заявила, что её знания ограничены серединой 2024 года — пятёрка хотя бы за то, что справилась.

Шестой и седьмой раунды объединю: пересказ большой статьи и работа с русским языком.

В пересказе Gemini снова лидер — каждый тезис не просто пересказ, а осмысленный текст, видны связки, модель понимает текст целиком, а не отдельный абзац. Девятка.

А в русском языке первое место у Яндекс GPT — 9 из 10. Самый естественный русский из всех моделей: чувствуется живой носитель языка. По факту так и есть. У остальных видно, что модель переводится с английского, а не говорит по-русски.

поиск — Gemini
9 баллов
пересказ — Gemini
9 баллов
русский язык — Яндекс GPT
9 баллов
верификация ссылок — Perplexity
единственный

Почему для сложного кода чата не хватит

Если сегодня писать код для небольших решений, можно использовать что угодно. Даже Яндекс GPT нам что-то создал — код там очень плохой, но пятёрку дадим за то, что справился.

А вот если речь про что-то тяжелее калькулятора, придётся пользоваться отдельными инструментами: агентами для кода, средами разработки, расширениями.

Причина простая. Внутри чата ты просто получаешь файл и не можешь его редактировать. Внутри среды разработки агент самостоятельно лазит по твоему коду и исправляет. Это две большие разницы.

ПРАВИЛО
Чат отдаёт файл, среда отдаёт работу с файлом. Пока ты копируешь код руками, размер проекта ограничен твоим терпением.

Итоговый рейтинг, и он неожиданный

Свожу результаты. Начну с конца, потому что там самое интересное.

Одна малоизвестная модель набрала 10 баллов и заняла предпоследнее место среди тех, кто вообще запустился.

А теперь про Claude. На бесплатной модели он абсолютно ужасен. И не только на бесплатной: если у вас подписка за 20 $, проще выкинуть её и купить что-то другое. Я знаю по себе — я ненавидел Claude, пока не купил подписку за 200 $. От 100 $ уже нормально, но на дешёвых тарифах и на бесплатном даже не пробуйте.

По сути Claude — идеальная модель, когда мы говорим про дорогие тарифы, и абсолютно бесполезная в бесплатных версиях.

ChatGPT — седьмое место. В бесплатном плане нормально, если задач совсем мало: я знаю, что моя мама пользуется бесплатной подпиской, и ей хватает спланировать путешествие или ремонт. А вот на платной версии он для меня до сих пор одна из лучших: огромный контекст, лимиты не заканчиваются — в то время как другие эти лимиты закручивают так, что работать становится невозможно.

Третье место разделили две модели, о которых я раньше даже не думал. Второе — Copilot, он был неплох практически во всех раундах. А первое место занимает Gemini.

1 местоGemini: лидер в поиске, пересказе, силён везде
2 местоCopilot: ровно хорош во всех раундах
3 место, поделеноевропейская и китайская модели
5 местоPerplexity: сильный код, верификация ссылок
7 местоChatGPT: хватит для бытовых задач
предпоследнеемалоизвестная модель, 10 баллов
последнее среди запустившихсяClaude: лимиты обрывают почти каждый раунд

Три возражения по итогам

Claude же лучший, вы просто не умеете им пользоваться
На дорогих тарифах — да, идеальный. Но здесь он не дошёл до конца ни в анализе данных, ни в коде, ни в логике: лимиты заканчивались прямо посреди ответа
Российские модели не тянут
Яндекс GPT взял 9 из 10 в копирайтинге и 9 из 10 в русском языке — это лучший естественный русский из всех участников. В коде он слаб, но со своей задачей справился
Победил Gemini, потому что вы им пользуетесь
На бесплатной подписке там доступна генерация изображений, причём в старшей версии, немного видео, кодовая среда и одна из лучших генеративных моделей на рынке. Нюанс есть: придётся чуть больше запариться с обходом блокировок. Но это того стоит

Что этот тест не измеряет

Важная оговорка про код: мы не сравнивали отдельные среды разработки и агентов, потому что задача была — сравнить генеративные модели внутри их собственных чатов. Если бы сравнивали их, результаты были бы другими.

И ещё: курса по нейросетям, для которого модели писали продающий пост, у нас нет. По крайней мере пока. Это просто тестовая задача, на которой оценивался результат.

ЧЕСТНО
Я плачу 200 $ за модель, которая в этом тесте оказалась внизу. Это не противоречие: тест про бесплатные тарифы, а не про то, кто умнее.

Выбирай под задачу, а не по привычке

Ты дочитал до конца — значит, вопрос не в том, какая нейросеть лучшая. Такой нет: у каждой задачи свой победитель, и на бесплатном тарифе привычный рейтинг переворачивается.

Вопрос в том, за что именно ты платишь или почему до сих пор не платишь.

Один вопрос напоследок. Ответь себе одним предложением: какая из семи задач — текст, данные, код, логика, поиск, пересказ, русский язык — занимает у тебя больше всего времени? Найди победителя именно в ней и попробуй его на этой неделе. Я читаю.

15 — моделей
7 — задач
70 — баллов максимум
3 — выбыли на старте