15 нейросетей на бесплатном тарифе: семь задач, 70 баллов, неожиданный последний
Никаких бенчмарков. Я взял 15 моделей на чистом бесплатном тарифе, прогнал через семь реальных задач и выставил оценки. Результат перевернул привычный рейтинг: та модель, за которую я плачу 200 $ и считаю лучшей, оказалась на предпоследнем месте. А выиграла та, о которой спорят меньше всего.
Содержание12 глав
- 01Что и как я проверял
- 02Трое выбыли, не начав
- 03Раунд первый: продающий пост
- 04Раунд второй: таблица на 5 000 строк
- 05Раунд третий: код, где всё перевернулось
- 06Claude не ответил на задачу про лампочки
- 07Раунды пятый, шестой и седьмой
- 08Почему для сложного кода чата не хватит
- 09Итоговый рейтинг, и он неожиданный
- 10Три возражения по итогам
- 11Что этот тест не измеряет
- 12Выбирай под задачу, а не по привычке
Что и как я проверял
Проблема простая. Мы все сидим на одном ChatGPT или максимум на двух-трёх привычных инструментах. И даже не знаем, что рядом есть бесплатные альтернативы, которые уже делают эту работу лучше.
А помимо этого большинство людей сидит именно на бесплатных тарифах. И там есть модели, которые очень крутые на платной подписке, а в бесплатной версии вы пользуетесь пустышкой и не знаете этого.
Поэтому цель — сравнить именно бесплатные тарифные планы. В тестировании 15 моделей: от международных до российских. Все на бесплатной подписке, нигде не нужно привязывать карту. Чистый бесплатный тариф.
Правила простые. Я заранее подготовил семь запросов под семь разных задач и не дорабатывал их под конкретные модели. За каждую задачу — от 1 до 10 баллов. Максимум, который можно набрать, — 70.
Трое выбыли, не начав
Оговорюсь сразу насчёт запросов. Кто-то скажет: для конкретной модели нужны уникальные формулировки. Возможно, где-то это действительно так.
Но я как человек, который разработал не один продукт с помощью нейросетей и использует их минимум половину рабочего дня — от контента до вайб-кодинга, — скажу: в своей повседневной работе я использую одни и те же запросы везде, и глобальной разницы за всё время не замечал.
Тестирование специально шло из России, и часть моделей отвалилась ещё на старте. Одна не открылась вообще без серьёзных танцев с бубном — нужно поднимать свой сервер и заходить через него. Другая на бесплатном тарифе разрешает загрузить всего один файл, из-за чего половина раундов для неё невозможна. Третья — полностью российская разработка — после первого раунда начала требовать авторизацию и просто перестала работать.
Три из пятнадцати выбыли до того, как тестирование запустилось.
Раунд первый: продающий пост
Задача — написать продающий пост для онлайн-курса, аудитория предприниматели 25-40 лет, максимум тысяча символов. Формат жёстко ограничен, поэтому у всех должно получиться плюс-минус одинаково.
И вот первый сюрприз. ChatGPT получает 5 из 10. Для неподготовленного читателя вроде и неплохо, но любой знающий человек моментально увидит машинный текст: конструкции вроде «это не, а вот это». Мы все знаем, как выглядит пост от ChatGPT.
Gemini получает 8. Понравился заход вроде «вы тратите по 4 часа в день на то, что я делаю за 15 минут» — сразу конкретно.
Десятку получили две модели: европейская и китайская. У первой хороший заголовок, акцент на болях, в которых узнаёшь себя, конкретика про курс, цифры для доверия. У второй хороший крючок, более выраженная структура, выгода и чистый текст.
А сильнее всего меня удивил Яндекс GPT — 9 из 10. Коротко и по делу, неподготовленному человеку вообще не будет понятно, что это писала нейросеть. Живой язык, непохожий на ChatGPT.
И проблема ChatGPT, мне кажется, не в том, что он плохо пишет. А в том, что мы очень сильно привыкли к тому, как он пишет. Поэтому всё отличное кажется свежим, хотя на самом деле просто задолбал один и тот же текст.
| европейская модель | 10 из 10, боли и конкретика |
| китайская модель | 10 из 10, чистый текст и структура |
| Яндекс GPT | 9 из 10, самый живой русский |
| Gemini | 8 из 10, сильный заход |
| GigaChat | 8 из 10, живой язык от первого лица |
| ChatGPT | 5 из 10, узнаваемый машинный текст |
Раунд второй: таблица на 5 000 строк
Второй раунд — настоящая бойня. Загружаем большую таблицу на 5 000 строк и просим найти три неочевидных инсайта, которые не видны на поверхности: для каждого объяснить влияние на бизнес, гипотезу и конкретные действия.
Огромное количество моделей просто не увидело этот файл — он оказался для них слишком большим.
ChatGPT получает тройку. Ответ понятный, хорошо упакован, но инсайты уровня «следи за остатками» и «тестируй цены» — это не анализ, это здравый смысл. Тройка хотя бы за то, что он загрузил файл, в отличие от предыдущих.
Gemini — восьмёрка. Причинно-следственные связи оказались интересными: он сразу сказал, что рейтинг товара и его продажи практически ни на что не влияют. В одной подкатегории могут быть товары с рейтингом 4,2 и 4,9, а продажи плюс-минус одинаковые.
У Claude начало было сильным — он дал уникальный инсайт про скорость накопления, нашёл 267 товаров с дефицитом из 5 000 и 91 позицию с определённым количеством выкупа. Он действительно нашёл то, чего не нашли другие. Но лимиты закончились до того, как он закончил работать с таблицей, и работу пришлось прервать.
Copilot — тоже восьмёрка. Нашёл связь между трафиком и внешним спросом, увидел сегмент, а не просто товар, сразу выделил кластер как точку роста и подготовил матрицу приоритетов.
Раунд третий: код, где всё перевернулось
Третий раунд особенно важен. Многие хотят попробовать вайб-кодинг, но у них нет возможности платить за дорогие модели — моя подписка обходится в 200 $ в месяц. Если это для тебя пока увлечение, это действительно дорого. А попробовать, я считаю, должен каждый: для оптимизации своей рутины, а возможно и как профессию.
Задача простая: телеграм-бот на Python, который собирает сообщения из чата за день, делает ежедневную сводку и отправляет обратно в чат. Немного строк кода.
И здесь меня, человека, который собрал уже не один продукт, результат по-настоящему удивил.
Perplexity — 9 из 10. Один из самых полных ответов: 32 000 символов, модели данных, миграции, запросы вынесены в отдельные файлы, логирование, контейнер. И всё это на полностью бесплатной подписке. Такое вообще мало кто может.
Copilot — тоже девятка, столько же символов и задача завершена.
Китайская модель — восьмёрка. Выдала самый большой код, 57 000 символов, с полной реализацией всех модулей. Проблема в том, что для бота это избыточно много. Хотя результат впечатляет: значит, можно делать проекты крупнее.
Claude — шестёрка. Начало архитектуры хорошее, модули продуманы, но код обрезан без предупреждения. Опять лимиты: даже такую задачу на бесплатной подписке сделать практически невозможно.
Gemini и ChatGPT получают по 8 баллов, код готов к реализации. Важная оговорка: мы не сравнивали отдельные среды разработки — задача была сравнить генеративные модели внутри их чатов. Подозреваю, что там результат был бы 8-9 баллов как минимум.
Claude не ответил на задачу про лампочки
Четвёртый раунд — логика. Две задачи: одна простая на арифметику, вторая классическая — три выключателя, три лампочки за дверью, войти можно один раз.
Справились почти все, от ChatGPT до Яндекс GPT.
А самое смешное — что Claude с задачей не справился. Точнее, он бы наверняка справился, но просто решил не давать ответ на бесплатной подписке: видимо, закончились лимиты или были перебои. В итоге Claude единственный, кто не отдал ответ вообще.
Почему я взял именно эту задачу. Есть стандартная история: напиши быстрой модели, что тебе прислали две пары обуви, правая лежит в коробке для левой, а левая в коробке для правой — что делать? Быстрая модель чаще всего ответит, что нужно оформить возврат. Мало какая догадается, что их нужно просто поменять местами. Мы подтвердили, что сейчас с этим стало немного лучше.
Раунды пятый, шестой и седьмой
Пятый раунд — поиск. Я много использую модели для этого: одну просто как замену обычному поиску, а часто делаю глубокие исследования, чтобы разобраться в теме. Задача — найти пять актуальных трендов и по каждому дать описание, практическую ценность, пример компании и ссылку на источник.
Gemini снова лидер: конкретные примеры компаний, детальное объяснение причинно-следственных связей. Твёрдая девятка.
Дальше китайская модель — восьмёрка, и это меня удивило: для меня она была забытой хайповой историей, которая вроде ничего не умеет. Но в бесплатных подписках привычные места меняются местами.
ChatGPT дал стандартные тренды — пятёрка, обо всём и ни о чём одновременно. Perplexity — семёрка: единственная модель, которая по природе продукта верифицировала ссылки, но глубина исследования средняя. Ещё одна модель честно заявила, что её знания ограничены серединой 2024 года — пятёрка хотя бы за то, что справилась.
Шестой и седьмой раунды объединю: пересказ большой статьи и работа с русским языком.
В пересказе Gemini снова лидер — каждый тезис не просто пересказ, а осмысленный текст, видны связки, модель понимает текст целиком, а не отдельный абзац. Девятка.
А в русском языке первое место у Яндекс GPT — 9 из 10. Самый естественный русский из всех моделей: чувствуется живой носитель языка. По факту так и есть. У остальных видно, что модель переводится с английского, а не говорит по-русски.
Почему для сложного кода чата не хватит
Если сегодня писать код для небольших решений, можно использовать что угодно. Даже Яндекс GPT нам что-то создал — код там очень плохой, но пятёрку дадим за то, что справился.
А вот если речь про что-то тяжелее калькулятора, придётся пользоваться отдельными инструментами: агентами для кода, средами разработки, расширениями.
Причина простая. Внутри чата ты просто получаешь файл и не можешь его редактировать. Внутри среды разработки агент самостоятельно лазит по твоему коду и исправляет. Это две большие разницы.
Итоговый рейтинг, и он неожиданный
Свожу результаты. Начну с конца, потому что там самое интересное.
Одна малоизвестная модель набрала 10 баллов и заняла предпоследнее место среди тех, кто вообще запустился.
А теперь про Claude. На бесплатной модели он абсолютно ужасен. И не только на бесплатной: если у вас подписка за 20 $, проще выкинуть её и купить что-то другое. Я знаю по себе — я ненавидел Claude, пока не купил подписку за 200 $. От 100 $ уже нормально, но на дешёвых тарифах и на бесплатном даже не пробуйте.
По сути Claude — идеальная модель, когда мы говорим про дорогие тарифы, и абсолютно бесполезная в бесплатных версиях.
ChatGPT — седьмое место. В бесплатном плане нормально, если задач совсем мало: я знаю, что моя мама пользуется бесплатной подпиской, и ей хватает спланировать путешествие или ремонт. А вот на платной версии он для меня до сих пор одна из лучших: огромный контекст, лимиты не заканчиваются — в то время как другие эти лимиты закручивают так, что работать становится невозможно.
Третье место разделили две модели, о которых я раньше даже не думал. Второе — Copilot, он был неплох практически во всех раундах. А первое место занимает Gemini.
| 1 место | Gemini: лидер в поиске, пересказе, силён везде |
| 2 место | Copilot: ровно хорош во всех раундах |
| 3 место, поделено | европейская и китайская модели |
| 5 место | Perplexity: сильный код, верификация ссылок |
| 7 место | ChatGPT: хватит для бытовых задач |
| предпоследнее | малоизвестная модель, 10 баллов |
| последнее среди запустившихся | Claude: лимиты обрывают почти каждый раунд |
Три возражения по итогам
Что этот тест не измеряет
Важная оговорка про код: мы не сравнивали отдельные среды разработки и агентов, потому что задача была — сравнить генеративные модели внутри их собственных чатов. Если бы сравнивали их, результаты были бы другими.
И ещё: курса по нейросетям, для которого модели писали продающий пост, у нас нет. По крайней мере пока. Это просто тестовая задача, на которой оценивался результат.
Выбирай под задачу, а не по привычке
Ты дочитал до конца — значит, вопрос не в том, какая нейросеть лучшая. Такой нет: у каждой задачи свой победитель, и на бесплатном тарифе привычный рейтинг переворачивается.
Вопрос в том, за что именно ты платишь или почему до сих пор не платишь.
Один вопрос напоследок. Ответь себе одним предложением: какая из семи задач — текст, данные, код, логика, поиск, пересказ, русский язык — занимает у тебя больше всего времени? Найди победителя именно в ней и попробуй его на этой неделе. Я читаю.


