Почему любой «топ-10 нейросетей» бесполезен
За лето вышло новое поколение почти у всех: обновились семейства Claude и GPT, подтянулись Gemini и открытые модели, у нас вышла вторая линейка GigaChat и обновилась Алиса. Цены на обращения к моделям упали в разы - то, что год назад считалось дорогим, сегодня стоит копейки.
Из этого следует ровно один практический вывод: любой рейтинг, который вы прочитаете, устареет раньше, чем вы им воспользуетесь. Я сам месяц назад считал одну модель лучшей под свою задачу, а после повторного сравнения перевёл всё на другую.
Поэтому дальше не список, а два вопроса. Они не устаревают.
Развилка первая: есть ли в задаче пациент
Первая развилка - это вопрос не про технологии, а про закон: есть ли в тексте конкретный человек. От ответа зависит не «какая модель удобнее», а какие модели вообще допустимы.
Если в тексте есть конкретный человек - фамилия, дата рождения, номер полиса, диагноз с привязкой к личности - вы работаете с персональными данными, причём со сведениями о здоровье. Это особая категория, требования к ней жёстче, чем к имени и телефону. Данные пациентов должны обрабатываться внутри страны, а за утечки штрафы за последние два года подняли до миллионных, плюс появилась отдельная уголовная статья за незаконный оборот баз.
Если конкретного человека нет - вы разбираете статью, готовите памятку, пишете приказ, сводите таблицу с суммами - это обычный текст, и ограничений на инструмент нет.
Практически: больше половины задач врача попадает во вторую корзину. Памятка, шаблон, презентация, разбор исследования, документ, прайс, ответ на отзыв - ни в одной из них пациент не нужен.
Если из текста убрать всё, по чему человека можно узнать, и задача от этого не разваливается - убирайте и работайте чем угодно. Если разваливается - это задача из первой корзины, и решать её надо по-другому: см. что нельзя загружать в нейросеть из карты пациента.
Корзина первая: задачи с данными пациентов
Для задач с данными пациентов выбор короткий - модели, которые считают на серверах внутри страны. Практически это GigaChat от Сбера и то, что стоит за Алисой у Яндекса, - обе линейки за год заметно подросли и обе обрабатывают данные внутри российской инфраструктуры. По узнаваемости у нас они, кстати, впервые обошли ChatGPT: во втором квартале 2026 года опрос давал Алисе 46 %, GigaChat 45 %, ChatGPT 38 %.
Но сам по себе выбор модели тут не решает вопрос. Отвечает не название, а весь путь данных: где они лежат, кто имеет доступ, что записывается в логи, есть ли согласие пациента. Модель - только один участок этого пути, и рассуждать про неё в отрыве от остального смысла нет.
Что вышло, когда я сравнил их на своей задаче
Сравнение на реальной задаче показало разрыв в 4 карты из 12 - там, где описания на сайтах не показывают ничего. Я взял свою рабочую задачу и прогнал через неё 4 модели.
Задача: превратить наговоренный текст приёма в структурированную карту по моему шаблону. Двенадцать разных приёмов, один и тот же шаблон, одинаковые условия, данные обезличенные, весь контур внутри страны.
Вот что получилось у двух основных участников - Алисы от Яндекса и GigaChat от Сбера.
| Алиса AI | GigaChat | |
|---|---|---|
| Диагноз сформулирован | 12 из 12 | 8 из 12 |
| Карт вообще без диагноза | 0 | 4 |
| Среднее время ответа | 13,1 с | 18,5 с |
Разрыв оказался больше, чем я ожидал. И он в том месте, где ошибку не видно с первого взгляда: карта без диагноза выглядит совершенно нормально. Текст ровный, разделы на месте, формулировки приличные. Пропустить её при беглом чтении легко - а это четыре карты из двенадцати.
По итогам я перевёл свою рабочую систему на Алису. Не потому что «Яндекс лучше Сбера» - а потому что на этой задаче в этом замере разница оказалась такой.
Находка, которая важнее таблицы
Обе модели дописывали диагноз, которого во входном тексте не было, - и это оказалось важнее разницы в цифрах. Общая находка для обеих, и я её не ожидал.
Когда в исходном тексте диагноза не было вообще, обе модели его дописывали. Вежливо, правдоподобно, без единого признака сомнения. Не «данных недостаточно», не «уточните» - готовая формулировка, которая выглядит как ваша.
Отсюда вывод, который не отменяется выбором модели, версией и настройкой: шаг «врач читает готовую карту» не убирается никогда. Это не осторожность новичка. Это то, что видно на замере.
Когда я гонял модели параллельно, одна начала отвечать отказами из-за превышения лимита запросов. В отчёте это выглядело как идеальный результат без единой ошибки - потому что там, где нет ответа, нет и ошибки. Пришлось переделывать замер последовательно.
Мораль для любого сравнения: сначала проверьте, что все участники вообще ответили. Красивая таблица иногда означает, что кто-то просто молчал.
Как повторить этот замер у себя за вечер
Замер повторяется за 1 вечер и состоит из 5 шагов. Цифры выше - мои, на моей задаче и на моём шаблоне. У вас будет своя задача, и результат может выйти другим. Метод при этом одинаковый:
- Возьмите десять-двенадцать реальных случаев - не выдуманных, а тех, что были на приёме. Обезличьте.
- Один и тот же шаблон и один и тот же запрос для всех моделей.
- Гоняйте последовательно, а не параллельно, иначе поймаете то же, что и я.
- Считайте не «понравилось», а конкретное: попал ли в структуру, есть ли диагноз, что дописано от себя, сколько секунд.
- Отдельным столбцом - что модель добавила, чего не было во входе. Это самая ценная колонка.
Вечер работы, и дальше вы не читаете чужие обзоры вообще.
Выбрать модель - десять минут. Собрать вокруг неё то, что будет работать каждый день - ваш шаблон, ваши проверки, ваш порядок - это другая работа. Ровно её мы и делаем на практикуме: три вечера, вы приходите со своей задачей и уходите с собранным AI-ассистентом. Без кода, 3 000 ₽. Записаться
Корзина вторая: какую модель брать для задач без пациента
Для задач без пациента работает грубое правило из 3 пунктов, и оно не зависит от бренда: выбирают по сложности задачи, а не по рейтингу.
- Длинные тексты, документы, разбор литературы, аккуратность в рассуждении - берите старшую модель у любого из крупных зарубежных семейств. Разница с младшими заметна именно на длинных и въедливых задачах.
- Быстрые короткие задачи - младшая модель того же семейства. Она в разы дешевле и на простом справляется не хуже.
- Работа с русским языком и деловыми документами - отечественные модели тут заметно подтянулись, и для официальных бумаг они часто удобнее.
Оплата зарубежных сервисов из России - отдельная головная боль, про неё у меня есть разбор в блоге.
Как не выбирать заново каждые три месяца
Три правила, которые экономят больше, чем любой рейтинг:
- Держите свою задачу-эталон. Пять-десять реальных случаев, на которых вы гоняете любую новую модель. Полчаса - и вы знаете ответ вместо того, чтобы читать чужие обзоры.
- Не привязывайтесь намертво. Всё, что вы настраиваете вокруг модели - шаблоны, порядок работы, проверки - должно легко переезжать. Модели меняются, ваш способ работы остаётся.
- Проверяйте, что сравниваете сравнимое. Когда я гонял модели параллельно, одна начала отвечать отказами из-за превышения лимита - и в отчёте это выглядело как идеальный результат без единой ошибки. Пришлось переделывать замер.
Часто задаваемые вопросы
Последний пункт стоил мне вечера. Зато теперь я знаю, что первый прогон всегда врёт, и второй делаю по-другому.
А третий, если что, ещё не делал.