Короткого ответа в виде места в таблице тут нет, потому что Алиса оценивается сразу в двух разных ролях: как голосовой ассистент в колонке и как чат на базе YandexGPT, и в независимых русскоязычных замерах вроде MERA участвует именно вторая часть, где она стабильно держится в верхней половине среди моделей, обученных под русский, уступая крупным зарубежным на длинных рассуждениях и задачах с кодом, но выигрывая у них в бытовых формулировках, склонениях и понимании разговорной речи; в роли колонки она сравнивается уже не с нейросетями, а с другими голосовыми ассистентами, и там оценка складывается из распознавания речи, скорости реакции и работы с умным домом, а не из умения написать эссе, поэтому ощущение, что она зачитывает куски из поиска, возникает закономерно: в голосовом сценарии длинный сгенерированный ответ звучал бы хуже короткой выжимки с найденной страницы, и продукт сознательно выбирает второе; если хочется сравнить честно, смотреть стоит не на подборки нейросетей из статей, где порядок мест зависит от автора, а на свежие открытые лидерборды с русскими наборами задач и на слепые арены, где люди голосуют за ответы, не зная, чья модель перед ними, и обязательно проверять дату замера, потому что версии обновляются несколько раз в год и прошлогодняя таблица описывает уже другую модель, чем та, что сейчас отвечает через вашу колонку.
Лучший ответ
4.1 Fast
4.1 Fast
Алиса нейросеть рейтинг?
Рейтинг Алисы зависит от того, кто его составлял и что именно мерили. Если речь про умную колонку, то она вообще не участник тех таблиц, которые гуляют по интернету: там сравнивают текстовые модели по бенчмаркам, а колонка это витрина поверх модели, урезанная по длине ответа, по скорости и по осторожности. Поэтому дома она кажется тупее, чем есть, и жена по своему права. В бытовом разговоре Алиса часто уходит в поиск и зачитывает первый попавшийся сниппет. Это не про интеллект, это про продуктовое решение, где лучше ответить быстро, чем умно. Теперь про сами рейтинги. В русскоязычной части живёт MERA, есть сборные арены, где модели сравнивают вслепую голосованием живых людей, и есть куча статей уровня топ-10 нейросетей, написанных ради трафика, где порядок мест меняется от настроения автора. Яндекс, естественно, публикует свои замеры и в них выглядит хорошо, что нормально для любого вендора, но принимать это за истину не стоит. Реальная картина примерно такая: YandexGPT в русском держится в группе крепких середняков, заметно выше старых открытых моделей, но до топовых зарубежных не дотягивает на сложных рассуждениях и на коде. В простых бытовых сценариях, погода, таймер, музыка, разница вообще не чувствуется, там побеждает тот, у кого микрофоны лучше. Станция Миди, кстати, из-за одного динамика и упрощённого сценария будет отвечать короче, чем та же модель в браузере. Нужна честная оценка, берите пять своих настоящих вопросов, тех, которые реально задаёте, и прогоните через Алису в приложении и через любой другой чат. Десять минут работы, а толку больше, чем от любой таблицы с местами.