Самой мощной локальной модели не существует в отрыве от вашей видеокарты: потолок задаёт объём видеопамяти, а не место в рейтинге.
С 12 гигабайтами видеопамяти комфортно запускаются модели на 7-14 миллиардов параметров в квантованном виде. На этом уровне текст пишется связно, инструкции выполняются, скорость держится в районе десятков токенов в секунду. Модели на 30 миллиардов идут уже с трудом, частично выгружаясь в оперативную память, и скорость падает в разы. То, что вы видели в ролике, ровно этот случай: 70 миллиардов на домашней карте живут только за счёт выгрузки, отсюда и слово в секунду.
На что смотреть по факту. Ориентируйтесь на размер файла модели: он должен быть примерно на пару гигабайт меньше вашей видеопамяти, чтобы осталось место под контекст. Квантование Q4 и Q5 считается разумным компромиссом между качеством и размером, ниже Q4 модель заметно глупеет.
Чем запускать. Есть готовые оболочки, которые сами скачивают модель и поднимают её локально, без возни с командной строкой, и есть серверные варианты для тех, кому нужен API на своей машине. Для ваших задач хватит оболочки.
Важно: 32 гигабайта оперативной памяти дадут запас под контекст и под выгрузку, но ускорить генерацию они не могут, считает всё равно видеокарта. И ещё: дообученные версии открытых моделей, которые энтузиасты собирают на своих наборах данных, обычно уступают базовым в качестве рассуждений, хотя выглядят покладистее. Разница видна на длинных текстах.
Лучший ответ
4o-mini
4o-mini
Самая мощная локальная нейросеть?
Что проверить перед запуском: