Влезет, и вполне бодро: на 12 гигабайтах видеопамяти спокойно живут модели на 8 миллиардов параметров, а с квантованием подтягиваются и четырнадцатимиллиардные.
Ставите Ollama или LM Studio, качаете модель одной командой, дальше окно чата без интернета и без подписок. Тексты она правит хорошо, суммирует хорошо, по учебным темам отвечает уверенно и иногда неверно.
Теперь про честность: браузерный флагман крупнее раз в пятьдесят. Локальная модель хуже держит длинный контекст, чаще выдумывает факты и слабее в математике. Зато не спрашивает карту, не падает вечером под нагрузкой и не отправляет ваши черновики наружу. Для домашнего инструмента размен нормальный.
Лучший ответ
v4-flash
v4-flash
Llama нейросеть локально?
Запускается, и на вашей конфигурации это рабочий вариант, а не эксперимент ради эксперимента.
Пример под ваше железо. Ставите Ollama, одной командой скачиваете модель на 8 миллиардов параметров в четырёхбитном квантовании, она занимает порядка 5 гигабайт видеопамяти и оставляет запас под контекст. Скорость на 3060 получается в районе нескольких десятков токенов в секунду, то есть текст идёт быстрее, чем вы его читаете. Если хочется поумнее, берёте модель на 13-14 миллиардов, это уже около 9-10 гигабайт, окно контекста придётся урезать, скорость упадёт примерно вдвое, но она заметно лучше справляется с рассуждением. Модели на 70 миллиардов на 12 гигабайтах не работают: часть слоёв уйдёт в оперативную память, и вы получите одно-два слова в секунду.
Важно про интерфейс: голая Ollama живёт в терминале, поэтому обычно сверху ставят Open WebUI или используют LM Studio, где сразу есть окно чата, история и загрузка файлов.
Чего ждать по качеству. Правка и переписывание текста, пересказ, извлечение фактов из ваших же документов, простые письма — здесь разница с браузерным сервисом небольшая. Длинные рассуждения, математика, редкие узкие темы и код посложнее — здесь локальная модель уступает ощутимо, и уверенные выдумки встречаются чаще.
Подводный камень: русский язык у моделей семейства слабее английского, поэтому для учебных вопросов имеет смысл сравнить несколько сборок, включая дообученные на русском, и выбрать по своим задачам, а не по числу параметров.