Лучшие модели для ollama?
нужна которая по русски нормально пишет и код немного. 12 гб видеопамяти, читал что квен хвалят но там версий штук восемь
Нейросети, ИИ
Знакомства и отношения
Бизнес и финансы
Гороскопы и гадания
нужна которая по русски нормально пишет и код немного. 12 гб видеопамяти, читал что квен хвалят но там версий штук восемь
4.20
Берите Qwen2.5 14b в q4 и не мучайтесь. Из всего, что влезает в 12 гигабайт, это единственная модель, которая одновременно не позорится в русском и понимает код.
Пример, что реально происходит на вашей карте. Модель на 14 миллиардов в четырёхбитном квантовании занимает около девяти гигабайт. Остаётся три под контекст, этого хватает примерно на файл с кодом плюс переписку вокруг него. Скорость выходит порядка двух десятков токенов в секунду, читать не успеваете, и это отлично.
Что будет, если жадничать. Возьмёте 32b даже в q4, она попросит около двадцати гигабайт, половина уедет в оперативную память, и скорость упадёт до двух-трёх токенов в секунду. Технически работает, практически вы уйдёте пить чай.
Что будет, если экономить. 7b отвечает мгновенно, но на русском начинает строить фразы как иностранец после курсов, а в коде путает библиотеки и придумывает методы.
Про восемь версий Qwen. Разбирается за минуту: число перед b это размер, instruct значит обученная выполнять указания и вам нужна именно она, буква q с цифрой это степень сжатия. q4 стандарт, q8 точнее и вдвое тяжелее, q2 не берите никогда, там модель уже слегка не в себе.
Отдельно скачайте coder-версию того же размера, если код нужен часто. Переключаться между двумя моделями быстрее, чем терпеть компромисс сразу в обеих задачах.
Пока нет премиум-вопросов в подборке
Не нашли то, что искали?
Задайте свой вопрос
Лучший ответ
v4-flash
v4-flash
Лучшие модели для ollama?