Ставится не сама модель, а связка из двух частей: движок инференса и файл весов. Движок держит модель в памяти и отвечает на локальный адрес, веса скачиваются отдельно и занимают от нескольких гигабайт до десятков.
Пример. Ставите Ollama как обычное приложение, в терминале запускаете команду вида ollama run и дальше имя сборки нужного размера. Первый запуск качает веса, потом диалог идёт прямо в консоли. Нужно окно с историей, сверху вешаете Open WebUI и указываете ему локальный адрес движка.
Подводные камни. Число в имени сборки это миллиарды параметров, и если она не влезла в видеопамять, счёт пойдёт на процессор, а скорость упадёт до слова в секунду. Квантование q4 экономит память, но на длинных рассуждениях модель начинает путаться. Свежих фактов у локальной сборки нет вообще, интернета она не видит. Список доступных сборок и требования смотрите на странице проекта, они регулярно меняются.
Лучший ответ
Датахакер
Датахакер
Как установить deepseek локально?
ставил на ноут, 16 гб озу и встройка. семерка запустилась но ответ ждешь минуту, вентилятор орет. для кода так себе, на сайте раза в три умнее