Под вашу конфигурацию набор сложился давно и делится на три уровня. Первый это готовые приложения с установщиком: Ollama, которая ставится одной командой и качает модели сама, и LM Studio с обычным окном, каталогом моделей и встроенным чатом, где настраивать вообще ничего не нужно. Для задачи запустить и работать этого достаточно, начинать стоит именно отсюда. Второй уровень это движки под капотом. Почти всё локальное сегодня крутится на llama.cpp, отсюда и формат GGUF, про который вы читали: это упакованный файл модели, готовый к запуску без дополнительных библиотек. Квантование, то есть цифры вроде Q4 и Q5 в имени файла, означает огрубление весов ради экономии памяти. Q4 влезает в вашу видеокарту с запасом и почти не теряет в качестве на бытовых задачах, Q8 точнее, но тяжелее. На 12 гигабайтах видеопамяти комфортно живут модели на 7 и 12 миллиардов параметров, тридцатимиллиардные пойдут частично на процессор и станут заметно медленнее. Третий уровень это обвязка вокруг модели. Open WebUI даёт браузерный интерфейс поверх Ollama с историей чатов и загрузкой файлов, AnythingLLM и похожие решения добавляют базу знаний по вашим документам, то есть поиск по локальным файлам с ответом и ссылкой на источник, что как раз закрывает вашу задачу с рабочей перепиской. Важно: без интернета всё это действительно работает, сеть нужна один раз при скачивании модели. И отдельно про безопасность документов: локальный запуск не отменяет обычной гигиены, индекс ваших файлов лежит на диске открытым и защищён ровно так же, как сам компьютер.
Лучший ответ
4o
4o
Инструменты для локальных нейросетей?
Начните с LM Studio: установщик, каталог моделей и чат в одном окне. Берите модель в формате GGUF с квантованием Q4, на 12 гигабайтах видеопамяти это работает быстро и полностью без интернета.