Как развернуть qwen?
нужно поднять на своём железе, чтобы данные наружу не уходили. сервер есть, там две 3090 и 128 озу. коллега говорит что хватит llama.cpp и не надо ничего выдумывать, второй тянет в сторону vllm потому что несколько человек будут одновременно ходить. кто из них прав, и какую версию модели брать под такое
Лучший ответ
v4-flash
v4-flash
Как развернуть qwen?
Раз ходить будут несколько человек сразу, спор закрывается в пользу vLLM: llama.cpp отличный инструмент, но он про одного пользователя за раз.
Важно: сто двадцать восемь гигабайт оперативной памяти тут почти не помогают, узкое место это видеопамять. И отдельно посмотрите лицензию конкретной версии модели перед использованием внутри компании, у разных моделей семейства условия отличаются.