Administrator
发布于 2026-08-28 / 20 阅读
1
1

用llama.cpp本地部署qwen3.8-27b unsloth版

  1. hugging face 下载 unsloth版本的gguf文件 合适的对应大小 下载

  2. 下载mmproj文件(图像解码)

  3. 安装llama.cpp

  4. 安装cuda补丁

  5. 在llama.cpp文件夹里新建models文件夹

  6. 配置启动文件

@echo off
chcp 65001 >nul
title 5080 Launcher

set LLAMA=llama-server.exe

:MENU
cls
echo =======================================================
echo          5080 Local LLM VLM Launcher
echo =======================================================
echo.
echo 1. Run Qwen3.5 9B UD Q8_K_XL (Port 1234)
echo 2. Run QWEN36       (Port 1237)
echo 3. Run Holo 3.1 9B VLM       (Port 1235)
echo 0. Exit
echo.
set /p CHOICE=Please choose (0-3): 

if "%CHOICE%"=="1" goto QWEN9B
if "%CHOICE%"=="2" goto QWEN36
if "%CHOICE%"=="3" goto HOLO9B
if "%CHOICE%"=="0" exit
goto MENU

:QWEN9B
cls
echo [5080 全面解除封印] 正在以满血暴风性能模式加载 Qwen3.5 9B UD...
"%LLAMA%" ^
-m models\Qwythos-9B-Claude-Mythos-5-1M-BF16.gguf ^
--mmproj models\mmproj-Qwythos-9B-Claude-Mythos-5-1M-F16.gguf ^
-np 1 ^
-c 24576 ^
--flash-attn on ^
--no-kv-offload ^
--numa distribute ^
--threads 8 ^
--host 127.0.0.1 ^
--port 1234 ^ 
--api
pause
goto MENU

:QWEN36
cls
echo Loading Holo 3.1 4B VLM on Port 1237...
"%LLAMA%" ^
-m models\Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ4_NL.gguf ^
--mmproj models\mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf^
   -c 128000 ^
   --image-min-tokens 1024 ^
   --no-mmap ^
   --host 127.0.0.1 ^
   --port 1237

pause
goto MENU

:HOLO9B
cls
echo Loading Holo 3.1 9B VLM on Port 1235...
"%LLAMA%" ^
-m models\Holo-3.1-9B.Q8_0.gguf ^
--mmproj models\Holo-3.1-9B.mmproj-q8_0.gguf ^
-ngl 999 ^
-c 24576 ^
--cache-type-k q8_0 ^
--cache-type-v q8_0 ^
--temp 0.2 ^
--top-p 0.9 ^
--host 127.0.0.1 ^
--port 1235
pause
goto MENU

:DUAL_MODE
cls
echo Loading Both Models (Qwen3.5 9B at 1234, Holo 4B at 1235)...
echo Please keep this window open.
start /b "" "%LLAMA%" -m models\Qwen3.5-9B-UD-Q8_K_XL.gguf -ngl 999 -c 16384 --flash-attn on --host 127.0.0.1 --port 1234
timeout /t 3 >nul
start /b "" "%LLAMA%" -m models\holo-4b.gguf --mmproj models\holo-4b-mmproj.gguf -ngl 999 -c 8192 --host 127.0.0.1 --port 1235
pause
goto MENU


评论