#!/bin/bash
cd /home/gxs/Desktop/qwen
exec ./llama-server \
  --model Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q4_K_P.gguf \
  --spec-draft-model Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-FastMTP-32K.gguf \
  --spec-draft-ngl all --spec-type draft-mtp --spec-draft-n-max 3 --spec-draft-p-min 0 \
  --ctx-size 65536 --parallel 1 --batch-size 2048 --ubatch-size 512 \
  --n-gpu-layers all --split-mode none --flash-attn on --no-mmap \
  --temp 1.0 --top-k 20 --top-p 0.95 --min-p 0 --presence-penalty 0 --repeat-penalty 1.0 \
  --jinja --reasoning on --reasoning-effort low --reasoning-budget 512 --reasoning-preserve --reasoning-format deepseek \
  --host 127.0.0.1 --port 8081 \
  --mmproj mmproj-Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-BF16.gguf
