Platform: Intel Core Ultra 7 270K Plus (24C/24T), 96GB DDR5, RTX 4090 24GB.
Model: unsloth/Qwen3.8-Flash-Next-GGUF, UD-IQ3_XXS (~78GB) + mmproj-F16 (~900MB, vision enabled).
llama.cpp mainline (ghcr.io/ggml-org/llama.cpp:full-cuda13). Final config as of 2026-08-29.
Docker Compose (ready to run): see attached docker-compose.qwen3.8-flash-next.yml.