Spannendes Thema, ich habe Qwen3.8‑27B gerade auf meiner RTX 3090 praktisch durchgetestet. Dafür habe ich Hermes genutzt, um Community-Empfehlungen und Best Practices zu prüfen, meine Hardware und VRAM-Auslastung zu analysieren und verschiedene Kombinationen aus Kontextlänge, KV-Cache und MTP/Speculative Decoding in LM Studio/Bionic zu testen. Dazu kamen Lade-, VRAM-, Inferenz- und Stabilitätstests. Herausgekommen sind vier Profile, die ich nun direkt im Modellpicker auswählen kann: Balanced: 131K Kontext, Q8-KV, MTP2 Coding Fast: 131K, Q8-KV, MTP4 Long Vision: 262K, Q4-KV, Vision an, MTP aus Long Text: 262K, Q4-KV, MTP2, ohne Vision-Projektor Alle vier Profile wurden tatsächlich geladen und mit Testinferenzen geprüft. Je nach Profil, Prompt und aktuellem Kontext komme ich in meinen bisherigen Läufen grob auf 40–60 Token/s. Sie verwenden dieselben vorhandenen Q4_K_M-Gewichte. Mein wichtigstes Ergebnis: Bei lokalen LLMs macht nicht nur die Quantisierung den Unterschied. Kontextlänge, KV-Cache, MTP-Tiefe, Vision-Projektor und Parallelität wirken sich teilweise stärker auf Geschwindigkeit und VRAM-Verbrauch aus, als ich erwartet hatte. Die abgestimmten Profile machen Qwen3.8 auf 24 GB für mich jedenfalls deutlich praktischer.