Activity
Mon
Wed
Fri
Sun
Sep
Oct
Nov
Dec
Jan
Feb
Mar
Apr
May
Jun
Jul
Aug
What is this?
Less
More
Web Dev & AI

64 members • Free

1 contribution to Web Dev & AI
Meine Learnings zu lokalen LLMs
Mal sehen wie viele Videos ich darüber machen kann, aber es sehr viele Parameter, an denen man drehen und das Ergebnis und die Geschwindigkeit optimieren kann.
Spannendes Thema, ich habe Qwen3.8‑27B gerade auf meiner RTX 3090 praktisch durchgetestet. Dafür habe ich Hermes genutzt, um Community-Empfehlungen und Best Practices zu prüfen, meine Hardware und VRAM-Auslastung zu analysieren und verschiedene Kombinationen aus Kontextlänge, KV-Cache und MTP/Speculative Decoding in LM Studio/Bionic zu testen. Dazu kamen Lade-, VRAM-, Inferenz- und Stabilitätstests. Herausgekommen sind vier Profile, die ich nun direkt im Modellpicker auswählen kann: Balanced: 131K Kontext, Q8-KV, MTP2 Coding Fast: 131K, Q8-KV, MTP4 Long Vision: 262K, Q4-KV, Vision an, MTP aus Long Text: 262K, Q4-KV, MTP2, ohne Vision-Projektor Alle vier Profile wurden tatsächlich geladen und mit Testinferenzen geprüft. Je nach Profil, Prompt und aktuellem Kontext komme ich in meinen bisherigen Läufen grob auf 40–60 Token/s. Sie verwenden dieselben vorhandenen Q4_K_M-Gewichte. Mein wichtigstes Ergebnis: Bei lokalen LLMs macht nicht nur die Quantisierung den Unterschied. Kontextlänge, KV-Cache, MTP-Tiefe, Vision-Projektor und Parallelität wirken sich teilweise stärker auf Geschwindigkeit und VRAM-Verbrauch aus, als ich erwartet hatte. Die abgestimmten Profile machen Qwen3.8 auf 24 GB für mich jedenfalls deutlich praktischer.
@Stephan Haewß Nein, vermutlich nicht. Ich habe dafür zwei lokale virtuelle model.yaml-Profile angelegt: - Das Vision-Profil verweist auf das ursprüngliche Modellverzeichnis mit Haupt-GGUF und mmproj-Datei. - Das Text-Profil verweist auf eine lokale Basis, die nur das Haupt-GGUF enthält. Dafür habe ich einen NTFS-Hardlink verwendet, also keine zweite 16,8-GB-Kopie. Dadurch kann die Vision-Datei an ihrem ursprünglichen Ort bleiben. Im Modellpicker erscheinen trotzdem zwei getrennte Einträge, einmal mit und einmal ohne Vision-Projektor.
1-1 of 1
Rodebert Echosommer
1
3 points to level up
@rodebert-echosommer-5336
Surrender to change or suffer in a loop

Active 14h ago
Joined Aug 26, 2026