Alibaba Qwen
Tongyi Qianwen · Qwen-7B · Qwen1.5 · Qwen2/2.5 · QwQ · Qwen3 · Coder · VL · Omni · TTS · Image · Qwen3.5/3.6/3.7/3.8 · Qwen Code · Agent · Robotik
Stand: September 2026
Qwen ist 2026 eines der breitesten offenen KI-Ökosysteme überhaupt. Aus Qwen-7B und Tongyi Qianwen von 2023 entstanden innerhalb von drei Jahren dichte und Mixture-of-Experts-Sprachmodelle, Reasoning, Coding, Vision, Audio, Omni-Modelle, TTS, Bildgenerierung, Embeddings, Reranker, Robotik und komplette Agentenwerkzeuge.
Die technische Hauptlinie führt von Qwen1.5 → Qwen2 → Qwen2.5 → QwQ → Qwen3 mit Hybrid Thinking → Qwen3-Next → Qwen3.5/3.6/3.7 → Qwen3.8. Parallel entstanden spezialisierte Familien wie Qwen3-Coder, Qwen3-VL, Qwen3-TTS und Qwen-Image.
Der aktuelle Endpunkt am 1. September 2026 ist besonders interessant: Qwen3.8-Max bildet die Cloud-Spitzenklasse und wurde erstmals auch als sehr großes offenes Max-Modell veröffentlicht; Qwen3.8-27B ist die handlichere offene multimodale Klasse. Qwen3.8-Flash-Next vom 26. August ist dagegen ausdrücklich eine offene Architekturvorschau auf Qwen4 – noch kein vollständiger Qwen4-Release.
System Diagnostic
- Qwen-7B
- Qwen1.5
- Qwen2
- Qwen2.5
- QwQ
- Qwen3
- Qwen3-Coder
- Qwen3-VL
- Qwen3-Embedding
- Qwen3-TTS
- Qwen-Image
- Qwen3.5
- Qwen3.6
- Qwen3.7
- Qwen3.8-Max
- Qwen3.8-27B
- Qwen3.8-Flash-Next
- Qwen Code
- Qwen-Agent
- EU Model Studio
Schnellzugriff
Qwen-Zeitlinie
- 03.08.2023Qwen-7B und Qwen-7B-Chat werden offen veröffentlicht.
- 22.08.2023Qwen-VL bringt Bildverständnis und Grounding.
- 25.09.2023Qwen-14B und Qwen-Agent.
- 30.11.2023Qwen-72B, Qwen-1.8B und Qwen-Audio.
- 04.02.2024Qwen1.5 mit stark verbesserter Open-Weight-Developer-Erfahrung.
- 07.06.2024Qwen2: mehr Sprachen, MoE und bis 128K Kontext.
- 09.08.2024Qwen2-Audio.
- 19.09.2024Qwen2.5 mit General-, Coder- und Math-Modellen.
- 11/2024QwQ-32B-Preview startet die offene Reasoninglinie.
- 26.01.2025Qwen2.5-VL.
- 27.03.2025Qwen2.5-Omni mit Thinker/Talker.
- 29.04.2025Qwen3 mit Hybrid Thinking.
- 05.06.2025Qwen3-Embedding und Reranker.
- 22.07.2025Qwen3-Coder und Qwen Code.
- 11.09.2025Qwen3-Next als Architekturbrücke.
- 22.09.2025Qwen3-VL.
- 25.01.2026Qwen3-Max-Thinking.
- 02/2026Qwen3.5 und Qwen-Image-2.0.
- 04/2026Qwen3.6-Plus, 35B-A3B und 27B.
- 05–07/2026Qwen3.7; Qwen-VLA; Robot Suite; AgentWorld; Qwen-Image-3.0.
- 02.08.2026Qwen3.8-Max.
- 12.08.2026Qwen3.8-2.4T-A95B wird offen veröffentlicht.
- 14.08.2026Qwen3.8-27B wird offen veröffentlicht.
- 26.08.2026Qwen3.8-Flash-Next als offene Qwen4-Architekturvorschau.
1. Qwen ist Modellfamilie, Forschungsprojekt, Consumer-Assistent und Cloudplattform
Qwen bezeichnet 2026 nicht nur ein Sprachmodell. Der Name umfasst offene und proprietäre Foundation-Modelle, multimodale Spezialmodelle, Qwen Studio, Qwen Code, Qwen-Agent und die Bereitstellung über Alibaba Cloud Model Studio beziehungsweise QwenCloud.
Bei jeder technischen Aussage müssen Modell, Checkpoint, Produktoberfläche, Cloudregion, API-Endpunkt, Agentenharness und lokale Runtime getrennt benannt werden.
2. Tongyi Qianwen als ursprünglicher Markenname
Qwen ist die international gebräuchliche Kurzform der Alibaba-Modellfamilie, die ursprünglich als Tongyi Qianwen beziehungsweise 通义千问 bekannt wurde.
Historische Quellen und frühe Lizenzen verwenden deshalb teilweise andere Produktnamen als heutige Qwen-Seiten.
3. Alibaba Group und Alibaba Cloud
Die Qwen-Modelle werden vom Qwen Team innerhalb des Alibaba-Ökosystems entwickelt und über Alibaba Cloud kommerziell bereitgestellt.
Offene Modellgewichte und Alibaba-Cloud-Dienste sind technisch und vertraglich getrennte Ebenen.
4. Alibaba Cloud Model Studio
Model Studio ist die Cloudplattform für Qwen und weitere Drittmodelle.
Sie bietet API-Zugriff, Fine-Tuning, Deployment, Evaluierung, Regionen, Workspaces und OpenAI-kompatible Schnittstellen.
5. Qwen Studio
Qwen Studio ist die Endnutzeroberfläche für Chat, multimodale Aufgaben, Bilder, Deep Research und weitere Qwen-Funktionen.
Qwen Studio darf nicht mit Alibaba Cloud Model Studio verwechselt werden.
6. QwenCloud
Neuere Qwen-Dokumentation verwendet QwenCloud als Entwickler- und API-Marke für Qwen-Modelle.
Historische DashScope-/Model-Studio-Endpunkte bleiben für bestehende Integrationen relevant.
7. DashScope
DashScope ist der etablierte Alibaba-API-Pfad für Qwen-Modelle und weitere generative Dienste.
Die genaue Base-URL hängt von Region und Bereitstellungsscope ab.
8. Offene Gewichte als Kernstrategie
Qwen veröffentlicht seit Qwen-7B regelmäßig Modellgewichte auf Hugging Face und ModelScope.
Nicht jede Qwen-Variante ist jedoch offen; Max- und Plus-Modelle waren lange proprietäre Cloudmodelle.
9. Proprietäre Qwen-Modelle
Qwen-Max, Qwen-Plus und manche Cloudvarianten existieren als gehostete Modelle ohne vollständig veröffentlichte Gewichte.
Ein API-Modellname darf daher nicht automatisch als herunterladbarer Checkpoint behandelt werden.
10. Lizenz ist Teil der Modellidentität
Qwen-Generationen verwenden unterschiedliche Lizenzmodelle.
Viele neuere offene Modelle nutzen Apache 2.0, während einzelne Größen oder Max-Releases eigene Qwen-Lizenzen besitzen.
11. Modell ≠ Produkt
Qwen3.8-Max kann in Qwen Studio oder API genutzt werden; Qwen Studio ergänzt jedoch Websuche, Dateien, Bildfunktionen, Deep Research und andere Produktwerkzeuge.
Ein lokal geladenes Qwen3.8-Modell besitzt diese Produktoberfläche nicht automatisch.
12. Modell ≠ Agent
Qwen Code, Qwen-Agent und QwenWork kombinieren Modelle mit Tools, Speicher, Dateisystem, MCP oder Subagenten.
Agentenleistung hängt deshalb genauso vom Harness wie vom Foundation-Modell ab.
13. Modell ≠ Websuche
Websuche liefert aktuelle externe Informationen zur Laufzeit.
Ein lokales Qwen-Modell hat ohne Searchtool keinen garantierten Zugriff auf aktuelle Webseiten.
14. Kontext ≠ dauerhaftes Gedächtnis
Ein 1M-Kontextfenster ist temporärer Inferenzkontext.
Persistentes Projektwissen oder gespeicherte Chats sind Produktschichten.
15. Qwen ist stark multimodal diversifiziert
Die Modellfamilie umfasst Text, Bild- und Videoverständnis, Audio, Sprache, TTS, Bildgenerierung, Embeddings, Reranker, Robotik und Vision-Language-Action.
Diese Spezialmodelle werden getrennt von der allgemeinen Qwen-LLM-Hauptlinie archiviert.
16. Aktueller Stand am 1. September 2026
Der aktuelle Spitzenbereich umfasst Qwen3.8-Max, Qwen3.8-27B, Qwen3.8-Flash sowie Qwen3.8-Flash-Next als offene Architekturvorschau Richtung Qwen4.
Parallel bleiben Qwen3.7, Qwen3.6, Qwen3.5, Qwen3-Coder, Qwen3-VL, Qwen3-TTS, Qwen-Image und spezialisierte Retrieval-/Robotiklinien relevant.
17. 3. August 2023: Qwen-7B und Qwen-7B-Chat
Alibaba veröffentlichte Qwen-7B als ersten öffentlich verfügbaren Qwen-Sprachmodellcheckpoint und Qwen-7B-Chat als menschlich ausgerichtete Variante.
Dieser Release ist der Beginn der offenen Qwen-Modellgeschichte.
18. Qwen-7B Pretraining
Der ursprüngliche Qwen-7B-Checkpoint wurde auf mehr als 2,2 Billionen Tokens vortrainiert.
Spätere Revisionen erweiterten Datenmenge und Kontext.
19. Qwen-7B-Chat
Die Chatvariante wurde auf kuratierten Aufgaben-, Safety- und Service-Daten ausgerichtet.
Base und Chat sind unterschiedliche Checkpoints.
20. Früher Kontext
Der erste Qwen-7B-Stand startete mit wesentlich kürzerem Kontext und wurde später auf längere Fenster erweitert.
Historische Benchmarks müssen deshalb die konkrete Revision nennen.
21. Tool Use
Schon die erste Qwen-Linie experimentierte mit Toolnutzung und Search-/Service-orientierten Daten.
Agenten waren damit kein erst 2025 nachträglich angefügtes Thema.
22. August 2023: Int4
Qwen veröffentlichte früh quantisierte Chatmodelle für deutlich geringeren Speicherbedarf.
Quantisierung wurde dadurch zu einem festen Bestandteil der Qwen-Developerstrategie.
23. 22. August 2023: Qwen-VL
Qwen-VL und Qwen-VL-Chat erweiterten Qwen-7B um Bildverständnis, Textlesen und Grounding.
Die Modelle konnten Bild und Text verarbeiten sowie Bounding-Box-Bezüge ausgeben.
24. 448-Pixel-Bildpfad
Qwen-VL nutzte gegenüber vielen damaligen offenen Visionmodellen eine höhere visuelle Auflösung.
Das verbesserte insbesondere OCR und feingranulare Dokumentfragen.
25. Visual Grounding
Qwen-VL gehörte früh zu den allgemeinen Modellen, die sprachlich beschriebene Objekte in Bildern lokalisieren konnten.
Grounding ist eine andere Fähigkeit als bloße Bildbeschreibung.
26. Mehrere Bilder
Qwen-VL-Chat unterstützt Gespräche über mehrere Bilder.
Das erlaubt Vergleiche und visuelle Storylines, erhöht aber den Kontextbedarf.
27. 25. September 2023: Qwen-14B
Qwen-14B und Qwen-14B-Chat erweiterten die offene Sprachmodellreihe auf eine mittlere Größe.
Der Release fiel mit neuen Entwicklerwerkzeugen zusammen.
28. 25. September 2023: Qwen-Agent
Qwen-Agent entstand als Framework für Tool Use, Planung, Memory und spätere RAG-/MCP-Anwendungen.
Das Framework wurde langfristig Backend und Referenzpfad für agentische Qwen-Anwendungen.
29. qwen.cpp
Parallel entstand eine lokale C++-Inferenzlinie.
Sie war ein frühes Signal für die starke lokale Qwen-Community.
30. Oktober 2023: Int8
Qwen ergänzte Int8-Quantisierungen für 7B und 14B.
Qwen bot damit mehrere Hardware-/Qualitätsstufen an.
31. 30. November 2023: Qwen-72B
Qwen-72B und Qwen-72B-Chat wurden als große offene Textmodelle veröffentlicht.
Sie wurden auf rund drei Billionen Tokens trainiert und unterstützen 32K Kontext.
32. 30. November 2023: Qwen-1.8B
Mit 1.8B erschien zugleich ein sehr kleines Qwen-Modell.
Die Spannweite von 1.8B bis 72B machte die Familie für Edge, Forschung und Server gleichermaßen interessant.
33. Stärkere Systemprompts
Qwen-72B-Chat und Qwen-1.8B-Chat erhielten verbesserte Systemprompt-Unterstützung.
Systemprompt-Fähigkeit ist für Agenten und anwendungsspezifische Rollen wesentlich.
34. 30. November 2023: Qwen-Audio
Qwen-Audio übertrug Qwen auf Sprache, Musik, Geräusche und weitere Audiosignale.
Das Basismodell nutzte Qwen-7B als Sprachkomponente und Whisper-large-v2 als Audioencoder.
35. Mehr als 30 Audioaufgaben
Qwen-Audio wurde als Multi-Task-Audio-Language-Modell trainiert.
Speech Recognition, Sound Understanding, Music und Audio Question Answering teilen sich eine Modellarchitektur.
36. Qwen-Audio-Chat
Die Chatvariante ermöglicht mehrturnige Audio-/Textinteraktion.
Audioverständnis und Sprachsynthese sind dabei noch getrennt; Qwen-Audio gibt Text aus.
37. Qwen Ende 2023
Ende 2023 existieren bereits Textmodelle, Vision, Audio, Quantisierung, lokale Inferenz und ein Agentenframework.
Viele Themen der späteren Qwen3.x-Generation sind damit schon in Grundform vorhanden.
38. 4. Februar 2024: Qwen1.5
Qwen1.5 modernisierte Modellqualität und vor allem die Developer Experience.
Die Modelle wurden direkt in Hugging Face Transformers integriert, sodass `trust_remote_code` für normale Nutzung entfiel.
39. Qwen1.5-Größen
Die Reihe deckte 0.5B, 1.8B, 4B, 7B, 14B, 32B, 72B und später 110B ab.
Zusätzlich erschien eine MoE-Variante.
40. 0.5B
Qwen1.5-0.5B war ein extrem kleines allgemeines Modell.
Solche Größen sind für Edgeexperimente und Distillation nützlich.
41. 1.8B
Qwen1.5-1.8B setzte die kleine Qwen-Linie fort.
Leistung und Hardwarebedarf liegen weit unter den großen Serverklassen.
42. 4B
Qwen1.5-4B schloss die Lücke zwischen Kleinmodellen und 7B.
Diese Größenklasse wurde später auch bei Qwen3 wieder strategisch wichtig.
43. 7B
Qwen1.5-7B war der direkte Nachfolger der ursprünglichen Qwen-7B-Linie.
Die verbesserte Tokenisierung und Trainingserfahrung machte ihn deutlich einfacher integrierbar.
44. 14B
14B blieb eine wichtige lokale Workstationgröße.
Sie war groß genug für robuste allgemeine Aufgaben, aber wesentlich handlicher als 72B.
45. 2. April 2024: Qwen1.5-32B
Qwen veröffentlichte 32B als bewussten Sweet Spot zwischen Qualität und Speicherbedarf.
Die 30B-Klasse wurde später zu einer der beliebtesten Größen für lokale High-End-Systeme.
46. 72B
Qwen1.5-72B war die starke große offene dense Klasse.
Sie blieb Hardwareintensiv, aber im Vergleich zu späteren 200B+-MoE-Modellen übersichtlicher.
47. Qwen1.5-110B
Mit 110B überschritt Qwen erstmals 100 Milliarden Parameter in dieser Generation.
Der Release demonstrierte klassisches Scaling ohne grundlegende Rezeptänderung.
48. Qwen1.5-MoE
Qwen1.5 experimentierte zusätzlich mit Mixture-of-Experts.
MoE wird in Qwen3 und späteren Generationen wesentlich wichtiger.
49. Kontextlängen
Mehrere Qwen1.5-Modelle unterstützen deutlich längere Kontexte als die frühesten 2023er Checkpoints.
Kontextunterstützung bleibt modellgrößen- und revisionsabhängig.
50. GPTQ
Offizielle GPTQ-Quantisierungen wurden bereitgestellt.
GPTQ ist ein Post-Training-Quantisierungsverfahren für geringeren VRAM-Bedarf.
51. AWQ
Qwen bot zusätzlich AWQ-Quantisierungen.
AWQ versucht Aktivierungsstatistiken zu nutzen, um wichtige Gewichte bei niedriger Bitbreite besser zu erhalten.
52. GGUF
Qwen1.5 unterstützte offiziell das GGUF-/llama.cpp-Ökosystem.
Das machte die Familie auf CPUs, Macs und Consumer-PCs leichter zugänglich.
53. Native Transformers-Unterstützung
Qwen1.5 wurde in Transformers ab Version 4.37 direkt unterstützt.
Das reduziert Supply-Chain-Risiken gegenüber automatisch ausgeführtem Repositorycode.
54. vLLM und SGLang
Qwen1.5 wurde von verbreiteten Serverframeworks unterstützt.
Qwen positionierte sich damit nicht nur als Modell, sondern als gut integrierbarer Open-Weight-Stack.
55. Lokale Nutzung wird Mainstream
Qwen1.5 war eine der Generationen, bei denen lokale Qwen-Nutzung mit Ollama, llama.cpp und LM Studio breiter praktikabel wurde.
Die konkrete Quantisierung bestimmt Geschwindigkeit und Qualität.
56. 7. Juni 2024: Qwen2
Qwen2 brachte eine neue Hauptgeneration mit offenen Base- und Instruct-Modellen.
Die Familie umfasste sowohl dichte Modelle als auch ein MoE-Modell.
57. Qwen2-Größen
Qwen2 erschien als 0.5B, 1.5B, 7B, 57B-A14B und 72B.
57B-A14B ist ein Mixture-of-Experts-Modell mit 14B aktivierten Parametern.
58. 27 zusätzliche Sprachen
Qwen2 wurde auf deutlich breitere Mehrsprachigkeit ausgerichtet.
Die zusätzliche Sprachabdeckung kam zu Englisch und Chinesisch hinzu.
59. Besseres Coding
Qwen2 verbesserte Codegenerierung und Codeverständnis gegenüber Qwen1.5.
Später spezialisierte Qwen2.5-Coder diese Linie weiter.
60. Bessere Mathematik
Mathematische Fähigkeiten wurden bereits im allgemeinen Qwen2 ausgebaut.
Qwen2.5-Math folgte als Spezialfamilie.
61. Bis zu 128K Kontext
Qwen2-7B-Instruct und Qwen2-72B-Instruct unterstützen bis zu 128K Kontext.
Lange Kontexte bleiben abhängig von Servingframework und Speicher.
62. Qwen2-57B-A14B
Das MoE-Modell kombiniert große Gesamtparameter mit deutlich weniger aktiven Parametern pro Token.
Die Architektur nimmt die später sehr starke Qwen-MoE-Linie vorweg.
63. Qwen2-72B
72B bleibt als große dense Modellklasse erhalten.
Die Familie bietet damit dense und MoE als alternative Effizienzpfade.
64. Tokenizer und Mehrsprachigkeit
Qwen2 nutzt einen breit ausgelegten Tokenizer für mehrsprachige und technische Inhalte.
Tokenizerwahl beeinflusst Kontextkosten und Sprachökonomie.
65. Instruct statt Chat
Die Benennung bewegt sich stärker von `Chat` zu `Instruct`.
Das reflektiert den Branchentrend zu allgemeinen instruktionstauglichen Checkpoints.
66. Tool Use
Qwen2-Instruct bleibt für Function Calling und agentische Workflows nutzbar.
Qwen-Agent dient als Referenzframework.
67. Offene Lizenzen
Viele Qwen2-Modelle werden unter permissiven Lizenzen veröffentlicht.
Die konkrete LICENSE-Datei bleibt pro Modell maßgeblich.
68. Lokale Qwen2-Nutzung
Transformers, vLLM, SGLang und lokale Quantisierungen unterstützen Qwen2 schnell.
Die Developer Experience von Qwen1.5 wird damit fortgeführt.
69. Qwen2-VL
Die zweite Vision-Language-Generation erweitert visuelles Verständnis, Video und variable Bildauflösungen.
Sie wird 2025 von Qwen2.5-VL abgelöst.
70. Dynamic Resolution
Qwen2-VL verarbeitet Bilder mit dynamischer Auflösung statt starrem Einheitsraster.
Das verbessert die Balance zwischen Detail und Tokenkosten.
71. Videoverständnis
Qwen2-VL erweitert Qwen deutlich in Richtung Videoanalyse.
Temporalität und Frameauswahl werden zu eigenen Modellproblemen.
72. 9. August 2024: Qwen2-Audio
Qwen2-Audio kann Audio und Text als Eingabe verarbeiten und Text ausgeben.
Es führt Voice Chat und Audio Analysis als zwei explizite Interaktionsmodi ein.
73. Voice Chat
Sprachanweisungen können direkt verarbeitet werden, ohne dass der Nutzer erst separat eine ASR-Transkription erstellt.
Intern bleibt Sprachverständnis eine multimodale Modellfunktion.
74. Audio Analysis
Das Modell kann Audiodateien gezielt mit Textfragen analysieren.
Musik, Geräusche, Sprache und akustische Szenen sind unterschiedliche Aufgabentypen.
75. Qwen2-Audio-7B
Die offene Modellfamilie erscheint als 7B Base und Instruct.
Sie bleibt ein Audio-zu-Text-System und kein vollwertiges Speech-to-Speech-Modell.
76. Qwen2-Math
Die mathematische Speziallinie wird auf Qwen2-Basis weiterentwickelt.
Später erweitert Qwen2.5-Math Tool-Integrated Reasoning.
77. Übergang zur Coder-Spezialisierung
Qwen2 verbessert bereits Code, aber der große Spezialrelease folgt mit Qwen2.5-Coder.
Allgemeines Coding und spezialisiertes Coding bleiben getrennte Benchmarks.
78. 19. September 2024: Qwen2.5
Qwen2.5 wurde als breite offene Foundation-Modellgeneration veröffentlicht.
Qwen beschrieb den Release als besonders große Sammlung allgemeiner und spezialisierter Modelle.
79. Qwen2.5-Größen
Die allgemeine Reihe erschien als 0.5B, 1.5B, 3B, 7B, 14B, 32B und 72B.
Diese Größenabdeckung macht die Familie vom Edgegerät bis zum Mehr-GPU-Server nutzbar.
80. Qwen2.5-0.5B
0.5B ist ein sehr kleines Sprachmodell für leichte lokale Aufgaben.
Komplexes Reasoning bleibt gegenüber großen Varianten stark begrenzt.
81. Qwen2.5-1.5B
1.5B ist ein kleiner, gut quantisierbarer Checkpoint.
Diese Klasse wurde häufig für On-Device- und Distillationsexperimente genutzt.
82. Qwen2.5-3B
3B schließt die Lücke zwischen sehr kleinen und 7B-Modellen.
Die konkrete Lizenz unterscheidet sich bei Qwen2.5 teilweise nach Modellgröße.
83. Qwen2.5-7B
7B wurde zu einem der verbreitetsten Qwen2.5-Checkpoints für lokale Nutzung.
Viele Finetunes und Communityderivate bauen darauf auf.
84. Qwen2.5-14B
14B bietet mehr Kapazität bei noch relativ überschaubarem Hardwarebedarf.
Quantisiert ist die Klasse auf starken Consumerrechnern praktikabel.
85. Qwen2.5-32B
32B wird ein sehr wichtiger Sweet Spot für starke lokale Sprachmodelle.
Die Größe taucht auch bei QwQ-32B als Reasoningbasis auf.
86. Qwen2.5-72B
72B bildet die große offene dense Spitzenklasse der Generation.
Sie erfordert deutlich mehr RAM/VRAM und ist typischerweise Server- oder Workstationmaterial.
87. Mehr Wissen und längere Texte
Qwen2.5 wurde mit stärkerem Fokus auf Wissen, strukturierte Daten, Code und lange Ausgaben trainiert.
Das verbessert praktische Aufgaben wie Tabellen, JSON und Dokumente.
88. Strukturierte Ausgabe
Qwen2.5 verbessert das Folgen strukturierter Formate.
JSON- und Tabellenkonsistenz bleiben trotzdem zu validieren.
89. Lange Generierung
Die Generation wurde auf längere zusammenhängende Outputs ausgerichtet.
Lange Ausgabe erhöht das Risiko später Drift und Wiederholung.
90. Qwen2.5-Coder
Die Codingfamilie erscheint zunächst in mehreren Größen und wird später auf 32B erweitert.
Sie ist auf Programmierung, Codeverständnis und agentische Entwickleraufgaben spezialisiert.
91. Coder 1.5B
Die kleine Coder-Variante eignet sich für lokale Completion und einfache Entwicklerhilfe.
Repositoryreasoning bleibt begrenzt.
92. Coder 7B
7B bietet einen stärkeren lokalen Codingkompromiss.
FIM und Editorintegration sind zentrale Einsatzfelder.
93. Qwen2.5-Coder-32B
Die 32B-Version wird zu einem der stärksten offenen Coder ihrer Generation.
Sie dient 2025 auch als Werkzeug zur Bereinigung synthetischer Daten für Qwen3-Coder.
94. Qwen2.5-Math
Die Math-Reihe erscheint in 1.5B, 7B und 72B.
Sie fokussiert mathematische Aufgaben und Tool-Integrated Reasoning.
95. Tool-Integrated Reasoning
Qwen2.5-Math kann externe Python- oder Rechenwerkzeuge in mathematische Lösungsprozesse integrieren.
Toolresultate sind verifizierbarer als rein mental berechnete Zwischenschritte.
96. Lizenzunterschiede
Viele Qwen2.5-Modelle nutzen Apache 2.0, während einzelne Größen andere Bedingungen besitzen.
Die Modellkarte bleibt die verbindliche Quelle.
97. 26. Januar 2025: Qwen2.5-VL
Qwen2.5-VL wird in 3B, 7B und 72B als Base/Instruct veröffentlicht.
Es verbessert OCR, Diagramme, Layout, Video und visuelle Agentenaufgaben.
98. Dokumentverständnis
Qwen2.5-VL ist stark auf Text, Tabellen, Icons und Layouts in Bildern ausgerichtet.
Visuelles Dokumentverständnis ist mehr als OCR: räumliche Struktur beeinflusst Bedeutung.
99. Visual Agent
Qwen2.5-VL kann Oberflächen und visuelle Zustände als Agentenkontext verarbeiten.
Aktionen benötigen weiterhin ein externes Computer-Use-Harness.
100. Video
Das Modell versteht längere Videoabläufe besser als die vorherige Generation.
Zeitliche Ereignisse und Untertitel können gemeinsam interpretiert werden.
101. 27. März 2025: Qwen2.5-Omni
Qwen2.5-Omni vereint Text, Bilder, Audio und Video als Eingaben und erzeugt Text sowie natürliche Sprache.
Es ist der erste breit integrierte End-to-End-Omni-Pfad der Qwen-Familie.
102. Thinker
Die Omni-Architektur besitzt einen multimodalen Thinker für Wahrnehmung und Sprachmodellreasoning.
Er verarbeitet den gemeinsamen Kontext der Eingabemodalitäten.
103. Talker
Der Talker erzeugt Sprache aus hochdimensionalen Thinker-Repräsentationen.
Thinker und Talker sind eng gekoppelt statt als lose ASR→LLM→TTS-Kaskade.
104. Streaming Speech
Qwen2.5-Omni unterstützt Echtzeit-nahe Sprachausgabe.
Streaminglatenz ist eine eigene Qualitätsdimension neben Sprachqualität.
105. Qwen2.5-Omni-7B
Das offene 7B-Modell macht End-to-End-Omni-Forschung relativ zugänglich.
Hardwarebedarf bleibt höher als bei reinem Text-7B.
106. November 2024: QwQ-32B-Preview
QwQ war Qwens frühe offene Reasoninglinie vor Qwen3.
Das 32B-Modell sollte durch längere Überlegung Mathematik, Coding und logische Aufgaben verbessern.
107. QwQ
Der Name steht als eigene Reasoning-Marke neben Qwen2.5.
QwQ ist kein separater Alibaba-Produktassistent, sondern ein Modellzweig.
108. 32B dense
QwQ nutzt eine 32B-dense-Modellgröße.
Die Klasse war stark genug für anspruchsvolles Reasoning und zugleich erheblich leichter lokal betreibbar als hundertmilliardengroße MoE-Systeme.
109. Thinking
QwQ erzeugt längere interne beziehungsweise sichtbare Reasoningtraces.
Mehr Denktokens bedeuten nicht automatisch bessere Endantwort.
110. Frühe Grenzen
Previewmodelle konnten Sprache wechseln, sich wiederholen oder zu lange analysieren.
Diese Muster ähneln frühen Reasoningmodellen anderer Anbieter.
111. März 2025: QwQ-32B
Die reifere QwQ-Version verbessert Reasoning und Agentenfähigkeit.
Sie wird kurz darauf durch Qwen3s Hybrid-Thinking-Konzept strategisch überholt.
112. Agenten und Tools
QwQ wurde stärker mit Toolnutzung und agentischen Aufgaben verbunden.
Reasoningmodell und Toolharness bleiben getrennte Systeme.
113. Lokale Reasoningoption
32B machte QwQ zu einer populären lokalen Alternative zu gehosteten Reasoningmodellen.
Quantisierung und langer Reasoningoutput erhöhen den Speicher- und Zeitbedarf.
114. QwQ als Brücke zu Qwen3
Qwen3 integriert Thinking und Non-Thinking innerhalb derselben Modellfamilie.
Die getrennte QwQ-Marke wird dadurch weniger zentral.
115. 29. April 2025: Qwen3
Qwen3 führt Hybrid Thinking als zentrales Konzept ein.
Ein Modell kann zwischen ausführlicherem Reasoning und schnellerem Non-Thinking wechseln.
116. Hybrid Thinking
Thinking und Non-Thinking werden in derselben Modellfamilie unterstützt.
Das vereinfacht Anwendungen, die je nach Aufgabe Latenz gegen Denktiefe abwägen.
117. `/think` und `/no_think`
Frühe Qwen3-Chattemplates erlauben Modussteuerung über spezielle Instruktionen.
Spätere Cloudmodelle verwenden teilweise API-Parameter statt Textmarker.
118. Qwen3 offene Größen
Qwen3 erscheint als 0.6B, 1.7B, 4B, 8B, 14B, 32B sowie MoE-Modelle 30B-A3B und 235B-A22B.
Die Familie deckt vom Edge-Modell bis zum großen Frontier-MoE einen außergewöhnlich breiten Bereich ab.
119. Qwen3-0.6B
0.6B ist die kleinste Qwen3-Klasse.
Sie eignet sich für Klassifikation, Extraktion und sehr leichte lokale Assistenten.
120. Qwen3-1.7B
1.7B bietet etwas mehr Sprach- und Instruction-Kapazität.
On-Device-Experimente bleiben ein Schwerpunkt.
121. Qwen3-4B
Qwen stellte heraus, dass selbst 4B gegenüber deutlich größeren Vorgängern konkurrenzfähig sein kann.
Generationssprünge machen reine Parametervergleiche unzureichend.
122. Qwen3-8B
8B ist ein klassischer lokaler Sweet Spot.
Die Modellgröße ist für starke Consumer-GPUs und Macs besonders relevant.
123. Qwen3-14B
14B kombiniert mehr Wissen und Reasoning mit noch praktikablem Self-Hosting.
Quantisierung erweitert die Hardwareoptionen.
124. Qwen3-32B
32B bleibt die starke dense Workstationklasse.
Sie konkurriert in vielen Aufgaben mit kleineren MoE-Modellen.
125. Qwen3-30B-A3B
Das kleine MoE besitzt etwa 30B Gesamt- und 3B aktivierte Parameter.
Es ist für hohe Effizienz bei dennoch großer gespeicherter Kapazität ausgelegt.
126. Qwen3-235B-A22B
Das große Qwen3-MoE besitzt etwa 235B Gesamt- und 22B aktivierte Parameter.
Es bildet die offene Spitzenklasse des ursprünglichen Qwen3-Releases.
127. MoE als Hauptarchitektur
Qwen3 macht Mixture of Experts zu einem zentralen Skalierungspfad.
Gesamtparameter, aktive Parameter und Speicherbedarf müssen getrennt verstanden werden.
128. 119 Sprachen und Dialekte
Qwen3 erweitert die Mehrsprachigkeit stark.
Spätere Qwen3.5-Generationen erhöhen die dokumentierte Abdeckung weiter.
129. 36 Billionen Tokens
Qwen3 wurde auf einer stark vergrößerten Pretrainingmischung trainiert.
Die genaue Datenqualität und Syntheseverfahren sind ebenso wichtig wie die rohe Tokenzahl.
130. Reasoning-Post-Training
Qwen3 kombiniert lange Reasoningtraces, Reinforcement Learning und Distillation.
Reasoning wird nicht als einzelner separater Modellsilo behandelt.
131. Non-Thinking
Der schnelle Modus eignet sich für einfache Fragen, Extraktion und latenzkritische Aufgaben.
Thinking sollte nicht reflexartig für jeden Prompt aktiviert werden.
132. Tool Use
Qwen3 wird für agentische Toolnutzung weiter optimiert.
Qwen-Agent und externe Frameworks können Function Calling orchestrieren.
133. MCP-Ökosystem
Qwen-Agent unterstützt später Model Context Protocol für externe Werkzeuge und Daten.
MCP standardisiert Schnittstellen, nicht Vertrauen.
134. Lokales Ökosystem
Qwen3 wird schnell von Transformers, vLLM, SGLang, llama.cpp, Ollama und MLX unterstützt.
Bei neuen Chattemplates ist eine aktuelle Runtime wichtig.
135. Apache-2.0-Linie
Viele Qwen3-Gewichte werden unter Apache 2.0 veröffentlicht.
Die konkrete Modellkarte bleibt maßgeblich.
136. Instruct/Thinking-Ausprägungen
Im Verlauf von 2025 erscheinen stärker spezialisierte Qwen3-Instruct- und Thinking-Updates.
Cloud- und Open-Weight-Namensräume laufen nicht immer synchron.
137. Qwen3-2507
Sommer-2025-Revisionen verbessern Instruct und Thinking gegenüber dem April-Release.
Datierte Checkpoints sind für reproduzierbare Benchmarks wichtig.
138. September 2025: Qwen3-Max
Qwen3-Max ist Alibabas große proprietäre Cloud-Spitzenklasse mit über einer Billion Parametern.
Der Max-Release ist nicht identisch mit Qwen3-235B-A22B.
139. 36 Billionen Pretraining-Tokens
Qwen3-Max wurde auf rund 36 Billionen Tokens vortrainiert.
Alibaba beschreibt dafür großskalige MoE-Trainingsinfrastruktur.
140. 1M-Training
Für Long Context nutzt Qwen3-Max Infrastruktur, die Training mit Million-Token-Sequenzen ermöglicht.
API-Kontext und Trainingskontext müssen trotzdem stichtagsbezogen geprüft werden.
141. Qwen3-Max-Thinking
Die Reasoningvariante wird später als eigener Flagship-Reasoner veröffentlicht.
Sie kombiniert große Parameterzahl, Reinforcement Learning und Tool Use.
142. 25. Januar 2026: Qwen3-Max-Thinking
Qwen veröffentlicht den reasoningorientierten Max-Pfad mit adaptiver Toolnutzung und Test-Time Scaling.
Das Modell ist proprietär und über Qwen/Alibaba-Cloud-Dienste verfügbar.
143. 22. Juli 2025: Qwen3-Coder
Qwen3-Coder wird als bis dahin agentischstes Qwen-Codemodell vorgestellt.
Die erste große Variante ist Qwen3-Coder-480B-A35B-Instruct.
144. 480B Gesamt / 35B aktiv
Das Coder-MoE speichert sehr große Kapazität bei 35B aktiven Parametern pro Token.
Self-Hosting bleibt trotz MoE ein Mehr-GPU-/Serverprojekt.
145. 7,5 Billionen Tokens
Qwen3-Coder wird auf 7,5 Billionen Tokens vortrainiert, davon rund 70 Prozent Code.
Allgemeine und mathematische Fähigkeiten sollen trotzdem erhalten bleiben.
146. 256K nativer Kontext
Das Modell unterstützt 256K Kontext nativ.
Für Repositoryarbeit kann der Kontext per YaRN auf bis zu 1M erweitert werden.
147. YaRN auf 1M
Context Extrapolation erweitert den nutzbaren Bereich über das native Training hinaus.
Extrapolierter Long Context sollte auf realen Repositories geprüft werden.
148. Synthetische Daten
Qwen2.5-Coder wurde verwendet, um verrauschte Codedaten zu säubern und neu zu schreiben.
Synthetische Teacherdaten können Qualität steigern, aber auch Teacherfehler übertragen.
149. Agent RL
Qwen3-Coder wurde mit Long-Horizon-Reinforcement-Learning auf echte Toolinteraktionen trainiert.
Das Ziel ist nicht nur Code schreiben, sondern iterativ in einer Umgebung handeln.
150. 20.000 parallele Umgebungen
Alibaba beschreibt eine Trainingsinfrastruktur mit bis zu 20.000 unabhängigen Agentenumgebungen.
Environment Scaling wird damit zum eigenen Trainingsproblem.
151. Qwen Code
Zusammen mit Qwen3-Coder wird ein terminalbasierter Coding-Agent veröffentlicht.
Qwen Code startete als Fork der Gemini-CLI-Idee und wurde auf Qwen-Protokolle, Tools und Prompts angepasst.
152. Terminalagent
Qwen Code lebt im Terminal und kann Dateien lesen, Code verändern, Shelltools ausführen und Entwicklungsaufgaben verfolgen.
Der Agent ist eine Anwendungsschicht und nicht das Qwen3-Coder-Gewicht.
153. Open Source
Qwen Code wird offen entwickelt.
Version, Installationsweg und Toolberechtigungen sind Teil eines reproduzierbaren Agentenstands.
154. Werkzeuge
Qwen Code besitzt Dateisystem-, Shell-, Search-, Web- und Erweiterungsfähigkeiten abhängig von Konfiguration.
Least Privilege bleibt zentral.
155. Subagenten
Neuere Qwen-Code-Versionen unterstützen spezialisierte Subagenten mit eigenem Kontext und eigenen Tools.
Parallelität kann Recherche beschleunigen, erhöht aber Merge- und Kostenkomplexität.
156. Fork-Subagent
Ein Subagent kann ausgewählten Gesprächskontext des Hauptagenten erben.
Kontextweitergabe sollte nur notwendige Informationen enthalten.
157. Hintergrundagenten
Neuere Qwen-Code-Varianten können Aufgaben unabhängig im Hintergrund fortführen.
Autonomie benötigt klare Stop-, Kosten- und Berechtigungsgrenzen.
158. Qwen-Code-Authentifizierung
Der frühere kostenlose Qwen-OAuth-Pfad wurde im April 2026 eingestellt.
Aktuell werden Alibaba Cloud Coding Plan oder eigene API-/Providerzugänge verwendet.
159. Claude-Code-Kompatibilität
Qwen-APIs können über Anthropic-kompatible Schnittstellen mit Claude-Code-nahen Clients verwendet werden.
Der Client bleibt Claude Code; das Modell bleibt Qwen.
160. OpenAI-kompatible Clients
Qwen lässt sich über OpenAI-kompatible Endpunkte in viele Codingtools einbinden.
Protokollkompatibilität ist keine Modellidentität.
161. Qoder
Alibaba positioniert Qoder als agentische Codingplattform, die aktuelle Qwen-Modelle integriert.
Qoder und Qwen Code sind getrennte Produkte.
162. Coding 2026
Qwen3.8 und Qwen3.8-Flash-Next erweitern Coding und Cowork über den spezialisierten Qwen3-Coder hinaus.
Der aktuell stärkste allgemeine Qwen kann daher für Coding besser geeignet sein als ein älterer expliziter Coder.
163. 5. Juni 2025: Qwen3-Embedding
Qwen3-Embedding überträgt die Qwen3-Sprachbasis auf semantische Vektorrepräsentationen.
Die Reihe deckt 0.6B, 4B und 8B ab und ist für Retrieval, Clustering, Klassifikation und Code Search gedacht.
164. Dual-Encoder
Embeddingmodelle kodieren Query und Dokument unabhängig in Vektoren.
Das ermöglicht schnelle Approximate-Nearest-Neighbor-Suche in großen Beständen.
165. Matryoshka Representation Learning
Qwen3-Embedding unterstützt flexible Vektordimensionen.
Kürzere Embeddings sparen Speicher und Rechenzeit, können aber Retrievalqualität reduzieren.
166. Instruction-aware Embeddings
Aufgabeninstruktionen können Retrieval auf Domäne und Suchziel ausrichten.
Query- und Dokumentseite müssen passend formatiert werden.
167. Qwen3-Reranker
Reranker in 0.6B, 4B und 8B bewerten Query-Dokument-Paare gemeinsam.
Sie sind langsamer als Embeddings, aber typischerweise präziser für eine kleine Kandidatenmenge.
168. Cross-Encoder
Reranking verarbeitet Query und Dokument gemeinsam.
Das erlaubt tiefere Tokeninteraktion als reine Vektorähnlichkeit.
169. Zweistufiges Retrieval
Embedding liefert schnell Kandidaten, Reranker sortiert anschließend genauer.
Diese Kombination ist für RAG häufig besser als nur ein einzelner Vektorvergleich.
170. Mehr als 100 Sprachen
Qwen3-Embedding ist stark multilingual und unterstützt auch Programmiersprachen.
Cross-Lingual Retrieval bleibt abhängig von Domäne und Queryqualität.
171. 22. September 2025: Qwen3-VL
Qwen3-VL wird als neue Spitzenfamilie für Vision-Language-Aufgaben veröffentlicht.
Die erste offene Flagshipklasse ist Qwen3-VL-235B-A22B in Instruct- und Thinking-Ausführung.
172. Visuelles Thinking
Qwen3-VL kann komplexe visuelle Mathematik, Diagramme und räumliche Aufgaben mit Reasoning bearbeiten.
Visuelle Fehler können Wahrnehmung und Schlussfolgerung zugleich betreffen.
173. Visual Agent
Qwen3-VL wird stärker für GUI-, Web- und Computer-Use-Aufgaben trainiert.
Das Modell beschreibt beziehungsweise interpretiert Zustände; ein Harness führt Aktionen aus.
174. Räumliche Intelligenz
Objektbeziehungen, Referenzierung und Koordinaten werden stärker als eigene Fähigkeit behandelt.
Bounding Boxes und natürliche räumliche Sprache müssen auseinandergehalten werden.
175. Langes Video
Qwen3-VL verbessert zeitliches Videoverständnis und längere Clips.
Frameauswahl und Tokenbudget beeinflussen Ergebnisqualität.
176. Qwen3-VL-235B-A22B
Das große MoE-Modell nutzt etwa 235B Gesamt- und 22B aktive Parameter.
Es ist für lokale Consumerhardware zu groß, aber als offener Forschungscheckpoint wichtig.
177. Kleinere Qwen3-VL-Modelle
Die Serie wird später um kleinere offene Größen ergänzt.
Diese sind für On-Prem- und Workstationeinsatz praktikabler.
178. 7. Januar 2026: Qwen3-VL-Embedding
Die multimodale Embeddingreihe bildet Text, Bilder, Screenshots, visuelle Dokumente und Video in einem gemeinsamen semantischen Raum ab.
Das ermöglicht Cross-Modal Retrieval.
179. Qwen3-VL-Reranker
Der multimodale Reranker bewertet Query-Dokument-Paare mit gemischten Modalitäten.
Er kann ein initiales multimodales Retrieval deutlich präzisieren.
180. VL-Embedding 2B
Die kleinere multimodale Embeddingklasse verwendet 32K Sequenzlänge und flexible Embeddingdimensionen.
Sie ist für größere Retrievalsysteme effizienter als 8B.
181. VL-Embedding 8B
8B bietet höhere semantische Kapazität bei höherem Inferenzaufwand.
Für große Indexierungsjobs können Kosten erheblich werden.
182. Qwen3-Omni
Qwen3-Omni führt die End-to-End-Multimodalitätslinie nach Qwen2.5-Omni weiter.
Text, Bild, Audio und Video werden enger mit Reasoning und Agentenfähigkeiten verbunden.
183. Omni ≠ VL
VL konzentriert sich primär auf visuelle Eingaben und Textausgabe.
Omni integriert zusätzlich Audio und Sprachgenerierung beziehungsweise Echtzeitinteraktion.
184. Realtime-Interaktion
Omni-Modelle zielen auf geringe Latenz zwischen Wahrnehmung, Reasoning und Sprache.
Netzwerk- und Audio-Pipeline beeinflussen die gefühlte Latenz genauso wie das Modell.
185. September 2025: Qwen3-TTS
Qwen3-TTS baut eine eigene Text-to-Speech-Familie für natürliche, mehrsprachige Sprachsynthese auf.
Spätere Varianten ergänzen Voice Clone und Voice Design.
186. Mehrsprachige TTS
Qwen3-TTS unterstützt unter anderem Deutsch, Englisch, Chinesisch, Französisch, Italienisch, Spanisch, Portugiesisch, Japanisch, Koreanisch und Russisch.
Stimmen- und Dialektabdeckung variiert je Modell.
187. Viele Timbres
Cloudmodelle bieten zahlreiche vordefinierte Stimmen.
Eine Timbre-Auswahl ist keine Identität des Foundation-Modells.
188. Voice Design
Voice-Design-Modelle erzeugen eine gewünschte Stimme aus natürlicher Beschreibung.
Das unterscheidet sich von Klonen einer realen Zielperson.
189. Voice Clone
Qwen3-TTS kann aus wenigen Sekunden Referenzaudio eine stimmähnliche Ausgabe erzeugen.
Einwilligung und Missbrauchsschutz sind besonders wichtig.
190. 21. Januar 2026: Qwen3-TTS Open Source
Qwen veröffentlicht mehrere TTS-Checkpoints in 1.7B- und 0.6B-Klassen.
VoiceDesign, CustomVoice und Base/Clone-Funktionen werden getrennt angeboten.
191. 12-Hz-TTS-Tokenizer
Qwen3-TTS komprimiert Sprachsignale über einen eigenen Multi-Codebook-Tokenizer.
Tokenizerqualität beeinflusst Sprachrekonstruktion und Sprecherähnlichkeit.
192. Streaming
Die Architektur unterstützt sehr frühe Audioausgabe während fortlaufender Textzufuhr.
Streamingqualität hängt von Netzwerk und Audiopuffer ab.
193. August 2025: Qwen-Image
Qwen-Image startet als eigene Bildgenerationsfamilie mit besonderem Schwerpunkt auf korrekter Textdarstellung.
Die Bildserie ist getrennt von Qwen-VL-Verständnismodellen.
194. 20B-Bildmodell
Die erste Qwen-Image-Generation basiert auf einer großen 20B-Klasse.
Bildmodellparameter lassen sich nicht direkt mit LLM-Parametern vergleichen.
195. Text in Bildern
Qwen-Image wurde besonders auf lesbare Typografie und komplexere Beschriftungen ausgerichtet.
Auch gute Modelle können Buchstaben, Zahlen und Layoutdetails falsch erzeugen.
196. 18. August 2025: Qwen-Image-Edit
Qwen-Image-Edit erweitert das Bildmodell um semantische und visuelle Bearbeitung.
Es kombiniert visuelle Semantik mit der Erhaltung von Erscheinungsdetails.
197. Semantische Bearbeitung
Objekte, Stil, Pose oder Bedeutung können verändert werden.
Solche Edits dürfen nicht als unveränderte Originalfotografie archiviert werden.
198. Appearance Editing
Niedrigstufige Bearbeitung versucht nicht betroffene Regionen möglichst stabil zu halten.
Generative Rekonstruktion kann dennoch Pixel außerhalb des Zielbereichs verändern.
199. 30. Dezember 2025: Qwen-Image-2512
Der Dezemberstand verbessert Realismus, natürliche Details und Textdarstellung.
Datierte Bildmodellrevisionen sind wegen sichtbarer Stiländerungen besonders archivierungswürdig.
200. 10. Februar 2026: Qwen-Image-2.0
Qwen-Image-2.0 vereint Generierung und Editing stärker in einem Modell und unterstützt native 2K-Ausgabe.
Der Fokus liegt auf komplexen Infografiken, Photorealismus und längeren Anweisungen.
201. 21. Juli 2026: Qwen-Image-3.0
Qwen-Image-3.0 ist die aktuelle dritte Generation für reichhaltige Layouts, authentische Details und Weltwissen.
Die Dokumentation nennt bis zu 4.5K Token Input und native Textdarstellung in mehreren Sprachen.
202. UI- und Layoutsimulation
Qwen-Image-3.0 kann komplexe Interfaces, Zeitungen, Storyboards oder Prüfungsseiten generieren.
Generierte UI-Screenshots sind keine Belege für echte Softwarezustände.
203. 12 Sprachen im Bild
Die aktuelle Bildgeneration unterstützt native Textdarstellung in zwölf Sprachen.
Fehlerfreie Typografie ist trotzdem nicht garantiert.
204. 29. Mai 2026: Qwen-VLA
Qwen-VLA erweitert Vision-Language-Fähigkeiten zu kontinuierlicher Aktion und Trajektorien für Robotik.
Das Modell ist ein Vision-Language-Action-System und nicht nur ein Chatbot.
205. Aktion im physischen Raum
VLA-Modelle müssen Wahrnehmung, Sprache, räumliche Planung und Motoraktionen verbinden.
Physische Aktionen haben höhere Sicherheitsanforderungen als Textausgabe.
206. 15. Juni 2026: Qwen-Robot Suite
Qwen veröffentlicht eine Modellfamilie für Navigation, Manipulation und World Modeling.
RobotNav, RobotManip und RobotWorld sind spezialisierte Komponenten.
207. 22. Juni 2026: Qwen-AgentWorld
Qwen-AgentWorld trainiert ein Language World Model, das Agentenumgebungen simuliert.
Es deckt Search, MCP, Terminal, SWE, Android, Web und OS ab.
208. Language World Model
Das Modell simuliert Reaktionen einer Umgebung auf Agentenaktionen.
Solche Simulationen können Reinforcement Learning skalieren, ohne jede Aktion in echter Software auszuführen.
209. AgentWorldBench
Ein begleitender Benchmark vergleicht simulierte und reale Agentenumgebungen.
Simulationsqualität bestimmt, wie gut Training in die Realität überträgt.
210. 11. September 2025: Qwen3-Next-80B-A3B
Qwen3-Next wird als ultra-sparsames MoE mit neuer Hybrid-Attention veröffentlicht.
Es dient ausdrücklich als Architekturvorläufer der späteren Qwen3.5-Familie.
211. 80B Gesamt / 3B aktiv
Die extrem geringe Aktivierung soll hohe Modellkapazität bei niedriger Rechenlast ermöglichen.
Speicherbedarf bleibt von den 80B Gesamtparametern geprägt.
212. Gated DeltaNet
Qwen3-Next kombiniert lineare Gated-DeltaNet-Schichten mit klassischen Attention-Layern.
GDN komprimiert Historie in einen festen Zustand und reduziert Long-Context-Kosten.
213. Hybrid Attention
Nicht jede Schicht berechnet vollständige Attention über den gesamten Verlauf.
Periodische Attention-Layer ermöglichen präzise Retrievalpfade.
214. Ultra-Sparse MoE
Nur ein sehr kleiner Parameteranteil ist pro Token aktiv.
Das verbessert Durchsatz, kann aber Expert-Routing komplexer machen.
215. Multi-Token Prediction
Zusätzliche Vorhersage mehrerer zukünftiger Tokens dient Training und schnelleren Decodingverfahren.
MTP ist kein separates Chatmodell.
216. Effizienzexperiment
Qwen3-Next untersucht Architekturideen, die später in Qwen3.5 bis 3.8 produktiv werden.
Der Name „Next“ bezeichnet deshalb einen Forschungs-/Übergangscheckpoint, nicht Qwen4.
217. Offene Gewichte
Qwen3-Next wurde offen bereitgestellt.
Die Community konnte dadurch die spätere Hybridarchitektur vor dem 2026er Hauptrelease untersuchen.
218. Von Next zu 3.5
Qwen3.5 übernimmt Gated DeltaNet plus sparse MoE und baut native Multimodalität darauf.
Qwen3-Next ist damit die direkte technische Brücke.
219. 16. Februar 2026: Qwen3.5
Qwen3.5 wird als neue native Vision-Language-Foundation für Agenten veröffentlicht.
Die erste offene Flagshipvariante ist Qwen3.5-397B-A17B.
220. 397B Gesamt / 17B aktiv
Das Flagship-MoE kombiniert sehr große Gesamtkapazität mit 17B aktivierten Parametern.
Es baut architektonisch auf Qwen3-Next auf.
221. Native Multimodalität
Qwen3.5 wird von Anfang an gemeinsam auf Text- und visuellen Daten trainiert statt ein Textmodell nachträglich um Vision zu erweitern.
Das soll Wahrnehmung, Reasoning und Agentenfähigkeit enger integrieren.
222. Early Fusion
Text- und visuelle Repräsentationen fließen früh in einen gemeinsamen Modellpfad.
Das verbessert cross-modales Reasoning, erhöht aber Trainingskomplexität.
223. Gated Delta Networks
Qwen3.5 übernimmt GDN aus Qwen3-Next als effizienten linearen Attentionersatz für viele Schichten.
Ein Teil der Schichten behält präzisere globale Attention.
224. Sparse MoE
Die Modellfamilie nutzt sparse Expertenaktivierung.
Gesamtgröße und aktive Größe müssen getrennt betrachtet werden.
225. 201 Sprachen und Dialekte
Qwen3.5 erweitert die dokumentierte Sprachabdeckung auf 201 Sprachen und Dialekte.
Breite Unterstützung bedeutet nicht identische Qualität in jedem Dialekt.
226. 1M Kontext in Qwen3.5-Plus
Das gehostete Plus-Modell wird mit einem 1-Million-Token-Kontextfenster angeboten.
Lokale offene Checkpoints können andere native beziehungsweise extrapolierte Kontextgrenzen besitzen.
227. Built-in Tools
Qwen3.5-Plus integriert offizielle Werkzeuge und adaptive Toolnutzung.
Cloudtools sind Produkt-/API-Funktionen, nicht Bestandteil nackter Gewichte.
228. Adaptive Tool Use
Das Modell soll selbst entscheiden können, wann Web-, Code- oder andere Werkzeuge nützlich sind.
Diese Entscheidung braucht dennoch Rechtekontrolle außerhalb des Modells.
229. Skaliertes Reinforcement Learning
Alibaba beschreibt millionenfache Agentenumgebungen und asynchrones RL als wichtigen Trainingspfad.
Agentenlernen wird damit zu einem zentralen Bestandteil des Foundation-Model-Post-Trainings.
230. 397B-A17B Open Weight
Der erste große Qwen3.5-Checkpoint wird offen auf Hugging Face und ModelScope veröffentlicht.
Die Größe verlangt Datacenter- oder stark verteilte Hardware.
231. 24. Februar 2026: Qwen3.5-122B-A10B
Die mittlere MoE-Klasse bietet 122B Gesamt- und 10B aktive Parameter.
Sie ist für High-End-On-Prem deutlich realistischer als 397B.
232. Qwen3.5-35B-A3B
35B Gesamt und 3B aktive Parameter liefern eine sehr effiziente kleinere MoE-Option.
Sie zielt besonders auf lokale Agenten und multimodale Nutzung.
233. Qwen3.5-27B
27B ist ein dichtes multimodales Modell.
Es bietet eine einfachere Servingcharakteristik als MoE und bleibt für große Workstations attraktiv.
234. 2. März 2026: kleinere Qwen3.5-Modelle
0.8B, 2B, 4B und 9B erweitern die Familie nach unten.
Die kleinen Modelle machen native multimodale Qwen3.5-Fähigkeiten für Edge und Consumerhardware zugänglicher.
235. Qwen3.5-0.8B
0.8B ist eine extrem kleine multimodale Foundationklasse.
Die Kapazität eignet sich vor allem für klar begrenzte Aufgaben.
236. Qwen3.5-2B
2B bietet mehr Robustheit bei weiterhin sehr geringem Speicherbedarf.
On-Device-Anwendungen profitieren besonders.
237. Qwen3.5-4B
4B ist ein praktischer kleiner Allrounder.
Quantisierung macht ihn auf vielen Verbrauchergeräten einsetzbar.
238. Qwen3.5-9B
9B ist die stärkste kleinere offene Klasse der 3.5-Serie.
Sie ist ein interessanter Kompromiss für lokale multimodale Assistenz.
239. Qwen3.5-Flash
Das Cloud-Flash-Modell priorisiert günstige und schnelle multimodale Inferenz.
Es bietet ebenfalls sehr langen Kontext.
240. Qwen3.5-Plus
Plus ist die stärkere gehostete Allroundklasse.
Cloud-Plus und offene 397B-A17B-Gewichte sind nicht zwangsläufig derselbe Checkpoint.
241. Hybrid Thinking
Qwen3.5 kann visuell und textuell zwischen Thinking und Non-Thinking wechseln.
Der Modus sollte entsprechend Aufgabenschwierigkeit gewählt werden.
242. Video
Qwen3.5-Cloudmodelle verarbeiten lange Videos.
Videoqualität hängt von Sampling, Auflösung und Kontextbudget ab.
243. Dokumentverständnis
Native Multimodalität verbessert OCR, Diagramme, Screenshots und Layoutfragen.
Dokumentseiten sollten für kritische Daten weiterhin direkt kontrolliert werden.
244. Agenten
Qwen3.5 wird explizit für Tool Use, Computer Use und reale Agentenaufgaben trainiert.
Ein Foundation-Modell handelt erst über ein Harness.
245. Rolle von Qwen3.5 im Jahr 2026
Qwen3.5 bildet die architektonische Basis für Qwen3.6, Qwen3.7 und Qwen3.8.
Die Generation bleibt daher trotz späterer Releases technisch zentral.
246. April 2026: Qwen3.6
Qwen3.6 baut auf Qwen3.5 auf und fokussiert Stabilität, Alltagstauglichkeit und Agentic Coding.
Die offene Serie startet mit 35B-A3B und 27B.
247. Qwen3.6-Plus
Die gehostete Plus-Klasse wird Anfang April als neuer Cloud-Allrounder bereitgestellt.
Sie unterstützt native Multimodalität und sehr langen Kontext.
248. 16. April 2026: Qwen3.6-35B-A3B
Das offene MoE-Modell besitzt 35B Gesamt- und nur 3B aktive Parameter.
Es ist auf hohe Effizienz und agentisches Coding ausgerichtet.
249. Multimodales 35B-A3B
Die kleine aktive Größe verarbeitet trotzdem Text, Bilder und Video.
Das macht die Klasse für lokale multimodale Agenten besonders interessant.
250. Agentic Coding
Qwen berichtet deutliche Verbesserungen bei Frontend-, Repository- und Tool-Aufgaben.
Herstellerbenchmarks werden im Archiv als Herstellerangaben gekennzeichnet.
251. Thinking Preservation
Qwen3.6 kann Reasoningkontext über Gesprächsverlauf erhalten.
Das reduziert wiederholtes Neudenken bei iterativer Codingarbeit.
252. 22. April 2026: Qwen3.6-27B
Das dichte 27B-Modell ergänzt die MoE-Variante.
Es ist nativ multimodal und unterstützt Thinking/Non-Thinking.
253. Dense 27B
Alle 27B Parameter sind pro Token aktiv.
Dense Serving ist einfacher vorhersehbar, braucht aber mehr Rechenarbeit pro Token als ein 3B-aktives MoE.
254. 18. April 2026: Qwen3.6-Max-Preview
Alibaba zeigt eine proprietäre stärkere Max-Vorschau mit besserem Wissen, Instruction Following und Agentic Coding.
Preview bedeutet ausdrücklich noch nicht stabiler Langzeitendpunkt.
255. 1M-Kontext bei Plus/Flash
Die gehosteten 3.6-Modelle unterstützen bis zu 1M Kontext.
Das ist besonders für lange Dokumente und Repositoryarbeit relevant.
256. Qwen3.6-Flash
Flash ist die günstigere und schnellere gehostete Klasse.
Das offene 35B-A3B-Modell wird im Cloudkontext eng mit dieser Leistungsstufe verbunden.
257. 201 Sprachen
Qwen3.6 hält die breite Sprachabdeckung der 3.5-Architektur.
Mehrsprachige Coding- und Office-Aufgaben profitieren davon.
258. Vision
Qwen3.6 bleibt nativ multimodal.
Ein separates VL-Modell ist für viele allgemeine Bildfragen nicht mehr zwingend notwendig.
259. Video
Cloudmodelle verarbeiten lange Videos zusammen mit Text.
Die maximale Videolänge ist produkt- und modellabhängig.
260. Agentenstack
Qwen3.6 wird direkt in Qwen Code und andere Agentenpfade integriert.
Modellupgrade und Agentenupgrade können unabhängig voneinander stattfinden.
261. Mai bis Juli 2026: Qwen3.7
Qwen3.7 entwickelt die 3.5/3.6-Linie zu einer stärkeren Cloud-Flagshipgeneration weiter.
Plus, Max und Flash werden als unterschiedliche Leistungs-/Kostenklassen angeboten.
262. Qwen3.7-Plus
Plus ist das multimodale Flagship für allgemeine Text-, Bild- und Videoaufgaben.
Die aktuelle Dokumentation nennt 1M Kontext und integrierte Tools.
263. 26. Mai 2026: Plus-Snapshot
`qwen3.7-plus-2026-05-26` ist ein datierter reproduzierbarer Cloudstand.
Der bewegliche Hauptname `qwen3.7-plus` kann später aktualisiert werden.
264. Qwen3.7-Max
Max ist die stärkere proprietäre Text-/Reasoningklasse innerhalb der 3.7-Serie.
Model Studio führt datierte Max-Snapshots für reproduzierbare Nutzung.
265. 20. Mai 2026: Max-Snapshot
Ein früher datierter Qwen3.7-Max-Stand wird in Model Studio gelistet.
Datierte Snapshots sind gegenüber `latest`-Aliasen für Langzeittests vorzuziehen.
266. 8. Juni 2026: Max-Snapshot
Ein weiterer Max-Snapshot aktualisiert die Cloudgeneration.
Die Existenz mehrerer Snapshots zeigt den schnellen Iterationsrhythmus.
267. Qwen3.7-Flash
Flash bietet nahe Flagshipfähigkeiten bei deutlich niedrigeren Kosten.
Auch Flash unterstützt 1M Kontext und multimodale Eingaben.
268. 15. Juli 2026: Flash-Snapshot
`qwen3.7-flash-2026-07-15` ist der aktuelle datierte 3.7-Flash-Stand.
Der Hauptalias kann auf diesen oder einen späteren Stand zeigen.
269. 1M Kontext
Plus, Max und Flash werden mit sehr langen Kontextfenstern angeboten.
Kosten können ab bestimmten Kontextlängen stufenweise steigen.
270. Bis zu lange Videos
3.7-Plus und 3.7-Flash unterstützen in Model Studio sehr lange Videoeingaben.
Videodauer, Dateigröße und Tokenisierung sind separate Limits.
271. Built-in Tools
Die 3.7-Cloudmodelle unterstützen Function Calling und integrierte Werkzeuge.
Toolverfügbarkeit hängt von API/Produktoberfläche ab.
272. Hybrid Reasoning
3.7-Modelle unterstützen Thinking und Non-Thinking in derselben Familie.
Die genaue Reasoningsteuerung variiert zwischen API-Protokollen.
273. Context Cache
Model Studio unterstützt implizites Prefix Caching für ausgewählte 3.7-Modelle.
Cache-Hits senken Kosten, sind aber nicht garantiert.
274. Qwen3.7 als Zwischenschritt
3.7 ist die direkte Cloudgeneration unmittelbar vor Qwen3.8.
Viele 3.7-Modelle bleiben am 1. September 2026 weiterhin produktiv verfügbar.
275. 2. August 2026: Qwen3.8-Max
Qwen3.8-Max wird als bis dahin leistungsfähigstes Qwen-Modell für Coding, professionelle Arbeit, Research und Long-Horizon-Agenten vorgestellt.
Der Release markiert zugleich erstmals die angekündigte Öffnung einer Qwen-Max-Klasse.
276. 2,4 Billionen Parameter
Qwen3.8-Max skaliert auf ungefähr 2,4T Gesamtparameter.
Der offene Checkpoint trägt die Bezeichnung Qwen3.8-2.4T-A95B und aktiviert rund 95B Parameter.
277. 95B aktive Parameter
Die aktive MoE-Kapazität liegt weit unter den 2,4T Gesamtparametern, bleibt aber selbst bereits sehr groß.
Self-Hosting ist dadurch ein Datacenterprojekt.
278. 12. August 2026: offene Max-Gewichte
Alibaba veröffentlicht Qwen3.8-2.4T-A95B auf Hugging Face und ModelScope.
Es ist das erste offene Qwen-Max-Klassenmodell dieser Linie.
279. Eigene Qwen3.8-Max-Lizenz
Der 2.4T-A95B-Checkpoint wird nicht einfach unter Apache 2.0 geführt, sondern besitzt eine eigene Qwen3.8-Max-Lizenz.
Das ist ein wichtiger Unterschied zum offenen 27B-Modell.
280. 14. August 2026: Qwen3.8-27B
Qwen3.8-27B wird als offene dichte multimodale 27B-Klasse veröffentlicht.
Die Modellkarte führt Apache 2.0.
281. Multimodales 27B
Qwen3.8-27B verarbeitet Text und Bilder in einer gemeinsamen Foundationarchitektur.
Es ist wesentlich realistischer lokal betreibbar als 2.4T-A95B.
282. Lokaler Sweet Spot
27B ist für große Consumer-GPUs, Macs mit viel Unified Memory oder Multi-GPU-Workstations interessant.
Quantisierung und Vision-Encoder erhöhen den realen Speicherbedarf.
283. Qwen3.8-Max in Qwen Studio
Qwen Studio führt Qwen3.8-Max als aktuelles Flagship mit Text-, Bild- und Videofähigkeiten.
Die Studio-Produktoberfläche ergänzt Tools und weitere Dienste.
284. 1M Kontext
Qwen Studio dokumentiert für Qwen3.8-Max bis zu eine Million Tokens Kontext.
Maximale Zusammenfassungsausgabe und maximaler Kontext sind unterschiedliche Limits.
285. Coding und Cowork
Qwen3.8-Max wird besonders für professionelle Wissensarbeit und langfristige Agentenaufgaben positioniert.
„Cowork“ beschreibt den Arbeitsmodus mit Tools und Umgebung, nicht einen einzelnen Benchmark.
286. Long-Horizon Agents
Die Generation soll längere mehrstufige Aufgaben robuster bis zum Ende durchführen.
Langhorizontaufgaben benötigen Zustandsverwaltung, Fehlerkorrektur und Toolkontrolle.
287. Flexible Reasoning-Tiefe
Qwen3.8 unterstützt differenziertere Reasoningsteuerung über `reasoning_effort` und erhält auf Wunsch Thinking-Kontext über mehrere Nachrichten.
Reasoningmodus ist eine Inferenzkonfiguration, kein separater Foundation-Checkpoint.
288. `preserve_thinking`
Neuere Qwen3.8-APIs können Reasoningkontext historischer Nachrichten erhalten.
Das kann iterative Agentenarbeit beschleunigen, erhöht aber Kontext- und Datenschutzbedarf.
289. Qwen3.8-Flash
Qwen3.8-Flash ist der aktuelle günstige, schnelle Produktionspfad der 3.8-Generation.
Model Studio listet ihn mit 1M Kontext und Context-Caching-Unterstützung.
290. Flash als Kostenklasse
Flash wird deutlich günstiger als Plus-/Max-Klassen angeboten.
Preise sind region- und zeitabhängig und gehören nicht dauerhaft in eine statische Modelldefinition.
291. 26. August 2026: Qwen3.8-Flash-Next
Qwen veröffentlicht Flash-Next als offenen multimodalen MoE-Forschungscheckpoint und frühe Vorschau auf die Architektur von Qwen4.
Die Gewichte erscheinen vor der vollständigen Qwen4-Familie, damit die Community die Architektur untersuchen kann.
292. 125B Hauptmodell
Qwen3.8-Flash-Next besitzt ungefähr 125B Parameter im Hauptmodell.
Zusätzlich kommen große N-Gram-Embeddingtabellen hinzu.
293. 6B aktive Parameter
Nur etwa 6B Hauptmodellparameter sind pro Token aktiv.
Das macht die Architektur trotz hoher Gesamtkapazität recheneffizient.
294. 51B N-Gram-Embeddingparameter
Ein zusätzlicher Lookup-Speicher kodiert lokale Tokenmuster.
Die Adressen sind deterministisch und können aus Host Memory asynchron vorab geladen werden.
295. Kapazität außerhalb klassischer FLOPs
Die 51B N-Gram-Parameter erhöhen gespeicherte Musterkapazität bei sehr wenig Matrixmultiplikationsaufwand.
Parameterzahl und FLOP-Aufwand entkoppeln sich dadurch weiter.
296. Qwen Sparse Attention
QSA wählt wichtige Kontextbereiche auf Micro-Block-Ebene aus, statt jedes Token global zu attendieren.
Das reduziert sowohl Attention- als auch Indexierungskosten bei sehr langen Sequenzen.
297. GDN + QSA
Gated DeltaNet komprimiert laufende Historie, QSA übernimmt präzises Retrieval aus wichtigen Kontextregionen.
Qwen beschreibt dies vereinfacht als effizientes Erinnern plus gezieltes Nachschlagen.
298. Gated Residual
Der Residual Stream wird auf mehrere parallele Pfade verbreitert und dynamisch gelesen beziehungsweise beschrieben.
Das soll Informationsfluss und Trainingsstabilität verbessern.
299. Vier Residualzweige
Flash-Next verwendet mehrere parallele Residualzustände statt nur eines Streams.
Bestimmte Zweige können sich auf langfristige Informationsweitergabe spezialisieren.
300. N-Gram Embedding
Lookupadressen hängen vom aktuellen Token plus lokalen Vorgängertokens ab.
Das ergänzt Transformerwissen durch relativ kostengünstige lokale Pattern-Memory.
301. Muon Optimizer
Qwen3.8-Flash-Next nutzt Muon für geeignete Matrixparameter und AdamW für andere Parametergruppen.
Optimizerdesign ist Teil der Trainingsarchitektur, keine Endnutzeroption.
302. 262K nativ, 1M mit YaRN
Der offene Flash-Next-Checkpoint unterstützt 262.144 Tokens nativ und kann auf 1M extrapoliert werden.
Der gehostete Qwen3.8-Flash-Pfad bietet 1M standardmäßig.
303. Multimodal
Flash-Next verarbeitet Text und Bild und wird für visuelle Agenten evaluiert.
Multimodalität ist bereits Teil des neuen Qwen4-Vorläuferdesigns.
304. Agentenleistung
Der Release fokussiert Coding, Office-Arbeit, Tool Use, Android-/OS-/Webagenten und visuelle App-Rekonstruktion.
Benchmarks hängen stark vom verwendeten Agentenharness ab.
305. Offene Architekturvorschau
Alibaba veröffentlicht nicht erst fertige Qwen4-Gewichte, sondern bereits den Architekturvorläufer.
Das wiederholt die Strategie von Qwen3-Next vor Qwen3.5.
306. Richtung Qwen4
Qwen erklärt ausdrücklich, dass die Flash-Next-Architektur ein früher Blick auf Qwen4 ist.
Am 1. September 2026 ist Qwen4 selbst jedoch noch keine veröffentlichte vollständige Modellfamilie.
307. Qwen3.8-Flash-Next ist nicht Qwen4
Der Checkpoint bleibt unter dem Namen Qwen3.8-Flash-Next veröffentlicht.
Eine Architekturvorschau darf nicht als fertiger Qwen4-Release ausgegeben werden.
308. Aktuelle Cloudmodelle
Model Studio führt unter anderem qwen3.8-max und qwen3.8-flash als aktuelle 3.8-Hauptmodelle.
Parallel bleiben 3.7- und ältere stabilisierte Modelle verfügbar.
309. Responses API
Neuere QwenCloud-Pfade unterstützen OpenAI-kompatible Responses-Schnittstellen.
Das erleichtert Integration in Agentenclients wie Codex-nahe Tools.
310. Anthropic-kompatible Schnittstelle
QwenCloud kann auch Anthropic-kompatible Clients bedienen.
Claude-Code-Kompatibilität bedeutet nicht, dass Claude als Modell verwendet wird.
311. Parallel Tool Calls
Qwen3.8-Cloudmodelle sind für agentische Toolnutzung ausgelegt.
Toolausführung bleibt in der Client-/Agentenschicht.
312. Bildinput
Qwen3.8-27B und aktuelle 3.8-Cloudmodelle besitzen native visuelle Fähigkeiten.
Bildgenerierung bleibt dagegen Aufgabe der Qwen-Image-Serie.
313. Video
Qwen3.8-Max wird in Qwen Studio als Text-/Bild-/Video-Modell geführt.
Videoeingabe ist produktseitig nicht automatisch für jeden offenen Checkpoint identisch.
314. Endpunkt am 1. September 2026
Die technische Chronik endet bei Qwen3.8-Max, Qwen3.8-27B und Qwen3.8-Flash-Next sowie dem gehosteten Qwen3.8-Flash.
Qwen4 wird nur als angekündigte Architekturfolge erwähnt, nicht als bereits existentes Release.
315. Qwen Studio 2026
Qwen Studio ist der kostenlose Consumer-Assistent für Chat, Kreativität und multimodale Aufgaben.
Die angezeigte Modellversion kann sich serverseitig ändern.
316. Auto-Modus
Die Oberfläche kann Modell und Tools automatisch passend zur Aufgabe wählen.
Automatisches Routing erschwert reproduzierbare Modellvergleiche.
317. Dateien
Qwen Studio kann Dokumente und Medien als Kontext verwenden.
Uploads sind ein anderer Datenpfad als lokal geladene offene Gewichte.
318. Bildgenerierung
Qwen Studio integriert Qwen-Image-Funktionen.
Der Bildgenerator ist nicht das gleiche Modell wie Qwen3.8-Max.
319. Bildbearbeitung
Generative Editingfunktionen stammen aus Qwen-Image-/VLo-nahen Modellen.
Edits verändern Pixel generativ und sind kein verlustfreies Retuschieren.
320. Deep Research
Qwen Studio bietet einen mehrstufigen Recherchemodus mit Websuche und Synthese.
Ein langer Bericht bleibt von Quellenqualität und Retrieval abhängig.
321. Mehrstufige Websuche
Research kann mehrere Suchanfragen und Zwischenschritte durchführen.
Primärquellen haben Vorrang vor zusammenfassenden Sekundärseiten.
322. Berichte
Deep Research erzeugt strukturierte Ergebnisberichte.
Quellen, Datum und Gegenpositionen müssen erhalten bleiben.
323. Qwen-Agent 2026
Qwen-Agent bleibt ein offenes Framework für Function Calling, MCP, RAG, Code Interpreter und Browserassistenten.
Es dient auch als Backend für Teile der Qwen-Chat-Erfahrung.
324. RAG
Qwen-Agent kann eigene Dokumentbestände durchsuchen und relevante Passagen in den Modellkontext geben.
Retrievalfehler und Modellfehler sind getrennt zu diagnostizieren.
325. Code Interpreter
Python-/Codeausführung kann Berechnungen und Datenanalyse verifizieren.
Lokale Demo-Executorpfade sind nicht automatisch sandboxed.
326. Browser Assistant
Qwen-Agent enthält Browser-/Webagentenbeispiele.
Webinhalte gelten als nicht vertrauenswürdige Eingabe.
327. MCP-Unterstützung
Qwen-Agent kann MCP-Server als standardisierte Toolquelle anbinden.
Serverrechte und Datenzugriff müssen separat geprüft werden.
328. QwenWork
QwenWork ist Alibabas Produktivitätsplattform für agentische Büro- und Wissensarbeit.
Neuere Qwen3.8-Modelle werden als Cowork-/Work-Agenten darin eingesetzt.
329. QwenWork ≠ Qwen Code
QwenWork zielt breiter auf Office- und Wissensarbeit; Qwen Code ist der Terminal-Coding-Agent.
Beide können dieselbe Qwen-Modellfamilie unterschiedlich orchestrieren.
330. Qoder
Qoder ist eine separate Codingplattform im Alibaba-Ökosystem mit Qwen-Integration.
Produktfeatures wie IDE, Repoindex und Tooling sind vom Modell getrennt.
331. Qwen-App
Qwen Studio wird zusätzlich über mobile beziehungsweise Desktop-Apps angeboten.
Appfunktionen und Weboberfläche können zeitversetzt ausgerollt werden.
332. Qwen3.8-Max in Studio
Anfang September 2026 zeigt Qwen Studio Qwen3.8-Max als aktuelle Spitzenoption.
Der sichtbare Produktname ist die beste Quelle für den aktuellen Consumerstand.
333. Usage Policy
Qwen Studio veröffentlicht eine Nutzungsrichtlinie für verbotene und hochriskante Anwendungen.
Sie umfasst auch Plattformen, APIs und offene Modelle als Verhaltensstandard.
334. High-Risk Use
Gesundheit, Recht, Finanzen und kritische Infrastruktur verlangen laut Qwen-Richtlinie menschliche Fachaufsicht.
Eine starke Modellleistung ersetzt keine verantwortliche Endfreigabe.
335. Model Studio als Produktionsplattform
Alibaba Cloud Model Studio stellt Qwen und Drittmodelle über Cloud-APIs bereit.
Für Unternehmen sind Region, Deployment Scope, Workspace, API-Domain und Modellname gemeinsam entscheidend.
336. OpenAI-kompatible API
Viele Qwen-Text- und Multimodalmodelle lassen sich mit OpenAI-kompatiblen SDKs ansprechen.
Base URL, API Key und Modellname müssen zur Region passen.
337. DashScope SDK
Alternativ stellt Alibaba ein eigenes DashScope SDK bereit.
Native APIs können Funktionen früher oder vollständiger unterstützen als kompatible Wrapper.
338. Responses API
Neuere Modelle unterstützen das OpenAI-Responses-Muster für Tool- und Agentenflows.
Nicht jede ältere Qwen-Version unterstützt denselben Funktionsumfang.
339. Anthropic-Protokoll
Ausgewählte QwenCloud-Modelle lassen sich über Anthropic-kompatible Clients ansprechen.
Protokoll und Modellherkunft bleiben getrennt.
340. Region bestimmt Datenspeicherort
Model Studio dokumentiert Regionen wie Beijing, Singapore, Frankfurt, Tokyo, Hong Kong und Virginia.
Die Region legt fest, wo statische Request-/Result-Daten gespeichert werden.
341. Service Deployment Scope
Zusätzlich zur Region bestimmt ein Deployment Scope, wo Inferenz tatsächlich ausgeführt werden darf.
Global, International, EU, US, Japan, Hong Kong und Mainland-China-Scope haben unterschiedliche Grenzen.
342. Deutschland: Frankfurt
Alibaba Cloud Model Studio ist in `eu-central-1` verfügbar.
Workspaces können in Frankfurt je nach Konfiguration Global- oder EU-Inferenzscope verwenden.
343. EU-Scope
Beim EU-Scope soll Inferenz innerhalb der Europäischen Union bleiben.
Wer Datenresidenz benötigt, darf nicht versehentlich den Global-Scope wählen.
344. Global-Scope
Global kann Inferenz über einen größeren internationalen Ressourcenpool verteilen, gegebenenfalls auch über verschiedene Rechtsräume.
Alibaba weist darauf hin, Cross-Border-Compliance selbst zu prüfen.
345. Singapore / International
Singapore nutzt einen International-Scope, der das chinesische Mainland ausschließt.
Dies ist nicht dasselbe wie EU-only.
346. Beijing / Mainland China
Beijing beschränkt Inferenz auf das chinesische Mainland.
API-Schlüssel und Domains sind regionsgebunden.
347. US Virginia
Virginia kann Global- oder US-restricted Modelle anbieten.
Bei US-restricted Modellen wird häufig ein `-us`-Suffix verwendet.
348. Japan
Tokyo kann einen Japan-restricted Scope bereitstellen.
Auch hier sind Workspace und Modellverfügbarkeit regionsabhängig.
349. Hong Kong
Hong Kong kann Global oder Hong-Kong-restricted bereitstellen.
Hong Kong ist regulatorisch und technisch vom chinesischen Mainland-Scope getrennt.
350. Workspaces
Workspaces isolieren Ressourcen, Berechtigungen und regionale Inferenzkonfiguration.
API-Keys sollten möglichst workspacebezogen vergeben werden.
351. API Keys
Schlüssel werden in der jeweiligen Region erzeugt und sind nicht beliebig regionsübergreifend nutzbar.
Sie gehören in Secret Stores, nicht in Clientcode.
352. Workspace-Domain
Alibaba empfiehlt workspace-dedizierte Inferenzdomains für Produktion.
Sie ermöglichen klarere Isolation und Servicegarantien.
353. Trial Domain
Trial-Endpunkte sind für Tests gedacht.
Produktion sollte nicht von Trialquoten oder Previewlimits abhängen.
354. Statische Daten
Alibaba dokumentiert, dass statische Daten in der ausgewählten Region gespeichert bleiben.
Transienter Inferenztraffic kann innerhalb des gewählten Scope weitergeleitet werden.
355. Verschlüsselung
Übertragungen innerhalb der Model-Studio-Pipeline werden verschlüsselt.
Alibaba nennt zusätzlich AES-256 für übertragene beziehungsweise gespeicherte Anwendungs-/Trainingsdaten in seiner Privacy-Dokumentation.
356. Keine Nutzung von Kundengeschäftsdaten ohne Zustimmung
Alibaba Cloud erklärt, Kundengeschäftsdaten nicht ohne ausdrückliche Einwilligung für Entwicklung oder Verbesserung der Modelle zu verwenden.
Das ist eine Cloud-Model-Studio-Aussage und darf nicht automatisch auf Qwen-Studio-Consumerchats übertragen werden.
357. Qwen-Trainingsdatenkategorien
Alibaba nennt öffentlich zugängliche Internetdaten, Partnerdaten, bezahlte/gelabelte Daten und synthetische Daten.
Die Dokumentation weist darauf hin, dass auch urheberrechtlich oder markenrechtlich geschütztes Material enthalten sein kann.
358. Datenfilterung
Automatische Safetyfilter, menschliche Reviews und Filter für personenbezogene Informationen werden als Pretraining-Governance genannt.
Solche Verfahren reduzieren Risiken, garantieren aber keine vollständige Entfernung.
359. Synthetische Daten
Qwen nutzt synthetisch erzeugte Daten für seltene Aufgaben, Reasoning, Multimodalität und Robustheit.
Teacherfehler können in synthetischen Daten weitergegeben werden.
360. Fine-Tuning in Model Studio
Model Studio unterstützt unter anderem SFT, DPO und Continued Pretraining für ausgewählte Modelle.
Fine-Tunes sind eigene Modellartefakte mit eigenem Safetyprofil.
361. Datasets
Training- und Evaluationsdatensätze werden workspacebezogen verwaltet.
Datenschutz und Rechte an hochgeladenen Trainingsdaten liegen in der Verantwortung des Anwenders.
362. Context Cache
Ausgewählte Qwen3.7-/3.8-Modelle unterstützen implizites Prefix Caching.
Der Cache kann wiederkehrende lange Präfixe günstiger machen.
363. Prefix ab ungefähr 1024 Tokens
Bei vielen Model-Studio-Modellen erfüllt ein gemeinsames Präfix ab 1024 Tokens die technische Voraussetzung für einen möglichen Cache-Hit.
Ein Hit ist dennoch nicht garantiert.
364. Cache ≠ Memory
Context Caching optimiert Inferenzkosten.
Es ist kein persönliches Langzeitgedächtnis und keine Wissensdatenbank.
365. Tokenbasierte Preise
Modelle werden nach Input- und Outputtokens abgerechnet; lange Kontexte können gestaffelte Preise besitzen.
Preise ändern sich schnell und werden deshalb nicht als dauerhafte Modellmerkmale behandelt.
366. Batch Inference
Ausgewählte Flashmodelle bieten reduzierte Batchpreise.
Batch ist für zeitunkritische Jobs geeignet, nicht für interaktive Chats.
367. Model Lifecycle
Alibaba dokumentiert einen formalen Modell-Lifecycle mit Retirement-Ankündigungen.
Snapshot- und Mainline-Modelle besitzen unterschiedliche Vorlaufzeiten.
368. Snapshot-Modelle
Datierte Namen wie `qwen3.7-flash-2026-07-15` sind reproduzierbare Stände.
Sie können später gezielt abgekündigt werden.
369. Mainline-Modelle
Bezeichnungen ohne Datum wie `qwen3.7-flash` können auf einen aktuellen Snapshot zeigen.
Für Langzeitbenchmarks ist der bewegliche Alias weniger geeignet.
370. Retirement
Bei auslaufenden Modellen werden QPM/TPM schrittweise reduziert und schließlich API-Aufrufe beendet.
Produktionsanwendungen brauchen Migrationsplanung.
371. Aktueller API-Katalog
Ende August 2026 führt Model Studio Qwen3.8-Max/Flash, Qwen3.7, Qwen3.6, Qwen3.5 sowie diverse Spezialmodelle.
Region und Scope bestimmen, welche Modell-ID tatsächlich verfügbar ist.
372. Frankfurt-Modellangebot
Frankfurt bietet aktuelle Qwen-Modelle über workspace-dedizierte Domains und verschiedene Deployment Scopes.
Nicht jedes China-Beijing-Modell ist automatisch auch in Frankfurt verfügbar.
373. Knowledge Base
Model Studios integrierte Knowledge-Base-Funktion ist regional eingeschränkt und laut aktueller Dokumentation nicht in Frankfurt verfügbar.
RAG in Europa muss daher gegebenenfalls über eigene Retrieval-Infrastruktur umgesetzt werden.
374. Eigenes RAG
Embeddings, Reranker und Vektordatenbanken können unabhängig von Model Studios eingebauter Knowledge Base betrieben werden.
Das erlaubt vollständige Kontrolle über Datenresidenz und Indexierung.
375. API-Versionierung
Kompatible Protokolle können sich langsamer ändern als Modellnamen.
Clienttests sollten Modell- und API-Regression getrennt erkennen.
376. Self-Hosting
Offene Qwen-Modelle können vollständig auf eigener Hardware oder eigener Cloud betrieben werden.
Dann übernimmt der Betreiber Inferenz, Security, Logging, Updates und Safety.
377. Hugging Face
Qwen veröffentlicht offizielle Gewichte auf dem verifizierten Qwen-Account.
Repositoryrevision und Modellkarte gehören zum Reproduktionsstand.
378. ModelScope
ModelScope ist der parallele Alibaba-nahe Distributionweg.
Für Regionen mit eingeschränktem Hugging-Face-Zugang ist er besonders wichtig.
379. Transformers
Qwen wird eng mit Hugging Face Transformers integriert.
Neue Qwen3.8-Architekturen benötigen ausreichend aktuelle Versionen.
380. vLLM
vLLM ist ein zentraler Serverpfad für Qwen3/3.5/3.8 und Coder-Modelle.
Neue multimodale und Reasoningfunktionen erfordern passende Parser.
381. SGLang
SGLang ist ebenfalls stark im Qwen-Serving-Ökosystem verankert.
MoE- und Long-Context-Optimierungen unterscheiden sich je Backend.
382. llama.cpp
GGUF-konvertierte Qwen-Modelle sind auf CPU, Apple Silicon und Consumer-GPUs nutzbar.
Nicht alle neuesten multimodalen Features werden sofort unterstützt.
383. Ollama
Ollama bietet einfache lokale Qwen-Installation.
Modelltags können Quantisierung und Template abstrahieren und sollten für Benchmarks genauer aufgelöst werden.
384. LM Studio
LM Studio macht Qwen-GGUFs grafisch lokal nutzbar.
Das Programm ist ein Drittprodukt und nicht Teil der Qwen-Entwicklung.
385. MLX
Apple-Silicon-Systeme verwenden häufig MLX-Konvertierungen für Qwen.
Unified Memory erlaubt große Modelle, Geschwindigkeit bleibt von Speicherbandbreite abhängig.
386. GGUF
GGUF bündelt quantisierte Gewichte und Metadaten für llama.cpp-nahe Laufzeiten.
Community-GGUFs sind nicht automatisch offizielle Alibaba-Artefakte.
387. GPTQ
Qwen hat seit frühen Generationen offizielle oder communitynahe GPTQ-Nutzung unterstützt.
Post-Training-Quantisierung kann Modellqualität beeinflussen.
388. AWQ
AWQ ist ein weiterer etablierter Qwen-Quantisierungspfad.
Gerade bei Coder- und Reasoningmodellen wird Toolqualität nach Quantisierung neu geprüft.
389. FP8
Servermodelle können FP8 für Gewichte, Aktivierungen oder Cache verwenden.
Hardwareunterstützung ist entscheidend.
390. Niedrigere Präzision
Neuere Hardware- und Servingpfade experimentieren mit noch geringeren Präzisionen.
Speichergewinn darf nicht ohne Taskevaluation übernommen werden.
391. RAM
Lokaler Speicherbedarf besteht aus Gewichten, KV-/State-Cache, Runtime und multimodalen Encodern.
Eine reine Modelldateigröße ist kein vollständiger RAM-Bedarf.
392. VRAM
GPU-Speicher bestimmt, ob ein Modell vollständig auf der GPU liegt oder Offloading benötigt.
MoE spart Rechenleistung pro Token, aber nicht zwangsläufig Gewichtsspeicher.
393. Unified Memory
Macs und andere Unified-Memory-Systeme können große quantisierte Qwen-Modelle ohne getrennten VRAM laden.
Bandbreite begrenzt die Tokens-pro-Sekunde-Leistung.
394. Qwen3.8-27B lokal
Der offene 27B-Checkpoint ist die naheliegende aktuelle 3.8-Klasse für starke lokale Systeme.
Er ist multimodal und Apache-2.0-lizenziert.
395. Qwen3.8-2.4T-A95B lokal
Das offene Max-Modell ist technisch herunterladbar, aber für einzelne Consumerrechner unrealistisch.
Verteiltes Datacenter-Serving ist die praktische Zielklasse.
396. Qwen3.8-Flash-Next lokal
125B Hauptparameter plus N-Gram-Speicher und nur 6B aktive Parameter machen Flash-Next architektonisch besonders effizient.
Gesamtspeicher bleibt dennoch groß.
397. N-Gram-Embedding im Host Memory
Flash-Next kann große deterministische Embeddingtabellen außerhalb des GPU-Speichers halten.
Asynchrones Prefetching soll GPU-Belastung reduzieren.
398. Qwen3.5 lokal
0.8B bis 397B-A17B bieten eine sehr breite multimodale Größenleiter.
9B, 27B und 35B-A3B sind für lokale High-End-Systeme besonders interessant.
399. Qwen3.6 lokal
27B dense und 35B-A3B MoE sind die offenen Hauptgrößen.
MoE bietet hohe Geschwindigkeit, dense 27B ein einfacheres Speicher-/Servingprofil.
400. Qwen3 lokal
0.6B bis 32B dense sowie 30B-A3B bieten viele lokale Optionen.
Qwen3 bleibt wegen breiter Runtimeunterstützung auch 2026 praktisch relevant.
401. Qwen2.5 lokal
Qwen2.5-7B/14B/32B bleiben sehr verbreitet, weil zahlreiche Finetunes und Quantisierungen existieren.
Neuere Generationen sind nicht für jede ältere Runtime stabiler.
402. Qwen Coder lokal
Qwen2.5-Coder-7B/32B und kleinere Qwen3-Coder-Derivate eignen sich für private Codinghilfe.
Repositoryzugriff und Shelltools erhöhen lokale Sicherheitsrisiken.
403. Vision lokal
Qwen2.5-VL, Qwen3-VL und Qwen3.5/3.6/3.8 multimodale Modelle können Bilder lokal analysieren.
Visionencoder und Bildtokens erhöhen Speicher und Latenz.
404. TTS lokal
Qwen3-TTS-0.6B/1.7B lassen sich lokal zur Sprachsynthese verwenden.
Voice Clone sollte nur mit berechtigtem Referenzaudio erfolgen.
405. Qwen-Image lokal
Offene Qwen-Image-Varianten können auf eigener GPU betrieben werden.
Bildgeneratoren benötigen andere Pipelines als LLM-Serving.
406. Embeddings lokal
Qwen3-Embedding 0.6B/4B/8B eignet sich hervorragend für private RAG-Systeme.
Lokales Embedding verhindert, dass Dokumenttexte an eine externe Embedding-API gesendet werden.
407. Reranker lokal
Lokale Qwen3-Reranker verbessern Retrieval ohne Cloudtransfer.
Sie sind rechenintensiver als reine Vektorsuche.
408. Hashes
Gewichtsdateien, Config, Tokenizer und Template werden mit Hashes archiviert.
Nur der Modellname reicht für Reproduzierbarkeit nicht.
409. Revision
Hugging-Face-/ModelScope-Commit oder Snapshotdatum wird festgehalten.
Upstream-Repositories können Dokumentation und Dateien nachträglich ändern.
410. Chattemplate
Qwen-Generationen unterscheiden sich bei Thinking, Tool Calls und Multimodalformaten.
Ein falsches Template kann ein gutes Modell massiv verschlechtern.
411. Sampling
Temperature, top_p, top_k, Seed und Reasoning Effort gehören zum Teststand.
Benchmarkvergleiche ohne Samplingangaben sind unvollständig.
412. Kontext
Maximale Kontextlänge kann nativ, extrapoliert oder cloudseitig unterschiedlich sein.
Für lokale Nutzung ist zusätzlich Speicherverbrauch entscheidend.
413. Datenschutz bei Self-Hosting
Vollständig lokaler Betrieb sendet Prompts nicht automatisch an Alibaba.
Websuche, Telemetrie, MCP oder externe Tools können dennoch Daten übertragen.
414. Safety lokal
Lokale Gewichte können ohne Cloudmoderation betrieben werden.
Der Betreiber muss eigene Richtlinien und Aktionsgrenzen setzen.
415. Updates
Lokale Modelle verändern sich nicht automatisch.
Das verbessert Reproduzierbarkeit, erfordert aber manuelle Security- und Qualitätsupdates.
416. Datenschutz hängt vom Qwen-Zugang ab
Qwen Studio, Alibaba Cloud Model Studio, Drittanbieter-Hosting und vollständig lokales Self-Hosting besitzen unterschiedliche Datenpfade.
Eine pauschale Aussage wie „Qwen speichert Daten in China“ ist für alle Varianten technisch falsch.
417. Qwen Studio Consumer
Qwen Studio verweist auf eigene Terms of Service und Privacy Policy.
Consumerchat wird deshalb getrennt von Model-Studios Unternehmenskontrollen bewertet.
418. Model Studio
Alibaba Cloud erklärt für Model Studio, Kundengeschäftsdaten nicht ohne ausdrückliche Zustimmung für Modelltraining zu verwenden.
Diese Aussage ist besonders für API-/Enterprise-Nutzung relevant.
419. Verschlüsselung
Model Studio dokumentiert verschlüsselte Übertragung und AES-256-Schutz für übermittelte Anwendungs-/Trainingsdaten.
Verschlüsselung ersetzt keine korrekte Region- und Berechtigungswahl.
420. EU-Datenresidenz
Frankfurt kann einen EU-restricted Deployment Scope verwenden, bei dem Inferenz innerhalb der EU bleiben soll.
Der Workspace muss ausdrücklich entsprechend konfiguriert werden.
421. Global ist nicht EU-only
Ein Frankfurt-Workspace mit Global-Scope nutzt einen größeren weltweiten Inferenzpool.
Der Standort des API-Endpunkts allein garantiert daher keine EU-only-Verarbeitung.
422. Regionale API Keys
Keys und Endpunkte sind regionsgebunden.
Ein versehentlich verwendeter Singapore-/Beijing-Key kann einen anderen Datenpfad erzeugen.
423. Workspace-Isolation
Model Studio isoliert Ressourcen und Zugriffe zwischen Workspaces.
Organisationen sollten Projekte und Teams nicht unnötig in einem gemeinsamen Workspace mischen.
424. RAM/IAM
Alibaba-Cloud-Berechtigungen können Rollen und Zugriffe auf Model Studio steuern.
Least Privilege wird auch für AI-Entwicklerkonten angewandt.
425. Explizite Zustimmung
Alibaba nennt ausdrückliche Zustimmung als Voraussetzung, wenn Kundengeschäftsdaten zur Modellverbesserung verwendet werden sollen.
Verträge und konkrete Produktoptionen bleiben maßgeblich.
426. Öffentliche Trainingsdaten
Qwen-Training nutzt öffentlich verfügbare Webdaten neben Partner-, gelabelten und synthetischen Daten.
Öffentlich zugänglich bedeutet nicht automatisch frei von Urheberrecht oder personenbezogenen Informationen.
427. Partnerdaten
Alibaba nennt auch nichtöffentliche Daten aus Partnervereinbarungen.
Solche Datenquellen können Nutzungsbeschränkungen besitzen.
428. Labeling-Daten
Bezahlte und vertraglich beschaffte gelabelte Daten ergänzen das Training.
Menschen können dabei sensible Inhalte sehen; Governance ist daher Teil der Datenpipeline.
429. Synthetische Trainingsdaten
Qwen nutzt eigene Modelle zur Erzeugung zusätzlicher Trainingsbeispiele.
Dies kann Datenlücken füllen, aber auch bestehende Modellverzerrungen reproduzieren.
430. PI-Filtering
Alibaba beschreibt Filterung personenbezogener Informationen in der Pretrainingvorbereitung.
Kein Filterverfahren kann garantieren, dass sämtliche personenbezogenen Daten entfernt werden.
431. Urheberrecht
Die Trainingsdatenzusammenfassung weist auf möglicherweise urheberrechtlich, markenrechtlich oder patentrechtlich geschütztes Material hin.
Model Output ist deshalb nicht automatisch frei von Rechten Dritter.
432. Usage Policy vom 9. April 2026
Qwen Studio veröffentlicht klare Regeln zu illegalen, schädlichen und hochriskanten Anwendungen.
Die Richtlinie umfasst auch APIs und offene Modelle als vom Anbieter formulierten Nutzungsstandard.
433. Gesundheit
Qwen fordert bei medizinischer Diagnose oder Behandlung professionelle menschliche Aufsicht.
AI-Ausgaben werden nicht als autonome medizinische Entscheidung genutzt.
434. Recht und Steuern
Individuelle Rechts-, Steuer-, Finanz- und Versicherungsberatung soll von qualifizierten Fachpersonen geprüft werden.
Diese Grenze gilt unabhängig vom Modellbenchmark.
435. Kritische Infrastruktur
Die Nutzungsrichtlinie untersagt beziehungsweise beschränkt riskante Eingriffe in kritische Systeme.
Agentische Tools benötigen dort besonders strenge technische Freigaben.
436. Minderjährige
Qwen-Regeln enthalten besondere Schutzanforderungen für Minderjährige.
Personenbezogene Daten von Kindern dürfen nicht leichtfertig in multimodale Systeme hochgeladen werden.
437. Biometrie
Unzulässige Überwachung oder biometrische Identifikation ohne Zustimmung wird in der Usage Policy beschränkt.
Visionmodelle können technisch Gesichter erkennen, rechtliche Nutzung ist eine andere Frage.
438. Prompt Injection
Qwen-Agenten können untrusted Webseiten, E-Mails, Dateien und MCP-Resultate lesen.
Externe Inhalte dürfen keine Systemrechte überschreiben.
439. Visuelle Prompt Injection
Native multimodale Qwen3.5–3.8-Modelle können Text in Screenshots erkennen.
Auch ein Bild kann versteckte manipulative Agentenanweisungen enthalten.
440. MCP-Sicherheit
Qwen-Agent und Qwen Code unterstützen MCP.
Serverauthentizität, Toolscope und Datenquelle werden vor Aktivierung geprüft.
441. Shellrechte
Qwen Code kann je nach Konfiguration Shellbefehle ausführen.
Repositories, Home-Verzeichnis und Produktionssysteme sollten nicht unnötig vollständig freigegeben werden.
442. Subagenten
Mehrere Subagenten können parallel unterschiedliche Tools einsetzen.
Rechte und Kontexte sollten pro Subagent begrenzt werden.
443. Secrets
API Keys, SSH-Schlüssel, Tokens und `.env`-Dateien gehören nicht in Modellkontext oder öffentliche Agentenlogs.
Bei Exposition werden Secrets rotiert.
444. Software Supply Chain
Ein Coding-Agent kann Abhängigkeiten installieren und Scripts ausführen.
Paketquelle, Version und Installationsscripts werden geprüft.
445. Generierter Code
Qwen kann syntaktisch korrekten, aber unsicheren Code erzeugen.
Tests, Static Analysis und Security Review bleiben Pflicht.
446. Browseraktionen
Visuelle Agenten können Buttons oder Formulare bedienen.
Zahlung, Veröffentlichung und Accountänderungen brauchen Bestätigung.
447. Robotik
Qwen-VLA und Qwen-Robot erweitern AI in physische Aktionen.
Realwelt-Aktoren benötigen harte Sicherheitsgrenzen außerhalb des Foundation-Modells.
448. Voice Clone
Qwen3-TTS kann Stimmen aus kurzer Referenz imitieren.
Einwilligung, Identitätsschutz und Betrugsprävention sind zentrale Einsatzbedingungen.
449. Bildgenerierung
Qwen-Image kann realistische Personen, Interfaces und Dokumentlayouts erzeugen.
Generierte Darstellungen sollten nicht als dokumentarische Originale ausgegeben werden.
450. Deepfakes
Bild-, Video- und Sprachmodelle können Identitätsimitation erleichtern.
Kennzeichnung und Zustimmung sind wichtiger als technische Perfektion.
451. Embeddings und RAG
Embeddings können sensible semantische Informationen aus Dokumenten kodieren.
Lokale Embedding-/Reranker-Modelle sind bei vertraulichen Daten besonders nützlich.
452. Vektorindizes
Ein Embedding ist kein anonymes Datenobjekt.
Zugriff auf Vektorindex und Quelldokumente wird genauso geschützt wie andere Unternehmensdaten.
453. Context Cache
Prefix Caching kann Teile wiederkehrender Prompts temporär für Inferenzoptimierung verwenden.
Cachepolitik wird von dauerhaftem Chatverlauf und Training getrennt betrachtet.
454. Logging
API-, Agenten- und Debuglogs können Prompts, Tools und sensible Resultate enthalten.
Redaction, Retention und Zugriffskontrolle gehören zur Produktionsarchitektur.
455. Audit
Agentensysteme sollten Modell, Tool, Aktion, Zeit, Nutzer und Freigabe nachvollziehbar protokollieren.
Auditlogs selbst sind schützenswerte Daten.
456. Self-Hosting als Datenschutzoption
Offene Qwen-Gewichte erlauben Inferenz ohne Alibaba-Cloudtransfer.
Das ist ein wesentlicher Vorteil gegenüber ausschließlich proprietären Modellen.
457. Lokale Telemetrie
Ein lokales Modell garantiert nicht, dass Launcher, Betriebssystem oder Plugins keine Telemetrie senden.
Netzwerkpfade werden separat geprüft.
458. China-hosted Qwen
Beijing-Model-Studio-Scope verarbeitet Inferenz im chinesischen Mainland.
Für europäische personenbezogene Daten ist das eine andere Complianceklasse als Frankfurt/EU.
459. International-Scope
Singapore schließt das chinesische Mainland aus, ist aber nicht auf die EU begrenzt.
Für EU-only-Anforderungen ist Frankfurt/EU die präzisere Wahl.
460. Bias
Mehrsprachige und multimodale Trainingsdaten enthalten gesellschaftliche und kulturelle Verzerrungen.
Benchmarks messen nur einen Teil davon.
461. Politisch sensible Inhalte
Gehostete Qwen-Dienste können regionalen Inhaltsregeln und Plattformpolicies unterliegen.
Hosted Service und offener Checkpoint können deshalb unterschiedlich antworten.
462. Hosted vs. Weight
Systemprompt, Moderation, Search und Tooling können das Verhalten eines Cloudprodukts stark verändern.
Ein lokaler Test darf nicht automatisch als Qwen-Studio-Verhalten verallgemeinert werden.
463. Human in the Loop
Je höher das Risiko einer Aktion, desto stärker sollte menschliche Freigabe eingesetzt werden.
Das gilt besonders bei Code, Robotik, Finanzen, Kommunikation und Veröffentlichung.
464. Rollback
Agentische Änderungen an Dateien und Repositories werden versioniert.
Git, Backups und Entwurfszustände sind Sicherheitswerkzeuge.
465. Fail-safe
Bei unklarem Ziel oder unsicherem Toolzustand stoppt der Agent.
Er soll nicht durch plausibles Raten eine irreversible Aktion erzwingen.
466. Qwen einfach ausprobieren
Qwen Studio ist der unkomplizierteste Consumerzugang zu aktuellen Modellen und Medienfunktionen.
Für vertrauliche Geschäftsdaten ist ein kontrollierter Model-Studio- oder Self-Hosting-Pfad geeigneter.
467. Maximale Cloudqualität
Qwen3.8-Max ist die aktuelle Qwen-Flagshipklasse.
Kosten und Latenz sind höher als bei Flash.
468. Günstige schnelle API
Qwen3.8-Flash eignet sich für hohe Anfragevolumen, Tool Workflows und Standardaufgaben.
Bei sehr komplexem Reasoning kann Max besser sein.
469. Aktuell stark lokal
Qwen3.8-27B ist die naheliegende aktuelle offene 3.8-Größe für leistungsfähige lokale Systeme.
Apache 2.0 vereinfacht viele Entwicklungs- und kommerzielle Szenarien.
470. Architekturforschung
Qwen3.8-Flash-Next ist besonders interessant für Forschung an Qwen4-Vorläufertechnik, QSA, Gated Residual und N-Gram Memory.
Der Checkpoint ist eher Architektur-/Effizienzstudie als einfach nur „kleiner Qwen3.8-Max“.
471. Effizientes lokales Multimodalmodell
Qwen3.6-35B-A3B bietet nur 3B aktive Parameter bei starker multimodaler und agentischer Leistung.
Gesamtgewichte bleiben deutlich größer als 3B.
472. Dense Workstationmodell
Qwen3.6-27B eignet sich für Nutzer, die eine dichte 27B-Architektur bevorzugen.
Sie ist gut vergleichbar mit Qwen3.8-27B als neuere Alternative.
473. Kleines multimodales Modell
Qwen3.5-4B oder 9B sind gute lokale Kandidaten für Vision plus Text mit begrenzter Hardware.
Sehr kleine Modelle haben weniger robustes Reasoning.
474. Breit unterstütztes Text-/Reasoningmodell
Qwen3 besitzt ein extrem reifes lokales Ökosystem und viele Größen.
Für rein textuelle Aufgaben kann es trotz neuerer Multimodalmodelle praktisch bleiben.
475. Coding-Agent
Qwen3-Coder beziehungsweise aktuelle Qwen3.8-Modelle in Qwen Code eignen sich für Repositoryarbeit.
Der Harness und dessen Rechte sind genauso wichtig wie die Modellwahl.
476. RAG
Qwen3-Embedding plus Qwen3-Reranker eignet sich für textbasierte Wissenssysteme.
Für Bilder, Screenshots und Video sind Qwen3-VL-Embedding/Reranker passender.
477. Multimodales Retrieval
Qwen3-VL-Embedding kann Text, Bilder und Videos in einen gemeinsamen Suchraum abbilden.
Große Datenbestände profitieren von zweistufigem Retrieval.
478. Bild-/Dokumentanalyse
Qwen3.8-27B, Qwen3.6 oder Qwen3-VL sind geeignete offene Visionmodelle.
Das richtige Modell hängt von Hardware und Agentenbedarf ab.
479. Langes Video
Qwen3.7-Plus/Flash und andere aktuelle Cloud-Multimodalmodelle sind für lange Videos ausgelegt.
Lokale Analyse langer Videos benötigt sehr viel Kontext- und Compute-Budget.
480. Audio + Vision + Sprache
Omni-Modelle sind sinnvoll, wenn mehrere Modalitäten in Echtzeit zusammenspielen sollen.
Für reine Textaufgaben ist der Omni-Stack unnötig schwer.
481. Sprachsynthese
Qwen3-TTS eignet sich für mehrsprachige TTS, Voice Design und berechtigtes Voice Cloning.
Ein allgemeines Qwen-LLM ersetzt kein spezialisiertes TTS-Modell.
482. Bildgenerierung
Qwen-Image-3.0 ist die aktuelle Qwen-Bildgenerationslinie.
Bildverständnis wird dagegen von Qwen-VL beziehungsweise den nativ multimodalen Qwen3.x-Modellen übernommen.
483. EU-Datenresidenz
Für API-Daten mit EU-Anforderung ist ein Frankfurt-Workspace mit EU-Deployment-Scope der naheliegende Alibaba-Cloud-Pfad.
Global-Scope darf nicht versehentlich gewählt werden.
484. Sensible Daten
Vollständiges Self-Hosting mit lokalem Embedding, Reranking und Modell bietet maximale Datenkontrolle.
Externe Search-/MCP-Tools werden dann bewusst einzeln zugelassen.
485. Produktions-API
Model Studio eignet sich für skalierbaren gehosteten Zugriff ohne eigene Inferenzcluster.
Snapshot-Modelle werden für reproduzierbare Produktionen bevorzugt.
486. Historische Modellforschung
Offizielle Blogs, GitHub, Hugging Face und ModelScope sind die wichtigsten Primärquellen.
Qwen-Studio-Antworten selbst ersetzen keine Modellkarte.
487. Robotik
Qwen-VLA und Qwen-Robot sind für embodied AI geeignet.
Sie benötigen reale Sicherheitssteuerung und sind kein allgemeiner Chatersatz.
488. Agententraining
Qwen-AgentWorld eignet sich als Forschungsgrundlage für simulierte Agentenumgebungen.
Simulationserfolg muss gegen reale Umgebungen validiert werden.
489. Ältere Qwen2.5-Modelle
Qwen2.5 bleibt sinnvoll, wenn eine stabile Runtime, bestehender Finetune oder geringe Migrationskosten wichtiger sind.
Neu ist nicht automatisch für jede Anwendung besser.
490. Lizenzkritische Anwendung
Apache-2.0-Checkpoints wie Qwen3.8-27B sind oft einfacher zu bewerten als Modelle mit eigener Qwen-Lizenz.
Die konkrete LICENSE-Datei muss trotzdem gelesen werden.
491. Problemhilfe: Qwen-Modell wird nicht gefunden
Mögliche Ursache: Region, Scope oder Modellname passen nicht zusammen.
Sinnvolle Prüfung: aktuelle Modellliste der konkreten Region prüfen.
492. Problemhilfe: API-Key funktioniert nicht
Mögliche Ursache: Key gehört zu anderer Region oder Workspace.
Sinnvolle Prüfung: Keyverwaltung und Base-URL gemeinsam prüfen.
493. Problemhilfe: Frankfurt-Aufruf scheitert
Mögliche Ursache: workspace-dedizierte Domain oder Workspace-ID fehlt.
Sinnvolle Prüfung: eu-central-1-Domain prüfen.
494. Problemhilfe: EU-Datenresidenz ist unklar
Mögliche Ursache: Workspace verwendet Global statt EU.
Sinnvolle Prüfung: Deployment Scope prüfen.
495. Problemhilfe: Anfrage läuft global
Mögliche Ursache: Global-Scope bewusst oder versehentlich gewählt.
Sinnvolle Prüfung: Workspace-Scope umstellen.
496. Problemhilfe: Alias verhält sich plötzlich anders
Mögliche Ursache: beweglicher Mainline-Name wurde aktualisiert.
Sinnvolle Prüfung: datierte Snapshot-ID pinnen.
497. Problemhilfe: Altes Modell liefert Fehler
Mögliche Ursache: Snapshot/Mainline wurde retired.
Sinnvolle Prüfung: Retirement-Hinweis und Nachfolger prüfen.
498. Problemhilfe: Qwen3.8-Max passt nicht lokal
Mögliche Ursache: 2.4T-A95B ist Datacenterklasse.
Sinnvolle Prüfung: 27B/Flash-Next oder Cloud verwenden.
499. Problemhilfe: Max-Lizenz passt nicht zum Projekt
Mögliche Ursache: 2.4T-Modell besitzt eigene Qwen3.8-Max-Lizenz.
Sinnvolle Prüfung: LICENSE direkt lesen.
500. Problemhilfe: 27B verarbeitet Bild nicht
Mögliche Ursache: Runtime/Processor unterstützt Multimodalformat nicht.
Sinnvolle Prüfung: aktuelle Transformers/vLLM-Version nutzen.
501. Problemhilfe: Flash-Next wird als Qwen4 erkannt
Mögliche Ursache: Architektur ist nur Vorschau.
Sinnvolle Prüfung: Modellname Qwen3.8-Flash-Next beibehalten.
502. Problemhilfe: Flash-Next braucht viel RAM
Mögliche Ursache: 125B Hauptmodell plus 51B N-Gram-Embeddings.
Sinnvolle Prüfung: Host-Memory-/Quantisierungspfad planen.
503. Problemhilfe: 1M lokal funktioniert schlecht
Mögliche Ursache: 262K ist nativ, 1M extrapoliert.
Sinnvolle Prüfung: YaRN/Runtime und Retrieval testen.
504. Problemhilfe: Antwort denkt zu lange
Mögliche Ursache: Thinking/Reasoning Effort zu hoch.
Sinnvolle Prüfung: Non-Thinking oder geringeren Effort wählen.
505. Problemhilfe: Altes Thinking stört neuen Turn
Mögliche Ursache: preserve_thinking hält Reasoningkontext.
Sinnvolle Prüfung: Funktion gezielt deaktivieren.
506. Problemhilfe: `/think` funktioniert nicht
Mögliche Ursache: neueres Modell/API nutzt andere Steuerung.
Sinnvolle Prüfung: Modellspezifische Doku prüfen.
507. Problemhilfe: Function Call hat falsche Argumente
Mögliche Ursache: Schema oder Modellinterpretation fehlerhaft.
Sinnvolle Prüfung: Parameter validieren.
508. Problemhilfe: Parallele Tools widersprechen sich
Mögliche Ursache: Agenten sehen unterschiedlichen Zustand.
Sinnvolle Prüfung: Ergebnisse synchronisieren.
509. Problemhilfe: MCP-Server ist nicht erreichbar
Mögliche Ursache: Auth, URL oder Scope falsch.
Sinnvolle Prüfung: Server separat testen.
510. Problemhilfe: Agent folgt Webseitenanweisung
Mögliche Ursache: untrusted Content wurde als Instruktion behandelt.
Sinnvolle Prüfung: System-/Toolgrenzen erzwingen.
511. Problemhilfe: Screenshot manipuliert Agenten
Mögliche Ursache: Bild enthält adversarialen Text.
Sinnvolle Prüfung: visuelle Inhalte als untrusted behandeln.
512. Problemhilfe: Qwen Code startet nicht
Mögliche Ursache: Installer/Node/Plattformproblem.
Sinnvolle Prüfung: aktuelle offizielle Installation prüfen.
513. Problemhilfe: Qwen OAuth funktioniert nicht mehr
Mögliche Ursache: kostenloser OAuth-Pfad wurde April 2026 eingestellt.
Sinnvolle Prüfung: Coding Plan oder eigenen Provider konfigurieren.
514. Problemhilfe: Agent ändert falsche Datei
Mögliche Ursache: Workspace oder Shellrechte zu breit.
Sinnvolle Prüfung: Git und Working Directory prüfen.
515. Problemhilfe: Subagent liefert widersprüchliches Ergebnis
Mögliche Ursache: eigener Kontext oder Tools unterscheiden sich.
Sinnvolle Prüfung: Hauptagent synthetisiert und prüft.
516. Problemhilfe: Zu viele Subagenten
Mögliche Ursache: Parallelisierung erhöht API- und Toolkosten.
Sinnvolle Prüfung: Agentenzahl begrenzen.
517. Problemhilfe: Repository passt nicht in Kontext
Mögliche Ursache: Repo > Modellfenster oder Dateiauswahl schlecht.
Sinnvolle Prüfung: Search/Index/RAG einsetzen.
518. Problemhilfe: Code sieht gut aus, Tests scheitern
Mögliche Ursache: Modell hat Fachlogik oder API falsch verstanden.
Sinnvolle Prüfung: Tests und Diff prüfen.
519. Problemhilfe: Secret im Agentenlog
Mögliche Ursache: Agent durfte `.env` oder Credentialdateien lesen.
Sinnvolle Prüfung: Secret rotieren und Rechte reduzieren.
520. Problemhilfe: Agent installiert unsichere Abhängigkeit
Mögliche Ursache: Paketname/Herkunft ungeprüft.
Sinnvolle Prüfung: Registry und Lockfile kontrollieren.
521. Problemhilfe: Qwen3-Coder schlechter als Qwen3.8
Mögliche Ursache: älteres Spezialmodell wird mit neuerem Generalisten verglichen.
Sinnvolle Prüfung: aktuelle Taskbenchmarks testen.
522. Problemhilfe: Qwen2.5-Coder wirkt alt
Mögliche Ursache: neuere Agentenmodelle sind stärker.
Sinnvolle Prüfung: bei stabilem Legacyworkflow behalten oder migrieren.
523. Problemhilfe: RAG findet falsche Dokumente
Mögliche Ursache: Embedding/Chunking/Instruction ungeeignet.
Sinnvolle Prüfung: Retrievaltreffer direkt prüfen.
524. Problemhilfe: Reranker verschlechtert Treffer
Mögliche Ursache: falsche Query-Dokument-Formatierung.
Sinnvolle Prüfung: Instruction und Kandidaten prüfen.
525. Problemhilfe: Kürzere Embeddingdimension verliert Qualität
Mögliche Ursache: MRL-Dimension zu aggressiv reduziert.
Sinnvolle Prüfung: höhere Dimension vergleichen.
526. Problemhilfe: Multimodale Suche verfehlt Text
Mögliche Ursache: VL-Embedding ist nicht optimal für reinen Text.
Sinnvolle Prüfung: Qwen3-Embedding gegenprüfen.
527. Problemhilfe: OCR liest Zahl falsch
Mögliche Ursache: Auflösung/Layout oder Modellfehler.
Sinnvolle Prüfung: Originalbild vergrößern und kontrollieren.
528. Problemhilfe: Videoantwort verpasst Szene
Mögliche Ursache: Frame-/Tokenbudget priorisiert andere Abschnitte.
Sinnvolle Prüfung: Zeitbereich eingrenzen.
529. Problemhilfe: Omni versteht Sprache falsch
Mögliche Ursache: Audioqualität, Dialekt oder Streamingfehler.
Sinnvolle Prüfung: Transkript gegenprüfen.
530. Problemhilfe: TTS spricht Namen falsch
Mögliche Ursache: Aussprache oder Sprache nicht eindeutig.
Sinnvolle Prüfung: phonetische/Sprachhinweise verwenden.
531. Problemhilfe: Voice Clone klingt instabil
Mögliche Ursache: Referenzaudio zu kurz/rauschig.
Sinnvolle Prüfung: saubere berechtigte Referenz verwenden.
532. Problemhilfe: Qwen-Image schreibt Text falsch
Mögliche Ursache: generative Typografie bleibt probabilistisch.
Sinnvolle Prüfung: Text im Output kontrollieren.
533. Problemhilfe: Bearbeitung verändert Hintergrund
Mögliche Ursache: generatives Editing rekonstruiert mehr als Zielbereich.
Sinnvolle Prüfung: Originalvergleich durchführen.
534. Problemhilfe: Bild wirkt fotografisch echt
Mögliche Ursache: Qwen-Image-3.0 ist stark auf Realismus optimiert.
Sinnvolle Prüfung: AI-Herkunft dokumentieren.
535. Problemhilfe: Code Interpreter ist unsicher
Mögliche Ursache: lokaler Demoexecutor ist nicht zwingend sandboxed.
Sinnvolle Prüfung: isolierte Umgebung verwenden.
536. Problemhilfe: Built-in Knowledge Base fehlt in Frankfurt
Mögliche Ursache: Feature ist regional eingeschränkt.
Sinnvolle Prüfung: eigenes RAG aufbauen.
537. Problemhilfe: Context Cache trifft nicht
Mögliche Ursache: Prefix nicht identisch oder Cache abgelaufen.
Sinnvolle Prüfung: cache hit tokens aus Response prüfen.
538. Problemhilfe: Kosten höher als erwartet
Mögliche Ursache: Cache-Miss oder Long-Context-Tier.
Sinnvolle Prüfung: Usage/Cache-Felder prüfen.
539. Problemhilfe: 1M-Kontext wird teuer
Mögliche Ursache: Preis und Rechenaufwand steigen mit Tokens.
Sinnvolle Prüfung: Retrieval/Kompression einsetzen.
540. Problemhilfe: Modell übersieht Detail in 1M
Mögliche Ursache: Attention ist nicht perfektes Retrieval.
Sinnvolle Prüfung: kritische Passage referenzieren.
541. Problemhilfe: Modell in Beijing vorhanden, Frankfurt nicht
Mögliche Ursache: regionale Modellkataloge unterscheiden sich.
Sinnvolle Prüfung: Frankfurt-Liste prüfen.
542. Problemhilfe: Batchantwort kommt nicht interaktiv
Mögliche Ursache: Batch ist asynchroner Kostenpfad.
Sinnvolle Prüfung: Realtime-Endpunkt verwenden.
543. Problemhilfe: Fine-Tune wird schlechter
Mögliche Ursache: Trainingsdaten/Hyperparameter übersteuern Basismodell.
Sinnvolle Prüfung: Evalset und Baseline vergleichen.
544. Problemhilfe: Trainingsdaten enthalten Geheimnisse
Mögliche Ursache: Workspace-Dataset wurde ungeprüft befüllt.
Sinnvolle Prüfung: Datenklassifikation und Rechte prüfen.
545. Problemhilfe: Sorge, Businessdaten trainierten Qwen
Mögliche Ursache: Model Studio erklärt keine Nutzung ohne Zustimmung.
Sinnvolle Prüfung: Vertrag/Consent-Setting prüfen.
546. Problemhilfe: Qwen Studio verhält sich anders als API
Mögliche Ursache: Produktoberfläche nutzt Tools/Routing/anderes Modell.
Sinnvolle Prüfung: Modell und Featurepfad dokumentieren.
547. Problemhilfe: Auto liefert wechselnde Ergebnisse
Mögliche Ursache: Routingmodell kann wechseln.
Sinnvolle Prüfung: konkretes Modell auswählen.
548. Problemhilfe: Deep Research zitiert schwache Quelle
Mögliche Ursache: Searchranking bevorzugt falsche Seite.
Sinnvolle Prüfung: Primärquelle öffnen.
549. Problemhilfe: Research vermischt alt und neu
Mögliche Ursache: Publikationsdatum nicht sauber priorisiert.
Sinnvolle Prüfung: Ereignis- und Veröffentlichungsdatum prüfen.
550. Problemhilfe: 35B-A3B ist langsamer als erwartet
Mögliche Ursache: Gewichtsladen/Memorybandbreite statt FLOPs limitiert.
Sinnvolle Prüfung: Runtime und Offload messen.
551. Problemhilfe: 27B dense wirkt langsamer als A3B
Mögliche Ursache: alle 27B Parameter sind aktiv.
Sinnvolle Prüfung: dense/MoE passend zur Hardware wählen.
552. Problemhilfe: 4-Bit-Modell denkt schlechter
Mögliche Ursache: Quantisierung verändert Gewichte.
Sinnvolle Prüfung: 8-Bit/BF16 gegenprüfen.
553. Problemhilfe: GGUF verhält sich anders
Mögliche Ursache: Communitytemplate oder Quantisierung weicht ab.
Sinnvolle Prüfung: Metadaten und Basisrevision prüfen.
554. Problemhilfe: MLX liefert andere Ausgabe
Mögliche Ursache: Backend/Sampling/Quant unterscheiden sich.
Sinnvolle Prüfung: gleiche Parameter einstellen.
555. Problemhilfe: vLLM erkennt Modell nicht
Mögliche Ursache: Version ist vor neuer Qwen-Architektur.
Sinnvolle Prüfung: Runtime aktualisieren.
556. Problemhilfe: Transformers-Klasse fehlt
Mögliche Ursache: Bibliothek ist zu alt.
Sinnvolle Prüfung: offizielle Mindestversion prüfen.
557. Problemhilfe: Kommerzielle Nutzung unklar
Mögliche Ursache: Qwen-Generation/Größe hat eigene Lizenz.
Sinnvolle Prüfung: konkrete LICENSE-Datei lesen.
558. Problemhilfe: Qwen3.8-Max wird als Apache bezeichnet
Mögliche Ursache: Max-Checkpoint hat eigene Lizenz.
Sinnvolle Prüfung: Model Card prüfen.
559. Problemhilfe: Medizinische Antwort klingt kompetent
Mögliche Ursache: Modell ist keine Fachperson.
Sinnvolle Prüfung: Leitlinie und Arzt prüfen.
560. Problemhilfe: Rechtsantwort nennt konkrete Frist
Mögliche Ursache: Jurisdiktion/Stand kann falsch sein.
Sinnvolle Prüfung: Primärrecht und Fachperson prüfen.
561. Problemhilfe: Finanzanalyse wirkt sicher
Mögliche Ursache: Marktdaten/Annahmen können fehlen.
Sinnvolle Prüfung: aktuelle Primärdaten prüfen.
562. Problemhilfe: VLA-Aktion ist gefährlich
Mögliche Ursache: Wahrnehmungs-/Planungsfehler.
Sinnvolle Prüfung: Safety Controller und Not-Aus verwenden.
563. Problemhilfe: Produktionsmodell wird abgekündigt
Mögliche Ursache: Lifecycle erreicht Retirement.
Sinnvolle Prüfung: Migration früh testen.
564. Mythos: Qwen ist ein einzelnes Modell
Qwen ist eine große Familie aus LLMs, Vision, Audio, TTS, Image, Retrieval, Robotik und Agententools.
Der konkrete Modellname ist für jede technische Aussage notwendig.
565. Mythos: Qwen Studio ist das Modell
Qwen Studio ist die Consumeroberfläche.
Sie kann unterschiedliche Modelle, Search und Medienwerkzeuge orchestrieren.
566. Mythos: Qwen Studio und Alibaba Cloud Model Studio sind dasselbe
Qwen Studio ist Consumerassistent; Model Studio ist Cloud-Entwicklerplattform.
Datenschutz- und Funktionsregeln unterscheiden sich.
567. Mythos: Alle Qwen-Modelle sind Open Source
Viele Qwen-Gewichte sind offen, Max-/Plus-Cloudmodelle und einzelne Releases besitzen andere Zugangsmodelle.
Open Weight, Apache 2.0 und proprietär werden getrennt.
568. Mythos: Alle offenen Qwen-Modelle sind Apache 2.0
Qwen3.8-27B ist Apache 2.0, Qwen3.8-Max nutzt eine eigene Lizenz.
Die LICENSE-Datei des konkreten Repositories ist maßgeblich.
569. Mythos: Qwen-Max war schon immer offen
Max war lange proprietäre Cloudklasse.
Qwen3.8 markiert erstmals die Öffnung einer Max-Klasse.
570. Mythos: Qwen4 wurde am 26. August 2026 veröffentlicht
Qwen3.8-Flash-Next ist eine Architekturvorschau auf Qwen4.
Der veröffentlichte Modellname bleibt Qwen3.8-Flash-Next.
571. Mythos: Flash-Next ist nur ein 6B-Modell
6B bezeichnet aktivierte Hauptmodellparameter pro Token.
Das Hauptmodell besitzt rund 125B plus zusätzliche 51B N-Gram-Embeddingparameter.
572. Mythos: Qwen3.6-35B-A3B braucht nur Speicher wie 3B
A3B beschreibt aktive MoE-Parameter.
Die gesamten 35B Gewichte müssen trotzdem gespeichert beziehungsweise verteilt werden.
573. Mythos: 1M Kontext ist dauerhaftes Memory
Kontext ist temporäre Eingabe einer Inferenz.
Persistente Projekte, Chats oder Agentenmemory sind getrennte Systeme.
574. Mythos: 1M Kontext ersetzt RAG
Sehr langer Kontext kann relevante Details übersehen und ist teuer.
Retrieval kann gezielter, günstiger und auditierbarer sein.
575. Mythos: Context Cache ist Benutzer-Memory
Cache dient Wiederverwendung identischer Präfixe.
Er ist keine persönliche Erinnerung.
576. Mythos: Thinking ist immer besser
Thinking verbessert schwierige Aufgaben, kostet aber Zeit und Tokens.
Non-Thinking ist für viele Extraktions- und Standardaufgaben sinnvoller.
577. Mythos: Lange Reasoningkette beweist Richtigkeit
Modelle können Fehler ausführlich begründen.
Finale Fakten und Toolresultate werden unabhängig geprüft.
578. Mythos: Qwen3-Coder ist automatisch das beste Qwen für jede Programmieraufgabe
Neuere Qwen3.8-Modelle können bei Agentic Coding stärker sein.
Der Task und Harness entscheiden.
579. Mythos: Qwen-VL generiert Bilder
Qwen-VL versteht Bilder und erzeugt Text.
Bildgenerierung gehört zur Qwen-Image-Linie.
580. Mythos: Qwen-Image ist das Vision-Verständnismodell
Qwen-Image erzeugt beziehungsweise bearbeitet Bilder.
Qwen3.x/VL analysieren visuelle Eingaben.
581. Mythos: Omni und TTS sind dasselbe
Omni verarbeitet mehrere Modalitäten end-to-end.
Qwen3-TTS ist eine spezialisierte Sprachsynthesefamilie.
582. Mythos: Technisch mögliche Voice Clones dürfen beliebig genutzt werden
Stimmimitation kann Identitäts-, Betrugs- und Persönlichkeitsrechtsrisiken erzeugen.
Einwilligung bleibt notwendig.
583. Mythos: Embeddingmodelle können normal chatten
Embeddings erzeugen Vektorrepräsentationen.
Reranker erzeugen Relevanzscores; beide sind keine normalen Assistenzchatmodelle.
584. Mythos: Ein Reranker ersetzt einen Vektorindex
Reranking ist zu teuer für Millionen Dokumente.
Embedding erledigt Recall, Reranker präzisiert eine kleinere Kandidatenmenge.
585. Mythos: OpenAI-kompatible API macht Qwen zu OpenAI
Kompatibilität betrifft Request-/Responseformen.
Modell, Provider, Datenpfad und Toolsemantik bleiben Alibaba/Qwen.
586. Mythos: Claude Code mit Qwen benutzt Claude
Claude Code kann über Anthropic-kompatible Qwen-Endpunkte ein Qwen-Modell ansprechen.
Client und Foundation-Modell sind getrennt.
587. Mythos: Jeder Frankfurt-Aufruf bleibt automatisch in der EU
Frankfurt kann Global oder EU als Deployment Scope nutzen.
Nur EU-Scope begrenzt Inferenz entsprechend.
588. Mythos: Singapore International ist EU-konform, weil China ausgeschlossen ist
International schließt Mainland China aus, ist aber nicht EU-only.
Für reine EU-Residenz ist Frankfurt/EU vorgesehen.
589. Mythos: Alibaba trainiert Model Studio automatisch mit allen Kundendaten
Alibaba erklärt, Kundengeschäftsdaten nicht ohne ausdrückliche Zustimmung zum Modelltraining zu verwenden.
Consumerprodukte und andere Verträge werden getrennt bewertet.
590. Mythos: Ein lokal geladenes Qwen sendet Prompts automatisch an Alibaba
Die Gewichte selbst brauchen keine Alibaba-Verbindung.
Runtime, Telemetrie oder externe Tools können trotzdem Netzwerkzugriffe verursachen.
591. Mythos: Quantisiertes Qwen ist exakt identisch
Quantisierung verändert numerische Repräsentation.
Reasoning, Vision und Tool Use sollten neu getestet werden.
592. Mythos: Jeder GGUF mit Qwen im Namen ist offiziell
Viele GGUFs stammen aus der Community.
Uploader, Basisrevision und Hash werden geprüft.
593. Mythos: Ein Herstellerbenchmark entscheidet die Modellwahl
Benchmarksetup, Harness und Prompt beeinflussen Ergebnisse.
Eigene produktive Aufgaben sind der entscheidende Test.
594. Mythos: Mehr Gesamtparameter bedeuten automatisch mehr Kosten pro Token
MoE aktiviert nur einen Teil der Experten.
Speicher, FLOPs und aktive Parameter müssen getrennt bewertet werden.
595. Mythos: Dense und MoE gleicher Gesamtgröße sind direkt vergleichbar
Bei dense Modellen sind alle Parameter aktiv; MoE aktiviert nur Teilmengen.
Hardware- und Latenzprofile unterscheiden sich stark.
596. Mythos: Qwen3-Next ist einfach eine Beta von Qwen3
Next führte neue Architekturkomponenten ein, die später Qwen3.5 prägten.
Es ist ein eigenständiger Forschungs-/Übergangsrelease.
597. Mythos: Qwen Code und Qwen-Agent sind Modelle
Beides sind Agenten-/Frameworkschichten.
Sie können unterschiedliche Qwen- oder Drittmodelle nutzen.
598. Mythos: Offene Gewichte besitzen dieselben Cloud-Safetyfilter
Self-Hosting kann Servermoderation vollständig umgehen.
Der Betreiber übernimmt eigene Safety.
599. Mythos: Die neueste Qwen-Version ist immer die beste Wahl
Ältere Modelle können kleiner, stabiler, besser unterstützt oder lizenzseitig einfacher sein.
Modellwahl hängt von Aufgabe, Hardware und Risiko ab.
600. Qwen-7B als Anfang sichern
Der 3. August 2023 ist der zentrale Startpunkt der offenen Qwen-Sprachmodellgeschichte.
Original-Checkpoint, Tech Memo, Lizenz und Chatvariante gehören zusammen.
601. Qwen-VL 2023
Der frühe Visionrelease dokumentiert Grounding, OCR und Multi-Image-Fähigkeit.
Spätere native Multimodalität darf diesen Stand nicht rückwirkend überschreiben.
602. Qwen-Agent 2023
Das Agentenframework zeigt, dass Tool Use früh zur Qwen-Strategie gehörte.
Frameworkversion und Modellgeneration werden getrennt archiviert.
603. Qwen-Audio 2023
Die erste Audio-Language-Generation zeigt den Übergang von Text zu universeller Wahrnehmung.
Audioverständnis und spätere TTS/Omni-Ausgabe werden getrennt gehalten.
604. Qwen1.5
Qwen1.5 ist besonders wegen Transformerintegration, Quantisierung und Größenvielfalt historisch wichtig.
32B und 110B dokumentieren unterschiedliche Scalingpfade.
605. Qwen2
Qwen2 erweitert Mehrsprachigkeit, 128K Kontext und MoE.
57B-A14B ist der frühe große MoE-Hauptcheckpoint.
606. Qwen2.5
Die Modellparty aus General, Coder, Math und VL bildet einen der größten offenen Releaseblöcke der Qwen-Geschichte.
Lizenzen werden pro Größe gesichert.
607. QwQ
QwQ dokumentiert die getrennte Reasoningphase vor Qwen3 Hybrid Thinking.
Preview und reifer 32B-Stand werden nicht vermischt.
608. Qwen2.5-Omni
Thinker/Talker und End-to-End-Multimodalität sind wichtige Architekturmerkmale.
Omni bleibt getrennt von TTS- und VL-Spezialmodellen.
609. Qwen3
Hybrid Thinking, 119 Sprachen und die breite dense/MoE-Reihe markieren den nächsten Hauptsprung.
Originalrelease und 2507-Revisionen werden separat notiert.
610. Qwen3-Coder
480B-A35B, 7.5T Tokens, Agent RL und Qwen Code machen den Juli-2025-Release besonders wichtig.
Harness- und Modellversion gehören gemeinsam zum Agentenbenchmark.
611. Qwen3-Embedding/Reranker
Die Retrievalmodelle dokumentieren Qwens Entwicklung vom Generator zum kompletten RAG-Stack.
Embeddingdimension, Instruction und Modellgröße gehören zum Teststand.
612. Qwen3-VL
Der September-2025-Release verbindet Thinking und visuelle Agenten.
235B-A22B Instruct und Thinking werden getrennt archiviert.
613. Qwen3-Next
80B-A3B und Gated DeltaNet sind der direkte Architekturvorläufer von Qwen3.5.
Der Name darf nicht rückwirkend zu Qwen4 umgedeutet werden.
614. Qwen-Image
Bildgeneration und Editing besitzen eigene Modellhistorie von 2025 über 2.0 bis 3.0.
Prompts, Modellrevision und Originalinput werden bei Edits gemeinsam aufbewahrt.
615. Qwen3-TTS
Cloud-TTS, Voice Design, Voice Clone und offene 0.6B/1.7B-Checkpoints bilden eine eigene Sprachgenerationslinie.
Referenzaudio bleibt aus Datenschutzgründen getrennt geschützt.
616. Qwen3.5
Native Multimodalität, GDN+MoE und 201 Sprachen machen 3.5 zum Fundament der 2026er Serie.
397B-A17B und kleinere Größen werden separat identifiziert.
617. Qwen3.6
35B-A3B und 27B dokumentieren die Stabilitäts-/Coding-Iteration.
Qwen3.6-Max-Preview bleibt ausdrücklich proprietärer Previewstand.
618. Qwen3.7
Plus, Max und Flash bilden eine Cloudgeneration mit datierten Snapshots.
Mainline-Aliase und Snapshotnamen werden gemeinsam dokumentiert.
619. Qwen3.8-Max
Der 2. August 2026 markiert die neue Spitzenklasse; offene 2.4T-A95B-Gewichte folgen am 12. August.
Die spezielle Qwen3.8-Max-Lizenz gehört zwingend zum Archivpaket.
620. Qwen3.8-27B
Der 14. August 2026 liefert eine wesentlich leichter selbsthostbare Apache-2.0-Alternative.
Multimodalität und Generation Config werden mitgesichert.
621. Qwen3.8-Flash-Next
Der 26. August 2026 ist am Stichtag der jüngste große offene Architekturrelease.
QSA, Gated Residual, N-Gram Embedding, Muon und Qwen4-Vorschau sind Kernmerkmale.
622. Qwen4-Grenze
Am 1. September 2026 existiert Qwen4 als angekündigte Architekturfolge, nicht als vollständige veröffentlichte Familie.
Dieser Grenzstand verhindert spätere rückwirkende Datierungsfehler.
623. Model Studio
Cloudmodellnamen, Regionen, Scopes und Preise verändern sich schnell.
Datierte Dokumentationssnapshots sind für eine Webarchivseite wichtiger als nur Produktmarketing.
624. Frankfurt/EU
Die 2026 dokumentierte EU-restricted Inferenz ist ein wichtiger regionaler Infrastrukturstand.
Workspace-, Region- und Scope-Konfiguration werden gemeinsam festgehalten.
625. Qwen Code
Terminalagent, Authentifizierungsmodell, Subagenten und Toolset entwickeln sich unabhängig vom Foundation-Modell.
CLI-Version und Modellprovider werden daher separat dokumentiert.
626. Qwen-AgentWorld
Language World Models markieren den Schritt, Agentenumgebungen selbst modellieren zu lassen.
Paper, Checkpoint und AgentWorldBench gehören zusammen.
627. Qwen-VLA / Robot
Embodied-AI-Modelle zeigen den Übergang von Bildschirmagenten zu physischer Aktion.
Hardware, Robotertyp und Safety Controller werden mit dem Modellstand archiviert.
628. Vergleich mit DeepSeek
Die DeepSeek-Chronik zeigt eine ähnlich starke Open-Weight- und Effizienzlinie mit MoE, MLA, R1 und V4.
Qwen ist breiter multimodal diversifiziert und besitzt deutlich mehr Modellgrößen und Spezialfamilien.
629. Vergleich mit Llama/Muse
Die Meta-AI-/Llama-/Muse-Chronik verbindet Open Weights mit einem großen Social-Ökosystem.
Qwen verbindet Open Weights stattdessen eng mit Alibaba Cloud, Coding, Multimodalität und Robotik.
630. Vergleich mit ChatGPT
Die ChatGPT-Chronik ist stärker produkt- und cloudzentriert.
Qwen bietet wesentlich mehr vollständig herunterladbare Modellgrößen.
631. Vergleich mit Claude
Die Claude-Chronik fokussiert wenige proprietäre Spitzenmodelle und professionelle Agentenwerkzeuge.
Qwen deckt parallel kleine lokale Modelle bis 2.4T-MoE ab.
632. Vergleich mit Gemini
Die Gemini-Chronik zeigt ebenfalls ein extrem breites Multimodal-, Search- und Agentenökosystem.
Qwens besonderer Unterschied ist die umfangreiche Open-Weight-Reihe über fast alle Größenklassen.
633. Vergleich mit Perplexity
Die Perplexity-Chronik ist Search-/Orchestrierungszentriert und kann verschiedene Foundationmodelle einbinden.
Qwen ist selbst ein Foundation-Modell- und Cloudprovider.
634. Vergleich mit Grok
Die Grok-Chronik ist enger mit X und Echtzeit-Social-Kontext verbunden.
Qwen setzt stärker auf offene Modellverteilung und Alibaba-Cloud-Infrastruktur.
635. Vergleich mit Copilot
Die Microsoft-Copilot-Chronik integriert KI tief in Windows und Microsoft 365.
QwenWork und Qwen Code verfolgen ähnliche Agentenarbeitsziele, aber mit einer großen offenen Modellbasis.
636. Zur KI-Werkzeugübersicht
Die Seite KI-Werkzeuge bleibt der übergreifende Vergleich von Methoden, Stärken und Risiken.
Diese Chronik vertieft ausschließlich Alibaba Qwen.
637. Wohin Qwen zeigt
Qwen3.8-Flash-Next kündigt Qwen4 als nächste Architekturphase an: noch effizientere Long-Context-Attention, skalierbare Pattern-Memory und agentische Multimodalität.
Parallel wächst die Familie in Robotik, Retrieval, Sprache, Bild und Cowork weiter.
638. Fazit: Qwen ist 2026 eines der breitesten offenen KI-Ökosysteme
Zwischen Qwen-7B im August 2023 und Qwen3.8-Flash-Next im August 2026 liegen nur drei Jahre, aber mehrere vollständige Architektur- und Produktgenerationen.
Die besondere Stärke ist die Kombination aus Open Weights, sehr vielen Größen, nativer Multimodalität, Cloudbereitstellung, Coding-Agenten und spezialisierter Forschung.
639. Rechtlicher und archivischer Hinweis
Diese Seite ist eine private, nicht-kommerzielle technische und historische Dokumentation. Alibaba, Alibaba Cloud, Qwen, Tongyi Qianwen, DashScope, Qoder und weitere Produktnamen sind Marken beziehungsweise Bezeichnungen ihrer jeweiligen Rechteinhaber.
Modelle, Lizenzen, Preise, Regionen, Datenschutzregeln, API-Namen und Funktionen können sich kurzfristig ändern. Für aktuelle Entscheidungen sind die jeweils gültigen Hersteller-, Lizenz- und Vertragsinformationen maßgeblich.
Weiterführende interne Themen
Die übergreifende Methoden- und Sicherheitsseite bleibt KI-Werkzeuge. Die parallelen großen Chroniken dokumentieren OpenAI ChatGPT, Anthropic Claude, Google Gemini, xAI / SpaceXAI Grok, Meta AI / Llama / Muse, Perplexity AI, DeepSeek und Microsoft Copilot.