sslxy

Alibaba Qwen

Tongyi Qianwen · Qwen-7B · Qwen1.5 · Qwen2/2.5 · QwQ · Qwen3 · Coder · VL · Omni · TTS · Image · Qwen3.5/3.6/3.7/3.8 · Qwen Code · Agent · Robotik

Stand: September 2026

Qwen ist 2026 eines der breitesten offenen KI-Ökosysteme überhaupt. Aus Qwen-7B und Tongyi Qianwen von 2023 entstanden innerhalb von drei Jahren dichte und Mixture-of-Experts-Sprachmodelle, Reasoning, Coding, Vision, Audio, Omni-Modelle, TTS, Bildgenerierung, Embeddings, Reranker, Robotik und komplette Agentenwerkzeuge.

Die technische Hauptlinie führt von Qwen1.5 → Qwen2 → Qwen2.5 → QwQ → Qwen3 mit Hybrid Thinking → Qwen3-Next → Qwen3.5/3.6/3.7 → Qwen3.8. Parallel entstanden spezialisierte Familien wie Qwen3-Coder, Qwen3-VL, Qwen3-TTS und Qwen-Image.

Der aktuelle Endpunkt am 1. September 2026 ist besonders interessant: Qwen3.8-Max bildet die Cloud-Spitzenklasse und wurde erstmals auch als sehr großes offenes Max-Modell veröffentlicht; Qwen3.8-27B ist die handlichere offene multimodale Klasse. Qwen3.8-Flash-Next vom 26. August ist dagegen ausdrücklich eine offene Architekturvorschau auf Qwen4 – noch kein vollständiger Qwen4-Release.

System Diagnostic

> ALIBABA QWEN · STATUS 2026-09-01
ROOTQwen-7B · 03.08.2023 · Tongyi Qianwen / Alibaba OPEN LINEQwen1.5 → Qwen2/2.5 → Qwen3 → Qwen3.5/3.6 → Qwen3.8 REASONINGQwQ → Qwen3 Hybrid Thinking → adaptive reasoning CODINGQwen2.5-Coder → Qwen3-Coder → Qwen Code → Qwen3.8 MULTIMODALVL · Omni · TTS · Image · native multimodal Qwen3.5+ RETRIEVALQwen3-Embedding/Reranker · Qwen3-VL-Embedding/Reranker CURRENT MAXQwen3.8-Max · 2.4T class · open 2.4T-A95B weights CURRENT LOCALQwen3.8-27B · Apache-2.0 · multimodal ARCH PREVIEWQwen3.8-Flash-Next · 26.08.2026 · early Qwen4 architecture preview CLOUDModel Studio / DashScope / QwenCloud · OpenAI + Responses + Anthropic paths EUFrankfurt eu-central-1 · Global or EU-restricted deployment scope CORE RULEModel ≠ Studio ≠ Cloud API ≠ Agent ≠ Search ≠ local runtime
Für belastbare Qwen-Vergleiche werden Modellrevision, Lizenz, Region, Deployment Scope, Thinking, Chattemplate, Runtime, Quantisierung und Agentenharness gemeinsam dokumentiert.

Qwen-Zeitlinie

  • 03.08.2023Qwen-7B und Qwen-7B-Chat werden offen veröffentlicht.
  • 22.08.2023Qwen-VL bringt Bildverständnis und Grounding.
  • 25.09.2023Qwen-14B und Qwen-Agent.
  • 30.11.2023Qwen-72B, Qwen-1.8B und Qwen-Audio.
  • 04.02.2024Qwen1.5 mit stark verbesserter Open-Weight-Developer-Erfahrung.
  • 07.06.2024Qwen2: mehr Sprachen, MoE und bis 128K Kontext.
  • 09.08.2024Qwen2-Audio.
  • 19.09.2024Qwen2.5 mit General-, Coder- und Math-Modellen.
  • 11/2024QwQ-32B-Preview startet die offene Reasoninglinie.
  • 26.01.2025Qwen2.5-VL.
  • 27.03.2025Qwen2.5-Omni mit Thinker/Talker.
  • 29.04.2025Qwen3 mit Hybrid Thinking.
  • 05.06.2025Qwen3-Embedding und Reranker.
  • 22.07.2025Qwen3-Coder und Qwen Code.
  • 11.09.2025Qwen3-Next als Architekturbrücke.
  • 22.09.2025Qwen3-VL.
  • 25.01.2026Qwen3-Max-Thinking.
  • 02/2026Qwen3.5 und Qwen-Image-2.0.
  • 04/2026Qwen3.6-Plus, 35B-A3B und 27B.
  • 05–07/2026Qwen3.7; Qwen-VLA; Robot Suite; AgentWorld; Qwen-Image-3.0.
  • 02.08.2026Qwen3.8-Max.
  • 12.08.2026Qwen3.8-2.4T-A95B wird offen veröffentlicht.
  • 14.08.2026Qwen3.8-27B wird offen veröffentlicht.
  • 26.08.2026Qwen3.8-Flash-Next als offene Qwen4-Architekturvorschau.
[qwen/einordnung]

1. Qwen ist Modellfamilie, Forschungsprojekt, Consumer-Assistent und Cloudplattform

Qwen bezeichnet 2026 nicht nur ein Sprachmodell. Der Name umfasst offene und proprietäre Foundation-Modelle, multimodale Spezialmodelle, Qwen Studio, Qwen Code, Qwen-Agent und die Bereitstellung über Alibaba Cloud Model Studio beziehungsweise QwenCloud.

Bei jeder technischen Aussage müssen Modell, Checkpoint, Produktoberfläche, Cloudregion, API-Endpunkt, Agentenharness und lokale Runtime getrennt benannt werden.

[qwen/tongyi]

2. Tongyi Qianwen als ursprünglicher Markenname

Qwen ist die international gebräuchliche Kurzform der Alibaba-Modellfamilie, die ursprünglich als Tongyi Qianwen beziehungsweise 通义千问 bekannt wurde.

Historische Quellen und frühe Lizenzen verwenden deshalb teilweise andere Produktnamen als heutige Qwen-Seiten.

[qwen/alibaba]

3. Alibaba Group und Alibaba Cloud

Die Qwen-Modelle werden vom Qwen Team innerhalb des Alibaba-Ökosystems entwickelt und über Alibaba Cloud kommerziell bereitgestellt.

Offene Modellgewichte und Alibaba-Cloud-Dienste sind technisch und vertraglich getrennte Ebenen.

[qwen/model-studio]

4. Alibaba Cloud Model Studio

Model Studio ist die Cloudplattform für Qwen und weitere Drittmodelle.

Sie bietet API-Zugriff, Fine-Tuning, Deployment, Evaluierung, Regionen, Workspaces und OpenAI-kompatible Schnittstellen.

[qwen/qwen-studio]

5. Qwen Studio

Qwen Studio ist die Endnutzeroberfläche für Chat, multimodale Aufgaben, Bilder, Deep Research und weitere Qwen-Funktionen.

Qwen Studio darf nicht mit Alibaba Cloud Model Studio verwechselt werden.

[qwen/qwencloud]

6. QwenCloud

Neuere Qwen-Dokumentation verwendet QwenCloud als Entwickler- und API-Marke für Qwen-Modelle.

Historische DashScope-/Model-Studio-Endpunkte bleiben für bestehende Integrationen relevant.

[qwen/dashscope]

7. DashScope

DashScope ist der etablierte Alibaba-API-Pfad für Qwen-Modelle und weitere generative Dienste.

Die genaue Base-URL hängt von Region und Bereitstellungsscope ab.

[qwen/open-models]

8. Offene Gewichte als Kernstrategie

Qwen veröffentlicht seit Qwen-7B regelmäßig Modellgewichte auf Hugging Face und ModelScope.

Nicht jede Qwen-Variante ist jedoch offen; Max- und Plus-Modelle waren lange proprietäre Cloudmodelle.

[qwen/proprietary]

9. Proprietäre Qwen-Modelle

Qwen-Max, Qwen-Plus und manche Cloudvarianten existieren als gehostete Modelle ohne vollständig veröffentlichte Gewichte.

Ein API-Modellname darf daher nicht automatisch als herunterladbarer Checkpoint behandelt werden.

[qwen/license-layer]

10. Lizenz ist Teil der Modellidentität

Qwen-Generationen verwenden unterschiedliche Lizenzmodelle.

Viele neuere offene Modelle nutzen Apache 2.0, während einzelne Größen oder Max-Releases eigene Qwen-Lizenzen besitzen.

[qwen/model-vs-product]

11. Modell ≠ Produkt

Qwen3.8-Max kann in Qwen Studio oder API genutzt werden; Qwen Studio ergänzt jedoch Websuche, Dateien, Bildfunktionen, Deep Research und andere Produktwerkzeuge.

Ein lokal geladenes Qwen3.8-Modell besitzt diese Produktoberfläche nicht automatisch.

[qwen/model-vs-agent]

12. Modell ≠ Agent

Qwen Code, Qwen-Agent und QwenWork kombinieren Modelle mit Tools, Speicher, Dateisystem, MCP oder Subagenten.

Agentenleistung hängt deshalb genauso vom Harness wie vom Foundation-Modell ab.

[qwen/model-vs-memory]

14. Kontext ≠ dauerhaftes Gedächtnis

Ein 1M-Kontextfenster ist temporärer Inferenzkontext.

Persistentes Projektwissen oder gespeicherte Chats sind Produktschichten.

[qwen/multimodal-map]

15. Qwen ist stark multimodal diversifiziert

Die Modellfamilie umfasst Text, Bild- und Videoverständnis, Audio, Sprache, TTS, Bildgenerierung, Embeddings, Reranker, Robotik und Vision-Language-Action.

Diese Spezialmodelle werden getrennt von der allgemeinen Qwen-LLM-Hauptlinie archiviert.

[qwen/current-map]

16. Aktueller Stand am 1. September 2026

Der aktuelle Spitzenbereich umfasst Qwen3.8-Max, Qwen3.8-27B, Qwen3.8-Flash sowie Qwen3.8-Flash-Next als offene Architekturvorschau Richtung Qwen4.

Parallel bleiben Qwen3.7, Qwen3.6, Qwen3.5, Qwen3-Coder, Qwen3-VL, Qwen3-TTS, Qwen-Image und spezialisierte Retrieval-/Robotiklinien relevant.

[qwen/qwen7b]

17. 3. August 2023: Qwen-7B und Qwen-7B-Chat

Alibaba veröffentlichte Qwen-7B als ersten öffentlich verfügbaren Qwen-Sprachmodellcheckpoint und Qwen-7B-Chat als menschlich ausgerichtete Variante.

Dieser Release ist der Beginn der offenen Qwen-Modellgeschichte.

[qwen/qwen7b-pretrain]

18. Qwen-7B Pretraining

Der ursprüngliche Qwen-7B-Checkpoint wurde auf mehr als 2,2 Billionen Tokens vortrainiert.

Spätere Revisionen erweiterten Datenmenge und Kontext.

[qwen/qwen7b-chat]

19. Qwen-7B-Chat

Die Chatvariante wurde auf kuratierten Aufgaben-, Safety- und Service-Daten ausgerichtet.

Base und Chat sind unterschiedliche Checkpoints.

[qwen/qwen7b-context]

20. Früher Kontext

Der erste Qwen-7B-Stand startete mit wesentlich kürzerem Kontext und wurde später auf längere Fenster erweitert.

Historische Benchmarks müssen deshalb die konkrete Revision nennen.

[qwen/qwen7b-tools]

21. Tool Use

Schon die erste Qwen-Linie experimentierte mit Toolnutzung und Search-/Service-orientierten Daten.

Agenten waren damit kein erst 2025 nachträglich angefügtes Thema.

[qwen/quant-int4]

22. August 2023: Int4

Qwen veröffentlichte früh quantisierte Chatmodelle für deutlich geringeren Speicherbedarf.

Quantisierung wurde dadurch zu einem festen Bestandteil der Qwen-Developerstrategie.

[qwen/qwen-vl]

23. 22. August 2023: Qwen-VL

Qwen-VL und Qwen-VL-Chat erweiterten Qwen-7B um Bildverständnis, Textlesen und Grounding.

Die Modelle konnten Bild und Text verarbeiten sowie Bounding-Box-Bezüge ausgeben.

[qwen/vl-448]

24. 448-Pixel-Bildpfad

Qwen-VL nutzte gegenüber vielen damaligen offenen Visionmodellen eine höhere visuelle Auflösung.

Das verbesserte insbesondere OCR und feingranulare Dokumentfragen.

[qwen/vl-grounding]

25. Visual Grounding

Qwen-VL gehörte früh zu den allgemeinen Modellen, die sprachlich beschriebene Objekte in Bildern lokalisieren konnten.

Grounding ist eine andere Fähigkeit als bloße Bildbeschreibung.

[qwen/vl-multiimage]

26. Mehrere Bilder

Qwen-VL-Chat unterstützt Gespräche über mehrere Bilder.

Das erlaubt Vergleiche und visuelle Storylines, erhöht aber den Kontextbedarf.

[qwen/qwen14b]

27. 25. September 2023: Qwen-14B

Qwen-14B und Qwen-14B-Chat erweiterten die offene Sprachmodellreihe auf eine mittlere Größe.

Der Release fiel mit neuen Entwicklerwerkzeugen zusammen.

[qwen/qwen-agent]

28. 25. September 2023: Qwen-Agent

Qwen-Agent entstand als Framework für Tool Use, Planung, Memory und spätere RAG-/MCP-Anwendungen.

Das Framework wurde langfristig Backend und Referenzpfad für agentische Qwen-Anwendungen.

[qwen/qwen-cpp]

29. qwen.cpp

Parallel entstand eine lokale C++-Inferenzlinie.

Sie war ein frühes Signal für die starke lokale Qwen-Community.

[qwen/int8]

30. Oktober 2023: Int8

Qwen ergänzte Int8-Quantisierungen für 7B und 14B.

Qwen bot damit mehrere Hardware-/Qualitätsstufen an.

[qwen/qwen72b]

31. 30. November 2023: Qwen-72B

Qwen-72B und Qwen-72B-Chat wurden als große offene Textmodelle veröffentlicht.

Sie wurden auf rund drei Billionen Tokens trainiert und unterstützen 32K Kontext.

[qwen/qwen18b]

32. 30. November 2023: Qwen-1.8B

Mit 1.8B erschien zugleich ein sehr kleines Qwen-Modell.

Die Spannweite von 1.8B bis 72B machte die Familie für Edge, Forschung und Server gleichermaßen interessant.

[qwen/system-prompt]

33. Stärkere Systemprompts

Qwen-72B-Chat und Qwen-1.8B-Chat erhielten verbesserte Systemprompt-Unterstützung.

Systemprompt-Fähigkeit ist für Agenten und anwendungsspezifische Rollen wesentlich.

[qwen/qwen-audio]

34. 30. November 2023: Qwen-Audio

Qwen-Audio übertrug Qwen auf Sprache, Musik, Geräusche und weitere Audiosignale.

Das Basismodell nutzte Qwen-7B als Sprachkomponente und Whisper-large-v2 als Audioencoder.

[qwen/audio-tasks]

35. Mehr als 30 Audioaufgaben

Qwen-Audio wurde als Multi-Task-Audio-Language-Modell trainiert.

Speech Recognition, Sound Understanding, Music und Audio Question Answering teilen sich eine Modellarchitektur.

[qwen/audio-chat]

36. Qwen-Audio-Chat

Die Chatvariante ermöglicht mehrturnige Audio-/Textinteraktion.

Audioverständnis und Sprachsynthese sind dabei noch getrennt; Qwen-Audio gibt Text aus.

[qwen/qwen-2023-summary]

37. Qwen Ende 2023

Ende 2023 existieren bereits Textmodelle, Vision, Audio, Quantisierung, lokale Inferenz und ein Agentenframework.

Viele Themen der späteren Qwen3.x-Generation sind damit schon in Grundform vorhanden.

[qwen/q15]

38. 4. Februar 2024: Qwen1.5

Qwen1.5 modernisierte Modellqualität und vor allem die Developer Experience.

Die Modelle wurden direkt in Hugging Face Transformers integriert, sodass `trust_remote_code` für normale Nutzung entfiel.

[qwen/q15-sizes]

39. Qwen1.5-Größen

Die Reihe deckte 0.5B, 1.8B, 4B, 7B, 14B, 32B, 72B und später 110B ab.

Zusätzlich erschien eine MoE-Variante.

[qwen/q15-05]

40. 0.5B

Qwen1.5-0.5B war ein extrem kleines allgemeines Modell.

Solche Größen sind für Edgeexperimente und Distillation nützlich.

[qwen/q15-18]

41. 1.8B

Qwen1.5-1.8B setzte die kleine Qwen-Linie fort.

Leistung und Hardwarebedarf liegen weit unter den großen Serverklassen.

[qwen/q15-4]

42. 4B

Qwen1.5-4B schloss die Lücke zwischen Kleinmodellen und 7B.

Diese Größenklasse wurde später auch bei Qwen3 wieder strategisch wichtig.

[qwen/q15-7]

43. 7B

Qwen1.5-7B war der direkte Nachfolger der ursprünglichen Qwen-7B-Linie.

Die verbesserte Tokenisierung und Trainingserfahrung machte ihn deutlich einfacher integrierbar.

[qwen/q15-14]

44. 14B

14B blieb eine wichtige lokale Workstationgröße.

Sie war groß genug für robuste allgemeine Aufgaben, aber wesentlich handlicher als 72B.

[qwen/q15-32]

45. 2. April 2024: Qwen1.5-32B

Qwen veröffentlichte 32B als bewussten Sweet Spot zwischen Qualität und Speicherbedarf.

Die 30B-Klasse wurde später zu einer der beliebtesten Größen für lokale High-End-Systeme.

[qwen/q15-72]

46. 72B

Qwen1.5-72B war die starke große offene dense Klasse.

Sie blieb Hardwareintensiv, aber im Vergleich zu späteren 200B+-MoE-Modellen übersichtlicher.

[qwen/q15-110]

47. Qwen1.5-110B

Mit 110B überschritt Qwen erstmals 100 Milliarden Parameter in dieser Generation.

Der Release demonstrierte klassisches Scaling ohne grundlegende Rezeptänderung.

[qwen/q15-moe]

48. Qwen1.5-MoE

Qwen1.5 experimentierte zusätzlich mit Mixture-of-Experts.

MoE wird in Qwen3 und späteren Generationen wesentlich wichtiger.

[qwen/q15-context]

49. Kontextlängen

Mehrere Qwen1.5-Modelle unterstützen deutlich längere Kontexte als die frühesten 2023er Checkpoints.

Kontextunterstützung bleibt modellgrößen- und revisionsabhängig.

[qwen/q15-gptq]

50. GPTQ

Offizielle GPTQ-Quantisierungen wurden bereitgestellt.

GPTQ ist ein Post-Training-Quantisierungsverfahren für geringeren VRAM-Bedarf.

[qwen/q15-awq]

51. AWQ

Qwen bot zusätzlich AWQ-Quantisierungen.

AWQ versucht Aktivierungsstatistiken zu nutzen, um wichtige Gewichte bei niedriger Bitbreite besser zu erhalten.

[qwen/q15-gguf]

52. GGUF

Qwen1.5 unterstützte offiziell das GGUF-/llama.cpp-Ökosystem.

Das machte die Familie auf CPUs, Macs und Consumer-PCs leichter zugänglich.

[qwen/q15-transformers]

53. Native Transformers-Unterstützung

Qwen1.5 wurde in Transformers ab Version 4.37 direkt unterstützt.

Das reduziert Supply-Chain-Risiken gegenüber automatisch ausgeführtem Repositorycode.

[qwen/q15-vllm]

54. vLLM und SGLang

Qwen1.5 wurde von verbreiteten Serverframeworks unterstützt.

Qwen positionierte sich damit nicht nur als Modell, sondern als gut integrierbarer Open-Weight-Stack.

[qwen/q15-local]

55. Lokale Nutzung wird Mainstream

Qwen1.5 war eine der Generationen, bei denen lokale Qwen-Nutzung mit Ollama, llama.cpp und LM Studio breiter praktikabel wurde.

Die konkrete Quantisierung bestimmt Geschwindigkeit und Qualität.

[qwen/q2]

56. 7. Juni 2024: Qwen2

Qwen2 brachte eine neue Hauptgeneration mit offenen Base- und Instruct-Modellen.

Die Familie umfasste sowohl dichte Modelle als auch ein MoE-Modell.

[qwen/q2-sizes]

57. Qwen2-Größen

Qwen2 erschien als 0.5B, 1.5B, 7B, 57B-A14B und 72B.

57B-A14B ist ein Mixture-of-Experts-Modell mit 14B aktivierten Parametern.

[qwen/q2-languages]

58. 27 zusätzliche Sprachen

Qwen2 wurde auf deutlich breitere Mehrsprachigkeit ausgerichtet.

Die zusätzliche Sprachabdeckung kam zu Englisch und Chinesisch hinzu.

[qwen/q2-code]

59. Besseres Coding

Qwen2 verbesserte Codegenerierung und Codeverständnis gegenüber Qwen1.5.

Später spezialisierte Qwen2.5-Coder diese Linie weiter.

[qwen/q2-math]

60. Bessere Mathematik

Mathematische Fähigkeiten wurden bereits im allgemeinen Qwen2 ausgebaut.

Qwen2.5-Math folgte als Spezialfamilie.

[qwen/q2-128k]

61. Bis zu 128K Kontext

Qwen2-7B-Instruct und Qwen2-72B-Instruct unterstützen bis zu 128K Kontext.

Lange Kontexte bleiben abhängig von Servingframework und Speicher.

[qwen/q2-57]

62. Qwen2-57B-A14B

Das MoE-Modell kombiniert große Gesamtparameter mit deutlich weniger aktiven Parametern pro Token.

Die Architektur nimmt die später sehr starke Qwen-MoE-Linie vorweg.

[qwen/q2-72]

63. Qwen2-72B

72B bleibt als große dense Modellklasse erhalten.

Die Familie bietet damit dense und MoE als alternative Effizienzpfade.

[qwen/q2-tokenizer]

64. Tokenizer und Mehrsprachigkeit

Qwen2 nutzt einen breit ausgelegten Tokenizer für mehrsprachige und technische Inhalte.

Tokenizerwahl beeinflusst Kontextkosten und Sprachökonomie.

[qwen/q2-instruct]

65. Instruct statt Chat

Die Benennung bewegt sich stärker von `Chat` zu `Instruct`.

Das reflektiert den Branchentrend zu allgemeinen instruktionstauglichen Checkpoints.

[qwen/q2-tools]

66. Tool Use

Qwen2-Instruct bleibt für Function Calling und agentische Workflows nutzbar.

Qwen-Agent dient als Referenzframework.

[qwen/q2-license]

67. Offene Lizenzen

Viele Qwen2-Modelle werden unter permissiven Lizenzen veröffentlicht.

Die konkrete LICENSE-Datei bleibt pro Modell maßgeblich.

[qwen/q2-local]

68. Lokale Qwen2-Nutzung

Transformers, vLLM, SGLang und lokale Quantisierungen unterstützen Qwen2 schnell.

Die Developer Experience von Qwen1.5 wird damit fortgeführt.

[qwen/q2-vl]

69. Qwen2-VL

Die zweite Vision-Language-Generation erweitert visuelles Verständnis, Video und variable Bildauflösungen.

Sie wird 2025 von Qwen2.5-VL abgelöst.

[qwen/q2-vl-dynamic]

70. Dynamic Resolution

Qwen2-VL verarbeitet Bilder mit dynamischer Auflösung statt starrem Einheitsraster.

Das verbessert die Balance zwischen Detail und Tokenkosten.

[qwen/q2-vl-video]

71. Videoverständnis

Qwen2-VL erweitert Qwen deutlich in Richtung Videoanalyse.

Temporalität und Frameauswahl werden zu eigenen Modellproblemen.

[qwen/q2-audio]

72. 9. August 2024: Qwen2-Audio

Qwen2-Audio kann Audio und Text als Eingabe verarbeiten und Text ausgeben.

Es führt Voice Chat und Audio Analysis als zwei explizite Interaktionsmodi ein.

[qwen/q2-audio-voice]

73. Voice Chat

Sprachanweisungen können direkt verarbeitet werden, ohne dass der Nutzer erst separat eine ASR-Transkription erstellt.

Intern bleibt Sprachverständnis eine multimodale Modellfunktion.

[qwen/q2-audio-analysis]

74. Audio Analysis

Das Modell kann Audiodateien gezielt mit Textfragen analysieren.

Musik, Geräusche, Sprache und akustische Szenen sind unterschiedliche Aufgabentypen.

[qwen/q2-audio-7b]

75. Qwen2-Audio-7B

Die offene Modellfamilie erscheint als 7B Base und Instruct.

Sie bleibt ein Audio-zu-Text-System und kein vollwertiges Speech-to-Speech-Modell.

[qwen/q2-math-special]

76. Qwen2-Math

Die mathematische Speziallinie wird auf Qwen2-Basis weiterentwickelt.

Später erweitert Qwen2.5-Math Tool-Integrated Reasoning.

[qwen/q2-coder-transition]

77. Übergang zur Coder-Spezialisierung

Qwen2 verbessert bereits Code, aber der große Spezialrelease folgt mit Qwen2.5-Coder.

Allgemeines Coding und spezialisiertes Coding bleiben getrennte Benchmarks.

[qwen/q25]

78. 19. September 2024: Qwen2.5

Qwen2.5 wurde als breite offene Foundation-Modellgeneration veröffentlicht.

Qwen beschrieb den Release als besonders große Sammlung allgemeiner und spezialisierter Modelle.

[qwen/q25-sizes]

79. Qwen2.5-Größen

Die allgemeine Reihe erschien als 0.5B, 1.5B, 3B, 7B, 14B, 32B und 72B.

Diese Größenabdeckung macht die Familie vom Edgegerät bis zum Mehr-GPU-Server nutzbar.

[qwen/q25-05]

80. Qwen2.5-0.5B

0.5B ist ein sehr kleines Sprachmodell für leichte lokale Aufgaben.

Komplexes Reasoning bleibt gegenüber großen Varianten stark begrenzt.

[qwen/q25-15]

81. Qwen2.5-1.5B

1.5B ist ein kleiner, gut quantisierbarer Checkpoint.

Diese Klasse wurde häufig für On-Device- und Distillationsexperimente genutzt.

[qwen/q25-3]

82. Qwen2.5-3B

3B schließt die Lücke zwischen sehr kleinen und 7B-Modellen.

Die konkrete Lizenz unterscheidet sich bei Qwen2.5 teilweise nach Modellgröße.

[qwen/q25-7]

83. Qwen2.5-7B

7B wurde zu einem der verbreitetsten Qwen2.5-Checkpoints für lokale Nutzung.

Viele Finetunes und Communityderivate bauen darauf auf.

[qwen/q25-14]

84. Qwen2.5-14B

14B bietet mehr Kapazität bei noch relativ überschaubarem Hardwarebedarf.

Quantisiert ist die Klasse auf starken Consumerrechnern praktikabel.

[qwen/q25-32]

85. Qwen2.5-32B

32B wird ein sehr wichtiger Sweet Spot für starke lokale Sprachmodelle.

Die Größe taucht auch bei QwQ-32B als Reasoningbasis auf.

[qwen/q25-72]

86. Qwen2.5-72B

72B bildet die große offene dense Spitzenklasse der Generation.

Sie erfordert deutlich mehr RAM/VRAM und ist typischerweise Server- oder Workstationmaterial.

[qwen/q25-data]

87. Mehr Wissen und längere Texte

Qwen2.5 wurde mit stärkerem Fokus auf Wissen, strukturierte Daten, Code und lange Ausgaben trainiert.

Das verbessert praktische Aufgaben wie Tabellen, JSON und Dokumente.

[qwen/q25-structured]

88. Strukturierte Ausgabe

Qwen2.5 verbessert das Folgen strukturierter Formate.

JSON- und Tabellenkonsistenz bleiben trotzdem zu validieren.

[qwen/q25-long-output]

89. Lange Generierung

Die Generation wurde auf längere zusammenhängende Outputs ausgerichtet.

Lange Ausgabe erhöht das Risiko später Drift und Wiederholung.

[qwen/q25-coder]

90. Qwen2.5-Coder

Die Codingfamilie erscheint zunächst in mehreren Größen und wird später auf 32B erweitert.

Sie ist auf Programmierung, Codeverständnis und agentische Entwickleraufgaben spezialisiert.

[qwen/q25-coder-15]

91. Coder 1.5B

Die kleine Coder-Variante eignet sich für lokale Completion und einfache Entwicklerhilfe.

Repositoryreasoning bleibt begrenzt.

[qwen/q25-coder-7]

92. Coder 7B

7B bietet einen stärkeren lokalen Codingkompromiss.

FIM und Editorintegration sind zentrale Einsatzfelder.

[qwen/q25-coder-32]

93. Qwen2.5-Coder-32B

Die 32B-Version wird zu einem der stärksten offenen Coder ihrer Generation.

Sie dient 2025 auch als Werkzeug zur Bereinigung synthetischer Daten für Qwen3-Coder.

[qwen/q25-math]

94. Qwen2.5-Math

Die Math-Reihe erscheint in 1.5B, 7B und 72B.

Sie fokussiert mathematische Aufgaben und Tool-Integrated Reasoning.

[qwen/tir]

95. Tool-Integrated Reasoning

Qwen2.5-Math kann externe Python- oder Rechenwerkzeuge in mathematische Lösungsprozesse integrieren.

Toolresultate sind verifizierbarer als rein mental berechnete Zwischenschritte.

[qwen/q25-license]

96. Lizenzunterschiede

Viele Qwen2.5-Modelle nutzen Apache 2.0, während einzelne Größen andere Bedingungen besitzen.

Die Modellkarte bleibt die verbindliche Quelle.

[qwen/q25-vl]

97. 26. Januar 2025: Qwen2.5-VL

Qwen2.5-VL wird in 3B, 7B und 72B als Base/Instruct veröffentlicht.

Es verbessert OCR, Diagramme, Layout, Video und visuelle Agentenaufgaben.

[qwen/q25-vl-doc]

98. Dokumentverständnis

Qwen2.5-VL ist stark auf Text, Tabellen, Icons und Layouts in Bildern ausgerichtet.

Visuelles Dokumentverständnis ist mehr als OCR: räumliche Struktur beeinflusst Bedeutung.

[qwen/q25-vl-agent]

99. Visual Agent

Qwen2.5-VL kann Oberflächen und visuelle Zustände als Agentenkontext verarbeiten.

Aktionen benötigen weiterhin ein externes Computer-Use-Harness.

[qwen/q25-vl-video]

100. Video

Das Modell versteht längere Videoabläufe besser als die vorherige Generation.

Zeitliche Ereignisse und Untertitel können gemeinsam interpretiert werden.

[qwen/q25-omni]

101. 27. März 2025: Qwen2.5-Omni

Qwen2.5-Omni vereint Text, Bilder, Audio und Video als Eingaben und erzeugt Text sowie natürliche Sprache.

Es ist der erste breit integrierte End-to-End-Omni-Pfad der Qwen-Familie.

[qwen/omni-thinker]

102. Thinker

Die Omni-Architektur besitzt einen multimodalen Thinker für Wahrnehmung und Sprachmodellreasoning.

Er verarbeitet den gemeinsamen Kontext der Eingabemodalitäten.

[qwen/omni-talker]

103. Talker

Der Talker erzeugt Sprache aus hochdimensionalen Thinker-Repräsentationen.

Thinker und Talker sind eng gekoppelt statt als lose ASR→LLM→TTS-Kaskade.

[qwen/omni-stream]

104. Streaming Speech

Qwen2.5-Omni unterstützt Echtzeit-nahe Sprachausgabe.

Streaminglatenz ist eine eigene Qualitätsdimension neben Sprachqualität.

[qwen/omni-7b]

105. Qwen2.5-Omni-7B

Das offene 7B-Modell macht End-to-End-Omni-Forschung relativ zugänglich.

Hardwarebedarf bleibt höher als bei reinem Text-7B.

[qwen/qwq-preview]

106. November 2024: QwQ-32B-Preview

QwQ war Qwens frühe offene Reasoninglinie vor Qwen3.

Das 32B-Modell sollte durch längere Überlegung Mathematik, Coding und logische Aufgaben verbessern.

[qwen/qwq-name]

107. QwQ

Der Name steht als eigene Reasoning-Marke neben Qwen2.5.

QwQ ist kein separater Alibaba-Produktassistent, sondern ein Modellzweig.

[qwen/qwq-32]

108. 32B dense

QwQ nutzt eine 32B-dense-Modellgröße.

Die Klasse war stark genug für anspruchsvolles Reasoning und zugleich erheblich leichter lokal betreibbar als hundertmilliardengroße MoE-Systeme.

[qwen/qwq-thinking]

109. Thinking

QwQ erzeugt längere interne beziehungsweise sichtbare Reasoningtraces.

Mehr Denktokens bedeuten nicht automatisch bessere Endantwort.

[qwen/qwq-limit]

110. Frühe Grenzen

Previewmodelle konnten Sprache wechseln, sich wiederholen oder zu lange analysieren.

Diese Muster ähneln frühen Reasoningmodellen anderer Anbieter.

[qwen/qwq-0325]

111. März 2025: QwQ-32B

Die reifere QwQ-Version verbessert Reasoning und Agentenfähigkeit.

Sie wird kurz darauf durch Qwen3s Hybrid-Thinking-Konzept strategisch überholt.

[qwen/qwq-agent]

112. Agenten und Tools

QwQ wurde stärker mit Toolnutzung und agentischen Aufgaben verbunden.

Reasoningmodell und Toolharness bleiben getrennte Systeme.

[qwen/qwq-local]

113. Lokale Reasoningoption

32B machte QwQ zu einer populären lokalen Alternative zu gehosteten Reasoningmodellen.

Quantisierung und langer Reasoningoutput erhöhen den Speicher- und Zeitbedarf.

[qwen/qwq-to-q3]

114. QwQ als Brücke zu Qwen3

Qwen3 integriert Thinking und Non-Thinking innerhalb derselben Modellfamilie.

Die getrennte QwQ-Marke wird dadurch weniger zentral.

[qwen/q3]

115. 29. April 2025: Qwen3

Qwen3 führt Hybrid Thinking als zentrales Konzept ein.

Ein Modell kann zwischen ausführlicherem Reasoning und schnellerem Non-Thinking wechseln.

[qwen/q3-hybrid]

116. Hybrid Thinking

Thinking und Non-Thinking werden in derselben Modellfamilie unterstützt.

Das vereinfacht Anwendungen, die je nach Aufgabe Latenz gegen Denktiefe abwägen.

[qwen/q3-switch]

117. `/think` und `/no_think`

Frühe Qwen3-Chattemplates erlauben Modussteuerung über spezielle Instruktionen.

Spätere Cloudmodelle verwenden teilweise API-Parameter statt Textmarker.

[qwen/q3-sizes]

118. Qwen3 offene Größen

Qwen3 erscheint als 0.6B, 1.7B, 4B, 8B, 14B, 32B sowie MoE-Modelle 30B-A3B und 235B-A22B.

Die Familie deckt vom Edge-Modell bis zum großen Frontier-MoE einen außergewöhnlich breiten Bereich ab.

[qwen/q3-06]

119. Qwen3-0.6B

0.6B ist die kleinste Qwen3-Klasse.

Sie eignet sich für Klassifikation, Extraktion und sehr leichte lokale Assistenten.

[qwen/q3-17]

120. Qwen3-1.7B

1.7B bietet etwas mehr Sprach- und Instruction-Kapazität.

On-Device-Experimente bleiben ein Schwerpunkt.

[qwen/q3-4]

121. Qwen3-4B

Qwen stellte heraus, dass selbst 4B gegenüber deutlich größeren Vorgängern konkurrenzfähig sein kann.

Generationssprünge machen reine Parametervergleiche unzureichend.

[qwen/q3-8]

122. Qwen3-8B

8B ist ein klassischer lokaler Sweet Spot.

Die Modellgröße ist für starke Consumer-GPUs und Macs besonders relevant.

[qwen/q3-14]

123. Qwen3-14B

14B kombiniert mehr Wissen und Reasoning mit noch praktikablem Self-Hosting.

Quantisierung erweitert die Hardwareoptionen.

[qwen/q3-32]

124. Qwen3-32B

32B bleibt die starke dense Workstationklasse.

Sie konkurriert in vielen Aufgaben mit kleineren MoE-Modellen.

[qwen/q3-30a3]

125. Qwen3-30B-A3B

Das kleine MoE besitzt etwa 30B Gesamt- und 3B aktivierte Parameter.

Es ist für hohe Effizienz bei dennoch großer gespeicherter Kapazität ausgelegt.

[qwen/q3-235a22]

126. Qwen3-235B-A22B

Das große Qwen3-MoE besitzt etwa 235B Gesamt- und 22B aktivierte Parameter.

Es bildet die offene Spitzenklasse des ursprünglichen Qwen3-Releases.

[qwen/q3-moe]

127. MoE als Hauptarchitektur

Qwen3 macht Mixture of Experts zu einem zentralen Skalierungspfad.

Gesamtparameter, aktive Parameter und Speicherbedarf müssen getrennt verstanden werden.

[qwen/q3-languages]

128. 119 Sprachen und Dialekte

Qwen3 erweitert die Mehrsprachigkeit stark.

Spätere Qwen3.5-Generationen erhöhen die dokumentierte Abdeckung weiter.

[qwen/q3-data]

129. 36 Billionen Tokens

Qwen3 wurde auf einer stark vergrößerten Pretrainingmischung trainiert.

Die genaue Datenqualität und Syntheseverfahren sind ebenso wichtig wie die rohe Tokenzahl.

[qwen/q3-thinking-train]

130. Reasoning-Post-Training

Qwen3 kombiniert lange Reasoningtraces, Reinforcement Learning und Distillation.

Reasoning wird nicht als einzelner separater Modellsilo behandelt.

[qwen/q3-nonthink]

131. Non-Thinking

Der schnelle Modus eignet sich für einfache Fragen, Extraktion und latenzkritische Aufgaben.

Thinking sollte nicht reflexartig für jeden Prompt aktiviert werden.

[qwen/q3-tools]

132. Tool Use

Qwen3 wird für agentische Toolnutzung weiter optimiert.

Qwen-Agent und externe Frameworks können Function Calling orchestrieren.

[qwen/q3-mcp]

133. MCP-Ökosystem

Qwen-Agent unterstützt später Model Context Protocol für externe Werkzeuge und Daten.

MCP standardisiert Schnittstellen, nicht Vertrauen.

[qwen/q3-local]

134. Lokales Ökosystem

Qwen3 wird schnell von Transformers, vLLM, SGLang, llama.cpp, Ollama und MLX unterstützt.

Bei neuen Chattemplates ist eine aktuelle Runtime wichtig.

[qwen/q3-apache]

135. Apache-2.0-Linie

Viele Qwen3-Gewichte werden unter Apache 2.0 veröffentlicht.

Die konkrete Modellkarte bleibt maßgeblich.

[qwen/q3-instruct-thinking]

136. Instruct/Thinking-Ausprägungen

Im Verlauf von 2025 erscheinen stärker spezialisierte Qwen3-Instruct- und Thinking-Updates.

Cloud- und Open-Weight-Namensräume laufen nicht immer synchron.

[qwen/q3-2507]

137. Qwen3-2507

Sommer-2025-Revisionen verbessern Instruct und Thinking gegenüber dem April-Release.

Datierte Checkpoints sind für reproduzierbare Benchmarks wichtig.

[qwen/q3-max]

138. September 2025: Qwen3-Max

Qwen3-Max ist Alibabas große proprietäre Cloud-Spitzenklasse mit über einer Billion Parametern.

Der Max-Release ist nicht identisch mit Qwen3-235B-A22B.

[qwen/q3max-36t]

139. 36 Billionen Pretraining-Tokens

Qwen3-Max wurde auf rund 36 Billionen Tokens vortrainiert.

Alibaba beschreibt dafür großskalige MoE-Trainingsinfrastruktur.

[qwen/q3max-1m]

140. 1M-Training

Für Long Context nutzt Qwen3-Max Infrastruktur, die Training mit Million-Token-Sequenzen ermöglicht.

API-Kontext und Trainingskontext müssen trotzdem stichtagsbezogen geprüft werden.

[qwen/q3max-thinking]

141. Qwen3-Max-Thinking

Die Reasoningvariante wird später als eigener Flagship-Reasoner veröffentlicht.

Sie kombiniert große Parameterzahl, Reinforcement Learning und Tool Use.

[qwen/q3max-thinking-2026]

142. 25. Januar 2026: Qwen3-Max-Thinking

Qwen veröffentlicht den reasoningorientierten Max-Pfad mit adaptiver Toolnutzung und Test-Time Scaling.

Das Modell ist proprietär und über Qwen/Alibaba-Cloud-Dienste verfügbar.

[qwen/q3coder]

143. 22. Juli 2025: Qwen3-Coder

Qwen3-Coder wird als bis dahin agentischstes Qwen-Codemodell vorgestellt.

Die erste große Variante ist Qwen3-Coder-480B-A35B-Instruct.

[qwen/q3coder-size]

144. 480B Gesamt / 35B aktiv

Das Coder-MoE speichert sehr große Kapazität bei 35B aktiven Parametern pro Token.

Self-Hosting bleibt trotz MoE ein Mehr-GPU-/Serverprojekt.

[qwen/q3coder-75t]

145. 7,5 Billionen Tokens

Qwen3-Coder wird auf 7,5 Billionen Tokens vortrainiert, davon rund 70 Prozent Code.

Allgemeine und mathematische Fähigkeiten sollen trotzdem erhalten bleiben.

[qwen/q3coder-256k]

146. 256K nativer Kontext

Das Modell unterstützt 256K Kontext nativ.

Für Repositoryarbeit kann der Kontext per YaRN auf bis zu 1M erweitert werden.

[qwen/q3coder-yarn]

147. YaRN auf 1M

Context Extrapolation erweitert den nutzbaren Bereich über das native Training hinaus.

Extrapolierter Long Context sollte auf realen Repositories geprüft werden.

[qwen/q3coder-synth]

148. Synthetische Daten

Qwen2.5-Coder wurde verwendet, um verrauschte Codedaten zu säubern und neu zu schreiben.

Synthetische Teacherdaten können Qualität steigern, aber auch Teacherfehler übertragen.

[qwen/q3coder-agentrl]

149. Agent RL

Qwen3-Coder wurde mit Long-Horizon-Reinforcement-Learning auf echte Toolinteraktionen trainiert.

Das Ziel ist nicht nur Code schreiben, sondern iterativ in einer Umgebung handeln.

[qwen/q3coder-20k]

150. 20.000 parallele Umgebungen

Alibaba beschreibt eine Trainingsinfrastruktur mit bis zu 20.000 unabhängigen Agentenumgebungen.

Environment Scaling wird damit zum eigenen Trainingsproblem.

[qwen/qwen-code]

151. Qwen Code

Zusammen mit Qwen3-Coder wird ein terminalbasierter Coding-Agent veröffentlicht.

Qwen Code startete als Fork der Gemini-CLI-Idee und wurde auf Qwen-Protokolle, Tools und Prompts angepasst.

[qwen/qwen-code-cli]

152. Terminalagent

Qwen Code lebt im Terminal und kann Dateien lesen, Code verändern, Shelltools ausführen und Entwicklungsaufgaben verfolgen.

Der Agent ist eine Anwendungsschicht und nicht das Qwen3-Coder-Gewicht.

[qwen/qwen-code-open]

153. Open Source

Qwen Code wird offen entwickelt.

Version, Installationsweg und Toolberechtigungen sind Teil eines reproduzierbaren Agentenstands.

[qwen/qwen-code-tools]

154. Werkzeuge

Qwen Code besitzt Dateisystem-, Shell-, Search-, Web- und Erweiterungsfähigkeiten abhängig von Konfiguration.

Least Privilege bleibt zentral.

[qwen/qwen-code-subagents]

155. Subagenten

Neuere Qwen-Code-Versionen unterstützen spezialisierte Subagenten mit eigenem Kontext und eigenen Tools.

Parallelität kann Recherche beschleunigen, erhöht aber Merge- und Kostenkomplexität.

[qwen/qwen-code-fork]

156. Fork-Subagent

Ein Subagent kann ausgewählten Gesprächskontext des Hauptagenten erben.

Kontextweitergabe sollte nur notwendige Informationen enthalten.

[qwen/qwen-code-background]

157. Hintergrundagenten

Neuere Qwen-Code-Varianten können Aufgaben unabhängig im Hintergrund fortführen.

Autonomie benötigt klare Stop-, Kosten- und Berechtigungsgrenzen.

[qwen/qwen-code-auth]

158. Qwen-Code-Authentifizierung

Der frühere kostenlose Qwen-OAuth-Pfad wurde im April 2026 eingestellt.

Aktuell werden Alibaba Cloud Coding Plan oder eigene API-/Providerzugänge verwendet.

[qwen/qwen-code-anthropic]

159. Claude-Code-Kompatibilität

Qwen-APIs können über Anthropic-kompatible Schnittstellen mit Claude-Code-nahen Clients verwendet werden.

Der Client bleibt Claude Code; das Modell bleibt Qwen.

[qwen/qwen-code-openai]

160. OpenAI-kompatible Clients

Qwen lässt sich über OpenAI-kompatible Endpunkte in viele Codingtools einbinden.

Protokollkompatibilität ist keine Modellidentität.

[qwen/qoder]

161. Qoder

Alibaba positioniert Qoder als agentische Codingplattform, die aktuelle Qwen-Modelle integriert.

Qoder und Qwen Code sind getrennte Produkte.

[qwen/coder-current]

162. Coding 2026

Qwen3.8 und Qwen3.8-Flash-Next erweitern Coding und Cowork über den spezialisierten Qwen3-Coder hinaus.

Der aktuell stärkste allgemeine Qwen kann daher für Coding besser geeignet sein als ein älterer expliziter Coder.

[qwen/q3embed]

163. 5. Juni 2025: Qwen3-Embedding

Qwen3-Embedding überträgt die Qwen3-Sprachbasis auf semantische Vektorrepräsentationen.

Die Reihe deckt 0.6B, 4B und 8B ab und ist für Retrieval, Clustering, Klassifikation und Code Search gedacht.

[qwen/embed-dual]

164. Dual-Encoder

Embeddingmodelle kodieren Query und Dokument unabhängig in Vektoren.

Das ermöglicht schnelle Approximate-Nearest-Neighbor-Suche in großen Beständen.

[qwen/embed-mrl]

165. Matryoshka Representation Learning

Qwen3-Embedding unterstützt flexible Vektordimensionen.

Kürzere Embeddings sparen Speicher und Rechenzeit, können aber Retrievalqualität reduzieren.

[qwen/embed-instruction]

166. Instruction-aware Embeddings

Aufgabeninstruktionen können Retrieval auf Domäne und Suchziel ausrichten.

Query- und Dokumentseite müssen passend formatiert werden.

[qwen/q3rerank]

167. Qwen3-Reranker

Reranker in 0.6B, 4B und 8B bewerten Query-Dokument-Paare gemeinsam.

Sie sind langsamer als Embeddings, aber typischerweise präziser für eine kleine Kandidatenmenge.

[qwen/rerank-cross]

168. Cross-Encoder

Reranking verarbeitet Query und Dokument gemeinsam.

Das erlaubt tiefere Tokeninteraktion als reine Vektorähnlichkeit.

[qwen/retrieval-two-stage]

169. Zweistufiges Retrieval

Embedding liefert schnell Kandidaten, Reranker sortiert anschließend genauer.

Diese Kombination ist für RAG häufig besser als nur ein einzelner Vektorvergleich.

[qwen/embed-100lang]

170. Mehr als 100 Sprachen

Qwen3-Embedding ist stark multilingual und unterstützt auch Programmiersprachen.

Cross-Lingual Retrieval bleibt abhängig von Domäne und Queryqualität.

[qwen/vl3]

171. 22. September 2025: Qwen3-VL

Qwen3-VL wird als neue Spitzenfamilie für Vision-Language-Aufgaben veröffentlicht.

Die erste offene Flagshipklasse ist Qwen3-VL-235B-A22B in Instruct- und Thinking-Ausführung.

[qwen/vl3-thinking]

172. Visuelles Thinking

Qwen3-VL kann komplexe visuelle Mathematik, Diagramme und räumliche Aufgaben mit Reasoning bearbeiten.

Visuelle Fehler können Wahrnehmung und Schlussfolgerung zugleich betreffen.

[qwen/vl3-agent]

173. Visual Agent

Qwen3-VL wird stärker für GUI-, Web- und Computer-Use-Aufgaben trainiert.

Das Modell beschreibt beziehungsweise interpretiert Zustände; ein Harness führt Aktionen aus.

[qwen/vl3-spatial]

174. Räumliche Intelligenz

Objektbeziehungen, Referenzierung und Koordinaten werden stärker als eigene Fähigkeit behandelt.

Bounding Boxes und natürliche räumliche Sprache müssen auseinandergehalten werden.

[qwen/vl3-video]

175. Langes Video

Qwen3-VL verbessert zeitliches Videoverständnis und längere Clips.

Frameauswahl und Tokenbudget beeinflussen Ergebnisqualität.

[qwen/vl3-235]

176. Qwen3-VL-235B-A22B

Das große MoE-Modell nutzt etwa 235B Gesamt- und 22B aktive Parameter.

Es ist für lokale Consumerhardware zu groß, aber als offener Forschungscheckpoint wichtig.

[qwen/vl3-smaller]

177. Kleinere Qwen3-VL-Modelle

Die Serie wird später um kleinere offene Größen ergänzt.

Diese sind für On-Prem- und Workstationeinsatz praktikabler.

[qwen/vl-embed]

178. 7. Januar 2026: Qwen3-VL-Embedding

Die multimodale Embeddingreihe bildet Text, Bilder, Screenshots, visuelle Dokumente und Video in einem gemeinsamen semantischen Raum ab.

Das ermöglicht Cross-Modal Retrieval.

[qwen/vl-rerank]

179. Qwen3-VL-Reranker

Der multimodale Reranker bewertet Query-Dokument-Paare mit gemischten Modalitäten.

Er kann ein initiales multimodales Retrieval deutlich präzisieren.

[qwen/vl-embed-2b]

180. VL-Embedding 2B

Die kleinere multimodale Embeddingklasse verwendet 32K Sequenzlänge und flexible Embeddingdimensionen.

Sie ist für größere Retrievalsysteme effizienter als 8B.

[qwen/vl-embed-8b]

181. VL-Embedding 8B

8B bietet höhere semantische Kapazität bei höherem Inferenzaufwand.

Für große Indexierungsjobs können Kosten erheblich werden.

[qwen/q3omni]

182. Qwen3-Omni

Qwen3-Omni führt die End-to-End-Multimodalitätslinie nach Qwen2.5-Omni weiter.

Text, Bild, Audio und Video werden enger mit Reasoning und Agentenfähigkeiten verbunden.

[qwen/omni-vs-vl]

183. Omni ≠ VL

VL konzentriert sich primär auf visuelle Eingaben und Textausgabe.

Omni integriert zusätzlich Audio und Sprachgenerierung beziehungsweise Echtzeitinteraktion.

[qwen/omni-live]

184. Realtime-Interaktion

Omni-Modelle zielen auf geringe Latenz zwischen Wahrnehmung, Reasoning und Sprache.

Netzwerk- und Audio-Pipeline beeinflussen die gefühlte Latenz genauso wie das Modell.

[qwen/q3tts]

185. September 2025: Qwen3-TTS

Qwen3-TTS baut eine eigene Text-to-Speech-Familie für natürliche, mehrsprachige Sprachsynthese auf.

Spätere Varianten ergänzen Voice Clone und Voice Design.

[qwen/tts-languages]

186. Mehrsprachige TTS

Qwen3-TTS unterstützt unter anderem Deutsch, Englisch, Chinesisch, Französisch, Italienisch, Spanisch, Portugiesisch, Japanisch, Koreanisch und Russisch.

Stimmen- und Dialektabdeckung variiert je Modell.

[qwen/tts-timbres]

187. Viele Timbres

Cloudmodelle bieten zahlreiche vordefinierte Stimmen.

Eine Timbre-Auswahl ist keine Identität des Foundation-Modells.

[qwen/tts-voice-design]

188. Voice Design

Voice-Design-Modelle erzeugen eine gewünschte Stimme aus natürlicher Beschreibung.

Das unterscheidet sich von Klonen einer realen Zielperson.

[qwen/tts-clone]

189. Voice Clone

Qwen3-TTS kann aus wenigen Sekunden Referenzaudio eine stimmähnliche Ausgabe erzeugen.

Einwilligung und Missbrauchsschutz sind besonders wichtig.

[qwen/tts-open]

190. 21. Januar 2026: Qwen3-TTS Open Source

Qwen veröffentlicht mehrere TTS-Checkpoints in 1.7B- und 0.6B-Klassen.

VoiceDesign, CustomVoice und Base/Clone-Funktionen werden getrennt angeboten.

[qwen/tts-tokenizer]

191. 12-Hz-TTS-Tokenizer

Qwen3-TTS komprimiert Sprachsignale über einen eigenen Multi-Codebook-Tokenizer.

Tokenizerqualität beeinflusst Sprachrekonstruktion und Sprecherähnlichkeit.

[qwen/tts-stream]

192. Streaming

Die Architektur unterstützt sehr frühe Audioausgabe während fortlaufender Textzufuhr.

Streamingqualität hängt von Netzwerk und Audiopuffer ab.

[qwen/qwen-image]

193. August 2025: Qwen-Image

Qwen-Image startet als eigene Bildgenerationsfamilie mit besonderem Schwerpunkt auf korrekter Textdarstellung.

Die Bildserie ist getrennt von Qwen-VL-Verständnismodellen.

[qwen/qwen-image-20b]

194. 20B-Bildmodell

Die erste Qwen-Image-Generation basiert auf einer großen 20B-Klasse.

Bildmodellparameter lassen sich nicht direkt mit LLM-Parametern vergleichen.

[qwen/image-text]

195. Text in Bildern

Qwen-Image wurde besonders auf lesbare Typografie und komplexere Beschriftungen ausgerichtet.

Auch gute Modelle können Buchstaben, Zahlen und Layoutdetails falsch erzeugen.

[qwen/image-edit]

196. 18. August 2025: Qwen-Image-Edit

Qwen-Image-Edit erweitert das Bildmodell um semantische und visuelle Bearbeitung.

Es kombiniert visuelle Semantik mit der Erhaltung von Erscheinungsdetails.

[qwen/image-semantic]

197. Semantische Bearbeitung

Objekte, Stil, Pose oder Bedeutung können verändert werden.

Solche Edits dürfen nicht als unveränderte Originalfotografie archiviert werden.

[qwen/image-appearance]

198. Appearance Editing

Niedrigstufige Bearbeitung versucht nicht betroffene Regionen möglichst stabil zu halten.

Generative Rekonstruktion kann dennoch Pixel außerhalb des Zielbereichs verändern.

[qwen/image-2512]

199. 30. Dezember 2025: Qwen-Image-2512

Der Dezemberstand verbessert Realismus, natürliche Details und Textdarstellung.

Datierte Bildmodellrevisionen sind wegen sichtbarer Stiländerungen besonders archivierungswürdig.

[qwen/image-2]

200. 10. Februar 2026: Qwen-Image-2.0

Qwen-Image-2.0 vereint Generierung und Editing stärker in einem Modell und unterstützt native 2K-Ausgabe.

Der Fokus liegt auf komplexen Infografiken, Photorealismus und längeren Anweisungen.

[qwen/image-3]

201. 21. Juli 2026: Qwen-Image-3.0

Qwen-Image-3.0 ist die aktuelle dritte Generation für reichhaltige Layouts, authentische Details und Weltwissen.

Die Dokumentation nennt bis zu 4.5K Token Input und native Textdarstellung in mehreren Sprachen.

[qwen/image-3-ui]

202. UI- und Layoutsimulation

Qwen-Image-3.0 kann komplexe Interfaces, Zeitungen, Storyboards oder Prüfungsseiten generieren.

Generierte UI-Screenshots sind keine Belege für echte Softwarezustände.

[qwen/image-3-12lang]

203. 12 Sprachen im Bild

Die aktuelle Bildgeneration unterstützt native Textdarstellung in zwölf Sprachen.

Fehlerfreie Typografie ist trotzdem nicht garantiert.

[qwen/qwen-vla]

204. 29. Mai 2026: Qwen-VLA

Qwen-VLA erweitert Vision-Language-Fähigkeiten zu kontinuierlicher Aktion und Trajektorien für Robotik.

Das Modell ist ein Vision-Language-Action-System und nicht nur ein Chatbot.

[qwen/vla-action]

205. Aktion im physischen Raum

VLA-Modelle müssen Wahrnehmung, Sprache, räumliche Planung und Motoraktionen verbinden.

Physische Aktionen haben höhere Sicherheitsanforderungen als Textausgabe.

[qwen/robot-suite]

206. 15. Juni 2026: Qwen-Robot Suite

Qwen veröffentlicht eine Modellfamilie für Navigation, Manipulation und World Modeling.

RobotNav, RobotManip und RobotWorld sind spezialisierte Komponenten.

[qwen/agentworld]

207. 22. Juni 2026: Qwen-AgentWorld

Qwen-AgentWorld trainiert ein Language World Model, das Agentenumgebungen simuliert.

Es deckt Search, MCP, Terminal, SWE, Android, Web und OS ab.

[qwen/world-model]

208. Language World Model

Das Modell simuliert Reaktionen einer Umgebung auf Agentenaktionen.

Solche Simulationen können Reinforcement Learning skalieren, ohne jede Aktion in echter Software auszuführen.

[qwen/agentworld-bench]

209. AgentWorldBench

Ein begleitender Benchmark vergleicht simulierte und reale Agentenumgebungen.

Simulationsqualität bestimmt, wie gut Training in die Realität überträgt.

[qwen/q3next]

210. 11. September 2025: Qwen3-Next-80B-A3B

Qwen3-Next wird als ultra-sparsames MoE mit neuer Hybrid-Attention veröffentlicht.

Es dient ausdrücklich als Architekturvorläufer der späteren Qwen3.5-Familie.

[qwen/q3next-size]

211. 80B Gesamt / 3B aktiv

Die extrem geringe Aktivierung soll hohe Modellkapazität bei niedriger Rechenlast ermöglichen.

Speicherbedarf bleibt von den 80B Gesamtparametern geprägt.

[qwen/q3next-gdn]

212. Gated DeltaNet

Qwen3-Next kombiniert lineare Gated-DeltaNet-Schichten mit klassischen Attention-Layern.

GDN komprimiert Historie in einen festen Zustand und reduziert Long-Context-Kosten.

[qwen/q3next-attn]

213. Hybrid Attention

Nicht jede Schicht berechnet vollständige Attention über den gesamten Verlauf.

Periodische Attention-Layer ermöglichen präzise Retrievalpfade.

[qwen/q3next-moe]

214. Ultra-Sparse MoE

Nur ein sehr kleiner Parameteranteil ist pro Token aktiv.

Das verbessert Durchsatz, kann aber Expert-Routing komplexer machen.

[qwen/q3next-mtp]

215. Multi-Token Prediction

Zusätzliche Vorhersage mehrerer zukünftiger Tokens dient Training und schnelleren Decodingverfahren.

MTP ist kein separates Chatmodell.

[qwen/q3next-efficiency]

216. Effizienzexperiment

Qwen3-Next untersucht Architekturideen, die später in Qwen3.5 bis 3.8 produktiv werden.

Der Name „Next“ bezeichnet deshalb einen Forschungs-/Übergangscheckpoint, nicht Qwen4.

[qwen/q3next-open]

217. Offene Gewichte

Qwen3-Next wurde offen bereitgestellt.

Die Community konnte dadurch die spätere Hybridarchitektur vor dem 2026er Hauptrelease untersuchen.

[qwen/q3next-to35]

218. Von Next zu 3.5

Qwen3.5 übernimmt Gated DeltaNet plus sparse MoE und baut native Multimodalität darauf.

Qwen3-Next ist damit die direkte technische Brücke.

[qwen/q35]

219. 16. Februar 2026: Qwen3.5

Qwen3.5 wird als neue native Vision-Language-Foundation für Agenten veröffentlicht.

Die erste offene Flagshipvariante ist Qwen3.5-397B-A17B.

[qwen/q35-397]

220. 397B Gesamt / 17B aktiv

Das Flagship-MoE kombiniert sehr große Gesamtkapazität mit 17B aktivierten Parametern.

Es baut architektonisch auf Qwen3-Next auf.

[qwen/q35-native-mm]

221. Native Multimodalität

Qwen3.5 wird von Anfang an gemeinsam auf Text- und visuellen Daten trainiert statt ein Textmodell nachträglich um Vision zu erweitern.

Das soll Wahrnehmung, Reasoning und Agentenfähigkeit enger integrieren.

[qwen/q35-early-fusion]

222. Early Fusion

Text- und visuelle Repräsentationen fließen früh in einen gemeinsamen Modellpfad.

Das verbessert cross-modales Reasoning, erhöht aber Trainingskomplexität.

[qwen/q35-gdn]

223. Gated Delta Networks

Qwen3.5 übernimmt GDN aus Qwen3-Next als effizienten linearen Attentionersatz für viele Schichten.

Ein Teil der Schichten behält präzisere globale Attention.

[qwen/q35-moe]

224. Sparse MoE

Die Modellfamilie nutzt sparse Expertenaktivierung.

Gesamtgröße und aktive Größe müssen getrennt betrachtet werden.

[qwen/q35-201]

225. 201 Sprachen und Dialekte

Qwen3.5 erweitert die dokumentierte Sprachabdeckung auf 201 Sprachen und Dialekte.

Breite Unterstützung bedeutet nicht identische Qualität in jedem Dialekt.

[qwen/q35-1m]

226. 1M Kontext in Qwen3.5-Plus

Das gehostete Plus-Modell wird mit einem 1-Million-Token-Kontextfenster angeboten.

Lokale offene Checkpoints können andere native beziehungsweise extrapolierte Kontextgrenzen besitzen.

[qwen/q35-tools]

227. Built-in Tools

Qwen3.5-Plus integriert offizielle Werkzeuge und adaptive Toolnutzung.

Cloudtools sind Produkt-/API-Funktionen, nicht Bestandteil nackter Gewichte.

[qwen/q35-adaptive]

228. Adaptive Tool Use

Das Modell soll selbst entscheiden können, wann Web-, Code- oder andere Werkzeuge nützlich sind.

Diese Entscheidung braucht dennoch Rechtekontrolle außerhalb des Modells.

[qwen/q35-rl]

229. Skaliertes Reinforcement Learning

Alibaba beschreibt millionenfache Agentenumgebungen und asynchrones RL als wichtigen Trainingspfad.

Agentenlernen wird damit zu einem zentralen Bestandteil des Foundation-Model-Post-Trainings.

[qwen/q35-397-open]

230. 397B-A17B Open Weight

Der erste große Qwen3.5-Checkpoint wird offen auf Hugging Face und ModelScope veröffentlicht.

Die Größe verlangt Datacenter- oder stark verteilte Hardware.

[qwen/q35-122]

231. 24. Februar 2026: Qwen3.5-122B-A10B

Die mittlere MoE-Klasse bietet 122B Gesamt- und 10B aktive Parameter.

Sie ist für High-End-On-Prem deutlich realistischer als 397B.

[qwen/q35-35]

232. Qwen3.5-35B-A3B

35B Gesamt und 3B aktive Parameter liefern eine sehr effiziente kleinere MoE-Option.

Sie zielt besonders auf lokale Agenten und multimodale Nutzung.

[qwen/q35-27]

233. Qwen3.5-27B

27B ist ein dichtes multimodales Modell.

Es bietet eine einfachere Servingcharakteristik als MoE und bleibt für große Workstations attraktiv.

[qwen/q35-small]

234. 2. März 2026: kleinere Qwen3.5-Modelle

0.8B, 2B, 4B und 9B erweitern die Familie nach unten.

Die kleinen Modelle machen native multimodale Qwen3.5-Fähigkeiten für Edge und Consumerhardware zugänglicher.

[qwen/q35-08]

235. Qwen3.5-0.8B

0.8B ist eine extrem kleine multimodale Foundationklasse.

Die Kapazität eignet sich vor allem für klar begrenzte Aufgaben.

[qwen/q35-2]

236. Qwen3.5-2B

2B bietet mehr Robustheit bei weiterhin sehr geringem Speicherbedarf.

On-Device-Anwendungen profitieren besonders.

[qwen/q35-4]

237. Qwen3.5-4B

4B ist ein praktischer kleiner Allrounder.

Quantisierung macht ihn auf vielen Verbrauchergeräten einsetzbar.

[qwen/q35-9]

238. Qwen3.5-9B

9B ist die stärkste kleinere offene Klasse der 3.5-Serie.

Sie ist ein interessanter Kompromiss für lokale multimodale Assistenz.

[qwen/q35-flash]

239. Qwen3.5-Flash

Das Cloud-Flash-Modell priorisiert günstige und schnelle multimodale Inferenz.

Es bietet ebenfalls sehr langen Kontext.

[qwen/q35-plus]

240. Qwen3.5-Plus

Plus ist die stärkere gehostete Allroundklasse.

Cloud-Plus und offene 397B-A17B-Gewichte sind nicht zwangsläufig derselbe Checkpoint.

[qwen/q35-hybrid-thinking]

241. Hybrid Thinking

Qwen3.5 kann visuell und textuell zwischen Thinking und Non-Thinking wechseln.

Der Modus sollte entsprechend Aufgabenschwierigkeit gewählt werden.

[qwen/q35-video]

242. Video

Qwen3.5-Cloudmodelle verarbeiten lange Videos.

Videoqualität hängt von Sampling, Auflösung und Kontextbudget ab.

[qwen/q35-doc]

243. Dokumentverständnis

Native Multimodalität verbessert OCR, Diagramme, Screenshots und Layoutfragen.

Dokumentseiten sollten für kritische Daten weiterhin direkt kontrolliert werden.

[qwen/q35-agent]

244. Agenten

Qwen3.5 wird explizit für Tool Use, Computer Use und reale Agentenaufgaben trainiert.

Ein Foundation-Modell handelt erst über ein Harness.

[qwen/q35-current-role]

245. Rolle von Qwen3.5 im Jahr 2026

Qwen3.5 bildet die architektonische Basis für Qwen3.6, Qwen3.7 und Qwen3.8.

Die Generation bleibt daher trotz späterer Releases technisch zentral.

[qwen/q36]

246. April 2026: Qwen3.6

Qwen3.6 baut auf Qwen3.5 auf und fokussiert Stabilität, Alltagstauglichkeit und Agentic Coding.

Die offene Serie startet mit 35B-A3B und 27B.

[qwen/q36-plus]

247. Qwen3.6-Plus

Die gehostete Plus-Klasse wird Anfang April als neuer Cloud-Allrounder bereitgestellt.

Sie unterstützt native Multimodalität und sehr langen Kontext.

[qwen/q36-35]

248. 16. April 2026: Qwen3.6-35B-A3B

Das offene MoE-Modell besitzt 35B Gesamt- und nur 3B aktive Parameter.

Es ist auf hohe Effizienz und agentisches Coding ausgerichtet.

[qwen/q36-35-mm]

249. Multimodales 35B-A3B

Die kleine aktive Größe verarbeitet trotzdem Text, Bilder und Video.

Das macht die Klasse für lokale multimodale Agenten besonders interessant.

[qwen/q36-35-code]

250. Agentic Coding

Qwen berichtet deutliche Verbesserungen bei Frontend-, Repository- und Tool-Aufgaben.

Herstellerbenchmarks werden im Archiv als Herstellerangaben gekennzeichnet.

[qwen/q36-thinking-preserve]

251. Thinking Preservation

Qwen3.6 kann Reasoningkontext über Gesprächsverlauf erhalten.

Das reduziert wiederholtes Neudenken bei iterativer Codingarbeit.

[qwen/q36-27]

252. 22. April 2026: Qwen3.6-27B

Das dichte 27B-Modell ergänzt die MoE-Variante.

Es ist nativ multimodal und unterstützt Thinking/Non-Thinking.

[qwen/q36-27-dense]

253. Dense 27B

Alle 27B Parameter sind pro Token aktiv.

Dense Serving ist einfacher vorhersehbar, braucht aber mehr Rechenarbeit pro Token als ein 3B-aktives MoE.

[qwen/q36-max-preview]

254. 18. April 2026: Qwen3.6-Max-Preview

Alibaba zeigt eine proprietäre stärkere Max-Vorschau mit besserem Wissen, Instruction Following und Agentic Coding.

Preview bedeutet ausdrücklich noch nicht stabiler Langzeitendpunkt.

[qwen/q36-context]

255. 1M-Kontext bei Plus/Flash

Die gehosteten 3.6-Modelle unterstützen bis zu 1M Kontext.

Das ist besonders für lange Dokumente und Repositoryarbeit relevant.

[qwen/q36-flash]

256. Qwen3.6-Flash

Flash ist die günstigere und schnellere gehostete Klasse.

Das offene 35B-A3B-Modell wird im Cloudkontext eng mit dieser Leistungsstufe verbunden.

[qwen/q36-languages]

257. 201 Sprachen

Qwen3.6 hält die breite Sprachabdeckung der 3.5-Architektur.

Mehrsprachige Coding- und Office-Aufgaben profitieren davon.

[qwen/q36-vision]

258. Vision

Qwen3.6 bleibt nativ multimodal.

Ein separates VL-Modell ist für viele allgemeine Bildfragen nicht mehr zwingend notwendig.

[qwen/q36-video]

259. Video

Cloudmodelle verarbeiten lange Videos zusammen mit Text.

Die maximale Videolänge ist produkt- und modellabhängig.

[qwen/q36-agent-stack]

260. Agentenstack

Qwen3.6 wird direkt in Qwen Code und andere Agentenpfade integriert.

Modellupgrade und Agentenupgrade können unabhängig voneinander stattfinden.

[qwen/q37]

261. Mai bis Juli 2026: Qwen3.7

Qwen3.7 entwickelt die 3.5/3.6-Linie zu einer stärkeren Cloud-Flagshipgeneration weiter.

Plus, Max und Flash werden als unterschiedliche Leistungs-/Kostenklassen angeboten.

[qwen/q37-plus]

262. Qwen3.7-Plus

Plus ist das multimodale Flagship für allgemeine Text-, Bild- und Videoaufgaben.

Die aktuelle Dokumentation nennt 1M Kontext und integrierte Tools.

[qwen/q37-plus-0526]

263. 26. Mai 2026: Plus-Snapshot

`qwen3.7-plus-2026-05-26` ist ein datierter reproduzierbarer Cloudstand.

Der bewegliche Hauptname `qwen3.7-plus` kann später aktualisiert werden.

[qwen/q37-max]

264. Qwen3.7-Max

Max ist die stärkere proprietäre Text-/Reasoningklasse innerhalb der 3.7-Serie.

Model Studio führt datierte Max-Snapshots für reproduzierbare Nutzung.

[qwen/q37-max-0520]

265. 20. Mai 2026: Max-Snapshot

Ein früher datierter Qwen3.7-Max-Stand wird in Model Studio gelistet.

Datierte Snapshots sind gegenüber `latest`-Aliasen für Langzeittests vorzuziehen.

[qwen/q37-max-0608]

266. 8. Juni 2026: Max-Snapshot

Ein weiterer Max-Snapshot aktualisiert die Cloudgeneration.

Die Existenz mehrerer Snapshots zeigt den schnellen Iterationsrhythmus.

[qwen/q37-flash]

267. Qwen3.7-Flash

Flash bietet nahe Flagshipfähigkeiten bei deutlich niedrigeren Kosten.

Auch Flash unterstützt 1M Kontext und multimodale Eingaben.

[qwen/q37-flash-0715]

268. 15. Juli 2026: Flash-Snapshot

`qwen3.7-flash-2026-07-15` ist der aktuelle datierte 3.7-Flash-Stand.

Der Hauptalias kann auf diesen oder einen späteren Stand zeigen.

[qwen/q37-1m]

269. 1M Kontext

Plus, Max und Flash werden mit sehr langen Kontextfenstern angeboten.

Kosten können ab bestimmten Kontextlängen stufenweise steigen.

[qwen/q37-video]

270. Bis zu lange Videos

3.7-Plus und 3.7-Flash unterstützen in Model Studio sehr lange Videoeingaben.

Videodauer, Dateigröße und Tokenisierung sind separate Limits.

[qwen/q37-tools]

271. Built-in Tools

Die 3.7-Cloudmodelle unterstützen Function Calling und integrierte Werkzeuge.

Toolverfügbarkeit hängt von API/Produktoberfläche ab.

[qwen/q37-reasoning]

272. Hybrid Reasoning

3.7-Modelle unterstützen Thinking und Non-Thinking in derselben Familie.

Die genaue Reasoningsteuerung variiert zwischen API-Protokollen.

[qwen/q37-cache]

273. Context Cache

Model Studio unterstützt implizites Prefix Caching für ausgewählte 3.7-Modelle.

Cache-Hits senken Kosten, sind aber nicht garantiert.

[qwen/q37-role]

274. Qwen3.7 als Zwischenschritt

3.7 ist die direkte Cloudgeneration unmittelbar vor Qwen3.8.

Viele 3.7-Modelle bleiben am 1. September 2026 weiterhin produktiv verfügbar.

[qwen/q38]

275. 2. August 2026: Qwen3.8-Max

Qwen3.8-Max wird als bis dahin leistungsfähigstes Qwen-Modell für Coding, professionelle Arbeit, Research und Long-Horizon-Agenten vorgestellt.

Der Release markiert zugleich erstmals die angekündigte Öffnung einer Qwen-Max-Klasse.

[qwen/q38-max-scale]

276. 2,4 Billionen Parameter

Qwen3.8-Max skaliert auf ungefähr 2,4T Gesamtparameter.

Der offene Checkpoint trägt die Bezeichnung Qwen3.8-2.4T-A95B und aktiviert rund 95B Parameter.

[qwen/q38-a95]

277. 95B aktive Parameter

Die aktive MoE-Kapazität liegt weit unter den 2,4T Gesamtparametern, bleibt aber selbst bereits sehr groß.

Self-Hosting ist dadurch ein Datacenterprojekt.

[qwen/q38-max-open]

278. 12. August 2026: offene Max-Gewichte

Alibaba veröffentlicht Qwen3.8-2.4T-A95B auf Hugging Face und ModelScope.

Es ist das erste offene Qwen-Max-Klassenmodell dieser Linie.

[qwen/q38-max-license]

279. Eigene Qwen3.8-Max-Lizenz

Der 2.4T-A95B-Checkpoint wird nicht einfach unter Apache 2.0 geführt, sondern besitzt eine eigene Qwen3.8-Max-Lizenz.

Das ist ein wichtiger Unterschied zum offenen 27B-Modell.

[qwen/q38-27]

280. 14. August 2026: Qwen3.8-27B

Qwen3.8-27B wird als offene dichte multimodale 27B-Klasse veröffentlicht.

Die Modellkarte führt Apache 2.0.

[qwen/q38-27-mm]

281. Multimodales 27B

Qwen3.8-27B verarbeitet Text und Bilder in einer gemeinsamen Foundationarchitektur.

Es ist wesentlich realistischer lokal betreibbar als 2.4T-A95B.

[qwen/q38-27-local]

282. Lokaler Sweet Spot

27B ist für große Consumer-GPUs, Macs mit viel Unified Memory oder Multi-GPU-Workstations interessant.

Quantisierung und Vision-Encoder erhöhen den realen Speicherbedarf.

[qwen/q38-max-product]

283. Qwen3.8-Max in Qwen Studio

Qwen Studio führt Qwen3.8-Max als aktuelles Flagship mit Text-, Bild- und Videofähigkeiten.

Die Studio-Produktoberfläche ergänzt Tools und weitere Dienste.

[qwen/q38-max-context]

284. 1M Kontext

Qwen Studio dokumentiert für Qwen3.8-Max bis zu eine Million Tokens Kontext.

Maximale Zusammenfassungsausgabe und maximaler Kontext sind unterschiedliche Limits.

[qwen/q38-cowork]

285. Coding und Cowork

Qwen3.8-Max wird besonders für professionelle Wissensarbeit und langfristige Agentenaufgaben positioniert.

„Cowork“ beschreibt den Arbeitsmodus mit Tools und Umgebung, nicht einen einzelnen Benchmark.

[qwen/q38-agent]

286. Long-Horizon Agents

Die Generation soll längere mehrstufige Aufgaben robuster bis zum Ende durchführen.

Langhorizontaufgaben benötigen Zustandsverwaltung, Fehlerkorrektur und Toolkontrolle.

[qwen/q38-reasoning-effort]

287. Flexible Reasoning-Tiefe

Qwen3.8 unterstützt differenziertere Reasoningsteuerung über `reasoning_effort` und erhält auf Wunsch Thinking-Kontext über mehrere Nachrichten.

Reasoningmodus ist eine Inferenzkonfiguration, kein separater Foundation-Checkpoint.

[qwen/preserve-thinking]

288. `preserve_thinking`

Neuere Qwen3.8-APIs können Reasoningkontext historischer Nachrichten erhalten.

Das kann iterative Agentenarbeit beschleunigen, erhöht aber Kontext- und Datenschutzbedarf.

[qwen/q38-flash]

289. Qwen3.8-Flash

Qwen3.8-Flash ist der aktuelle günstige, schnelle Produktionspfad der 3.8-Generation.

Model Studio listet ihn mit 1M Kontext und Context-Caching-Unterstützung.

[qwen/q38-flash-price]

290. Flash als Kostenklasse

Flash wird deutlich günstiger als Plus-/Max-Klassen angeboten.

Preise sind region- und zeitabhängig und gehören nicht dauerhaft in eine statische Modelldefinition.

[qwen/q38-flash-next]

291. 26. August 2026: Qwen3.8-Flash-Next

Qwen veröffentlicht Flash-Next als offenen multimodalen MoE-Forschungscheckpoint und frühe Vorschau auf die Architektur von Qwen4.

Die Gewichte erscheinen vor der vollständigen Qwen4-Familie, damit die Community die Architektur untersuchen kann.

[qwen/flashnext-main]

292. 125B Hauptmodell

Qwen3.8-Flash-Next besitzt ungefähr 125B Parameter im Hauptmodell.

Zusätzlich kommen große N-Gram-Embeddingtabellen hinzu.

[qwen/flashnext-active]

293. 6B aktive Parameter

Nur etwa 6B Hauptmodellparameter sind pro Token aktiv.

Das macht die Architektur trotz hoher Gesamtkapazität recheneffizient.

[qwen/flashnext-ngram]

294. 51B N-Gram-Embeddingparameter

Ein zusätzlicher Lookup-Speicher kodiert lokale Tokenmuster.

Die Adressen sind deterministisch und können aus Host Memory asynchron vorab geladen werden.

[qwen/flashnext-total]

295. Kapazität außerhalb klassischer FLOPs

Die 51B N-Gram-Parameter erhöhen gespeicherte Musterkapazität bei sehr wenig Matrixmultiplikationsaufwand.

Parameterzahl und FLOP-Aufwand entkoppeln sich dadurch weiter.

[qwen/qsa]

296. Qwen Sparse Attention

QSA wählt wichtige Kontextbereiche auf Micro-Block-Ebene aus, statt jedes Token global zu attendieren.

Das reduziert sowohl Attention- als auch Indexierungskosten bei sehr langen Sequenzen.

[qwen/qsa-gdn]

297. GDN + QSA

Gated DeltaNet komprimiert laufende Historie, QSA übernimmt präzises Retrieval aus wichtigen Kontextregionen.

Qwen beschreibt dies vereinfacht als effizientes Erinnern plus gezieltes Nachschlagen.

[qwen/gated-residual]

298. Gated Residual

Der Residual Stream wird auf mehrere parallele Pfade verbreitert und dynamisch gelesen beziehungsweise beschrieben.

Das soll Informationsfluss und Trainingsstabilität verbessern.

[qwen/gr-four]

299. Vier Residualzweige

Flash-Next verwendet mehrere parallele Residualzustände statt nur eines Streams.

Bestimmte Zweige können sich auf langfristige Informationsweitergabe spezialisieren.

[qwen/ngram]

300. N-Gram Embedding

Lookupadressen hängen vom aktuellen Token plus lokalen Vorgängertokens ab.

Das ergänzt Transformerwissen durch relativ kostengünstige lokale Pattern-Memory.

[qwen/muon]

301. Muon Optimizer

Qwen3.8-Flash-Next nutzt Muon für geeignete Matrixparameter und AdamW für andere Parametergruppen.

Optimizerdesign ist Teil der Trainingsarchitektur, keine Endnutzeroption.

[qwen/flashnext-context]

302. 262K nativ, 1M mit YaRN

Der offene Flash-Next-Checkpoint unterstützt 262.144 Tokens nativ und kann auf 1M extrapoliert werden.

Der gehostete Qwen3.8-Flash-Pfad bietet 1M standardmäßig.

[qwen/flashnext-multimodal]

303. Multimodal

Flash-Next verarbeitet Text und Bild und wird für visuelle Agenten evaluiert.

Multimodalität ist bereits Teil des neuen Qwen4-Vorläuferdesigns.

[qwen/flashnext-agent]

304. Agentenleistung

Der Release fokussiert Coding, Office-Arbeit, Tool Use, Android-/OS-/Webagenten und visuelle App-Rekonstruktion.

Benchmarks hängen stark vom verwendeten Agentenharness ab.

[qwen/flashnext-open]

305. Offene Architekturvorschau

Alibaba veröffentlicht nicht erst fertige Qwen4-Gewichte, sondern bereits den Architekturvorläufer.

Das wiederholt die Strategie von Qwen3-Next vor Qwen3.5.

[qwen/qwen4-preview]

306. Richtung Qwen4

Qwen erklärt ausdrücklich, dass die Flash-Next-Architektur ein früher Blick auf Qwen4 ist.

Am 1. September 2026 ist Qwen4 selbst jedoch noch keine veröffentlichte vollständige Modellfamilie.

[qwen/q38-vs-q4]

307. Qwen3.8-Flash-Next ist nicht Qwen4

Der Checkpoint bleibt unter dem Namen Qwen3.8-Flash-Next veröffentlicht.

Eine Architekturvorschau darf nicht als fertiger Qwen4-Release ausgegeben werden.

[qwen/q38-current-cloud]

308. Aktuelle Cloudmodelle

Model Studio führt unter anderem qwen3.8-max und qwen3.8-flash als aktuelle 3.8-Hauptmodelle.

Parallel bleiben 3.7- und ältere stabilisierte Modelle verfügbar.

[qwen/q38-responses]

309. Responses API

Neuere QwenCloud-Pfade unterstützen OpenAI-kompatible Responses-Schnittstellen.

Das erleichtert Integration in Agentenclients wie Codex-nahe Tools.

[qwen/q38-anthropic]

310. Anthropic-kompatible Schnittstelle

QwenCloud kann auch Anthropic-kompatible Clients bedienen.

Claude-Code-Kompatibilität bedeutet nicht, dass Claude als Modell verwendet wird.

[qwen/q38-tools]

311. Parallel Tool Calls

Qwen3.8-Cloudmodelle sind für agentische Toolnutzung ausgelegt.

Toolausführung bleibt in der Client-/Agentenschicht.

[qwen/q38-images]

312. Bildinput

Qwen3.8-27B und aktuelle 3.8-Cloudmodelle besitzen native visuelle Fähigkeiten.

Bildgenerierung bleibt dagegen Aufgabe der Qwen-Image-Serie.

[qwen/q38-video]

313. Video

Qwen3.8-Max wird in Qwen Studio als Text-/Bild-/Video-Modell geführt.

Videoeingabe ist produktseitig nicht automatisch für jeden offenen Checkpoint identisch.

[qwen/q38-endpoint]

314. Endpunkt am 1. September 2026

Die technische Chronik endet bei Qwen3.8-Max, Qwen3.8-27B und Qwen3.8-Flash-Next sowie dem gehosteten Qwen3.8-Flash.

Qwen4 wird nur als angekündigte Architekturfolge erwähnt, nicht als bereits existentes Release.

[qwen/studio]

315. Qwen Studio 2026

Qwen Studio ist der kostenlose Consumer-Assistent für Chat, Kreativität und multimodale Aufgaben.

Die angezeigte Modellversion kann sich serverseitig ändern.

[qwen/studio-auto]

316. Auto-Modus

Die Oberfläche kann Modell und Tools automatisch passend zur Aufgabe wählen.

Automatisches Routing erschwert reproduzierbare Modellvergleiche.

[qwen/studio-files]

317. Dateien

Qwen Studio kann Dokumente und Medien als Kontext verwenden.

Uploads sind ein anderer Datenpfad als lokal geladene offene Gewichte.

[qwen/studio-image]

318. Bildgenerierung

Qwen Studio integriert Qwen-Image-Funktionen.

Der Bildgenerator ist nicht das gleiche Modell wie Qwen3.8-Max.

[qwen/studio-edit]

319. Bildbearbeitung

Generative Editingfunktionen stammen aus Qwen-Image-/VLo-nahen Modellen.

Edits verändern Pixel generativ und sind kein verlustfreies Retuschieren.

[qwen/deep-research]

320. Deep Research

Qwen Studio bietet einen mehrstufigen Recherchemodus mit Websuche und Synthese.

Ein langer Bericht bleibt von Quellenqualität und Retrieval abhängig.

[qwen/research-report]

322. Berichte

Deep Research erzeugt strukturierte Ergebnisberichte.

Quellen, Datum und Gegenpositionen müssen erhalten bleiben.

[qwen/qwen-agent-current]

323. Qwen-Agent 2026

Qwen-Agent bleibt ein offenes Framework für Function Calling, MCP, RAG, Code Interpreter und Browserassistenten.

Es dient auch als Backend für Teile der Qwen-Chat-Erfahrung.

[qwen/agent-rag]

324. RAG

Qwen-Agent kann eigene Dokumentbestände durchsuchen und relevante Passagen in den Modellkontext geben.

Retrievalfehler und Modellfehler sind getrennt zu diagnostizieren.

[qwen/agent-code]

325. Code Interpreter

Python-/Codeausführung kann Berechnungen und Datenanalyse verifizieren.

Lokale Demo-Executorpfade sind nicht automatisch sandboxed.

[qwen/agent-browser]

326. Browser Assistant

Qwen-Agent enthält Browser-/Webagentenbeispiele.

Webinhalte gelten als nicht vertrauenswürdige Eingabe.

[qwen/agent-mcp]

327. MCP-Unterstützung

Qwen-Agent kann MCP-Server als standardisierte Toolquelle anbinden.

Serverrechte und Datenzugriff müssen separat geprüft werden.

[qwen/qwenwork]

328. QwenWork

QwenWork ist Alibabas Produktivitätsplattform für agentische Büro- und Wissensarbeit.

Neuere Qwen3.8-Modelle werden als Cowork-/Work-Agenten darin eingesetzt.

[qwen/qwenwork-vs-code]

329. QwenWork ≠ Qwen Code

QwenWork zielt breiter auf Office- und Wissensarbeit; Qwen Code ist der Terminal-Coding-Agent.

Beide können dieselbe Qwen-Modellfamilie unterschiedlich orchestrieren.

[qwen/qoder-current]

330. Qoder

Qoder ist eine separate Codingplattform im Alibaba-Ökosystem mit Qwen-Integration.

Produktfeatures wie IDE, Repoindex und Tooling sind vom Modell getrennt.

[qwen/studio-app]

331. Qwen-App

Qwen Studio wird zusätzlich über mobile beziehungsweise Desktop-Apps angeboten.

Appfunktionen und Weboberfläche können zeitversetzt ausgerollt werden.

[qwen/studio-current-model]

332. Qwen3.8-Max in Studio

Anfang September 2026 zeigt Qwen Studio Qwen3.8-Max als aktuelle Spitzenoption.

Der sichtbare Produktname ist die beste Quelle für den aktuellen Consumerstand.

[qwen/usage-policy]

333. Usage Policy

Qwen Studio veröffentlicht eine Nutzungsrichtlinie für verbotene und hochriskante Anwendungen.

Sie umfasst auch Plattformen, APIs und offene Modelle als Verhaltensstandard.

[qwen/high-risk]

334. High-Risk Use

Gesundheit, Recht, Finanzen und kritische Infrastruktur verlangen laut Qwen-Richtlinie menschliche Fachaufsicht.

Eine starke Modellleistung ersetzt keine verantwortliche Endfreigabe.

[qwen/cloud-overview]

335. Model Studio als Produktionsplattform

Alibaba Cloud Model Studio stellt Qwen und Drittmodelle über Cloud-APIs bereit.

Für Unternehmen sind Region, Deployment Scope, Workspace, API-Domain und Modellname gemeinsam entscheidend.

[qwen/api-openai]

336. OpenAI-kompatible API

Viele Qwen-Text- und Multimodalmodelle lassen sich mit OpenAI-kompatiblen SDKs ansprechen.

Base URL, API Key und Modellname müssen zur Region passen.

[qwen/api-dashscope]

337. DashScope SDK

Alternativ stellt Alibaba ein eigenes DashScope SDK bereit.

Native APIs können Funktionen früher oder vollständiger unterstützen als kompatible Wrapper.

[qwen/api-responses]

338. Responses API

Neuere Modelle unterstützen das OpenAI-Responses-Muster für Tool- und Agentenflows.

Nicht jede ältere Qwen-Version unterstützt denselben Funktionsumfang.

[qwen/api-anthropic]

339. Anthropic-Protokoll

Ausgewählte QwenCloud-Modelle lassen sich über Anthropic-kompatible Clients ansprechen.

Protokoll und Modellherkunft bleiben getrennt.

[qwen/region]

340. Region bestimmt Datenspeicherort

Model Studio dokumentiert Regionen wie Beijing, Singapore, Frankfurt, Tokyo, Hong Kong und Virginia.

Die Region legt fest, wo statische Request-/Result-Daten gespeichert werden.

[qwen/scope]

341. Service Deployment Scope

Zusätzlich zur Region bestimmt ein Deployment Scope, wo Inferenz tatsächlich ausgeführt werden darf.

Global, International, EU, US, Japan, Hong Kong und Mainland-China-Scope haben unterschiedliche Grenzen.

[qwen/frankfurt]

342. Deutschland: Frankfurt

Alibaba Cloud Model Studio ist in `eu-central-1` verfügbar.

Workspaces können in Frankfurt je nach Konfiguration Global- oder EU-Inferenzscope verwenden.

[qwen/eu-scope]

343. EU-Scope

Beim EU-Scope soll Inferenz innerhalb der Europäischen Union bleiben.

Wer Datenresidenz benötigt, darf nicht versehentlich den Global-Scope wählen.

[qwen/global-scope]

344. Global-Scope

Global kann Inferenz über einen größeren internationalen Ressourcenpool verteilen, gegebenenfalls auch über verschiedene Rechtsräume.

Alibaba weist darauf hin, Cross-Border-Compliance selbst zu prüfen.

[qwen/singapore]

345. Singapore / International

Singapore nutzt einen International-Scope, der das chinesische Mainland ausschließt.

Dies ist nicht dasselbe wie EU-only.

[qwen/beijing]

346. Beijing / Mainland China

Beijing beschränkt Inferenz auf das chinesische Mainland.

API-Schlüssel und Domains sind regionsgebunden.

[qwen/us]

347. US Virginia

Virginia kann Global- oder US-restricted Modelle anbieten.

Bei US-restricted Modellen wird häufig ein `-us`-Suffix verwendet.

[qwen/japan]

348. Japan

Tokyo kann einen Japan-restricted Scope bereitstellen.

Auch hier sind Workspace und Modellverfügbarkeit regionsabhängig.

[qwen/hongkong]

349. Hong Kong

Hong Kong kann Global oder Hong-Kong-restricted bereitstellen.

Hong Kong ist regulatorisch und technisch vom chinesischen Mainland-Scope getrennt.

[qwen/workspace]

350. Workspaces

Workspaces isolieren Ressourcen, Berechtigungen und regionale Inferenzkonfiguration.

API-Keys sollten möglichst workspacebezogen vergeben werden.

[qwen/api-key]

351. API Keys

Schlüssel werden in der jeweiligen Region erzeugt und sind nicht beliebig regionsübergreifend nutzbar.

Sie gehören in Secret Stores, nicht in Clientcode.

[qwen/workspace-domain]

352. Workspace-Domain

Alibaba empfiehlt workspace-dedizierte Inferenzdomains für Produktion.

Sie ermöglichen klarere Isolation und Servicegarantien.

[qwen/trial-domain]

353. Trial Domain

Trial-Endpunkte sind für Tests gedacht.

Produktion sollte nicht von Trialquoten oder Previewlimits abhängen.

[qwen/static-data]

354. Statische Daten

Alibaba dokumentiert, dass statische Daten in der ausgewählten Region gespeichert bleiben.

Transienter Inferenztraffic kann innerhalb des gewählten Scope weitergeleitet werden.

[qwen/encryption]

355. Verschlüsselung

Übertragungen innerhalb der Model-Studio-Pipeline werden verschlüsselt.

Alibaba nennt zusätzlich AES-256 für übertragene beziehungsweise gespeicherte Anwendungs-/Trainingsdaten in seiner Privacy-Dokumentation.

[qwen/no-training-business]

356. Keine Nutzung von Kundengeschäftsdaten ohne Zustimmung

Alibaba Cloud erklärt, Kundengeschäftsdaten nicht ohne ausdrückliche Einwilligung für Entwicklung oder Verbesserung der Modelle zu verwenden.

Das ist eine Cloud-Model-Studio-Aussage und darf nicht automatisch auf Qwen-Studio-Consumerchats übertragen werden.

[qwen/training-data]

357. Qwen-Trainingsdatenkategorien

Alibaba nennt öffentlich zugängliche Internetdaten, Partnerdaten, bezahlte/gelabelte Daten und synthetische Daten.

Die Dokumentation weist darauf hin, dass auch urheberrechtlich oder markenrechtlich geschütztes Material enthalten sein kann.

[qwen/training-filter]

358. Datenfilterung

Automatische Safetyfilter, menschliche Reviews und Filter für personenbezogene Informationen werden als Pretraining-Governance genannt.

Solche Verfahren reduzieren Risiken, garantieren aber keine vollständige Entfernung.

[qwen/synthetic]

359. Synthetische Daten

Qwen nutzt synthetisch erzeugte Daten für seltene Aufgaben, Reasoning, Multimodalität und Robustheit.

Teacherfehler können in synthetischen Daten weitergegeben werden.

[qwen/fine-tune]

360. Fine-Tuning in Model Studio

Model Studio unterstützt unter anderem SFT, DPO und Continued Pretraining für ausgewählte Modelle.

Fine-Tunes sind eigene Modellartefakte mit eigenem Safetyprofil.

[qwen/dataset]

361. Datasets

Training- und Evaluationsdatensätze werden workspacebezogen verwaltet.

Datenschutz und Rechte an hochgeladenen Trainingsdaten liegen in der Verantwortung des Anwenders.

[qwen/context-cache]

362. Context Cache

Ausgewählte Qwen3.7-/3.8-Modelle unterstützen implizites Prefix Caching.

Der Cache kann wiederkehrende lange Präfixe günstiger machen.

[qwen/cache-1024]

363. Prefix ab ungefähr 1024 Tokens

Bei vielen Model-Studio-Modellen erfüllt ein gemeinsames Präfix ab 1024 Tokens die technische Voraussetzung für einen möglichen Cache-Hit.

Ein Hit ist dennoch nicht garantiert.

[qwen/cache-not-memory]

364. Cache ≠ Memory

Context Caching optimiert Inferenzkosten.

Es ist kein persönliches Langzeitgedächtnis und keine Wissensdatenbank.

[qwen/pricing]

365. Tokenbasierte Preise

Modelle werden nach Input- und Outputtokens abgerechnet; lange Kontexte können gestaffelte Preise besitzen.

Preise ändern sich schnell und werden deshalb nicht als dauerhafte Modellmerkmale behandelt.

[qwen/batch]

366. Batch Inference

Ausgewählte Flashmodelle bieten reduzierte Batchpreise.

Batch ist für zeitunkritische Jobs geeignet, nicht für interaktive Chats.

[qwen/lifecycle]

367. Model Lifecycle

Alibaba dokumentiert einen formalen Modell-Lifecycle mit Retirement-Ankündigungen.

Snapshot- und Mainline-Modelle besitzen unterschiedliche Vorlaufzeiten.

[qwen/snapshot]

368. Snapshot-Modelle

Datierte Namen wie `qwen3.7-flash-2026-07-15` sind reproduzierbare Stände.

Sie können später gezielt abgekündigt werden.

[qwen/mainline]

369. Mainline-Modelle

Bezeichnungen ohne Datum wie `qwen3.7-flash` können auf einen aktuellen Snapshot zeigen.

Für Langzeitbenchmarks ist der bewegliche Alias weniger geeignet.

[qwen/retirement]

370. Retirement

Bei auslaufenden Modellen werden QPM/TPM schrittweise reduziert und schließlich API-Aufrufe beendet.

Produktionsanwendungen brauchen Migrationsplanung.

[qwen/current-models]

371. Aktueller API-Katalog

Ende August 2026 führt Model Studio Qwen3.8-Max/Flash, Qwen3.7, Qwen3.6, Qwen3.5 sowie diverse Spezialmodelle.

Region und Scope bestimmen, welche Modell-ID tatsächlich verfügbar ist.

[qwen/current-frankfurt]

372. Frankfurt-Modellangebot

Frankfurt bietet aktuelle Qwen-Modelle über workspace-dedizierte Domains und verschiedene Deployment Scopes.

Nicht jedes China-Beijing-Modell ist automatisch auch in Frankfurt verfügbar.

[qwen/knowledge-base]

373. Knowledge Base

Model Studios integrierte Knowledge-Base-Funktion ist regional eingeschränkt und laut aktueller Dokumentation nicht in Frankfurt verfügbar.

RAG in Europa muss daher gegebenenfalls über eigene Retrieval-Infrastruktur umgesetzt werden.

[qwen/rag-own]

374. Eigenes RAG

Embeddings, Reranker und Vektordatenbanken können unabhängig von Model Studios eingebauter Knowledge Base betrieben werden.

Das erlaubt vollständige Kontrolle über Datenresidenz und Indexierung.

[qwen/api-versioning]

375. API-Versionierung

Kompatible Protokolle können sich langsamer ändern als Modellnamen.

Clienttests sollten Modell- und API-Regression getrennt erkennen.

[qwen/local]

376. Self-Hosting

Offene Qwen-Modelle können vollständig auf eigener Hardware oder eigener Cloud betrieben werden.

Dann übernimmt der Betreiber Inferenz, Security, Logging, Updates und Safety.

[qwen/hf]

377. Hugging Face

Qwen veröffentlicht offizielle Gewichte auf dem verifizierten Qwen-Account.

Repositoryrevision und Modellkarte gehören zum Reproduktionsstand.

[qwen/modelscope]

378. ModelScope

ModelScope ist der parallele Alibaba-nahe Distributionweg.

Für Regionen mit eingeschränktem Hugging-Face-Zugang ist er besonders wichtig.

[qwen/transformers]

379. Transformers

Qwen wird eng mit Hugging Face Transformers integriert.

Neue Qwen3.8-Architekturen benötigen ausreichend aktuelle Versionen.

[qwen/vllm]

380. vLLM

vLLM ist ein zentraler Serverpfad für Qwen3/3.5/3.8 und Coder-Modelle.

Neue multimodale und Reasoningfunktionen erfordern passende Parser.

[qwen/sglang]

381. SGLang

SGLang ist ebenfalls stark im Qwen-Serving-Ökosystem verankert.

MoE- und Long-Context-Optimierungen unterscheiden sich je Backend.

[qwen/llamacpp]

382. llama.cpp

GGUF-konvertierte Qwen-Modelle sind auf CPU, Apple Silicon und Consumer-GPUs nutzbar.

Nicht alle neuesten multimodalen Features werden sofort unterstützt.

[qwen/ollama]

383. Ollama

Ollama bietet einfache lokale Qwen-Installation.

Modelltags können Quantisierung und Template abstrahieren und sollten für Benchmarks genauer aufgelöst werden.

[qwen/lmstudio]

384. LM Studio

LM Studio macht Qwen-GGUFs grafisch lokal nutzbar.

Das Programm ist ein Drittprodukt und nicht Teil der Qwen-Entwicklung.

[qwen/mlx]

385. MLX

Apple-Silicon-Systeme verwenden häufig MLX-Konvertierungen für Qwen.

Unified Memory erlaubt große Modelle, Geschwindigkeit bleibt von Speicherbandbreite abhängig.

[qwen/gguf]

386. GGUF

GGUF bündelt quantisierte Gewichte und Metadaten für llama.cpp-nahe Laufzeiten.

Community-GGUFs sind nicht automatisch offizielle Alibaba-Artefakte.

[qwen/gptq]

387. GPTQ

Qwen hat seit frühen Generationen offizielle oder communitynahe GPTQ-Nutzung unterstützt.

Post-Training-Quantisierung kann Modellqualität beeinflussen.

[qwen/awq]

388. AWQ

AWQ ist ein weiterer etablierter Qwen-Quantisierungspfad.

Gerade bei Coder- und Reasoningmodellen wird Toolqualität nach Quantisierung neu geprüft.

[qwen/fp8]

389. FP8

Servermodelle können FP8 für Gewichte, Aktivierungen oder Cache verwenden.

Hardwareunterstützung ist entscheidend.

[qwen/fp4]

390. Niedrigere Präzision

Neuere Hardware- und Servingpfade experimentieren mit noch geringeren Präzisionen.

Speichergewinn darf nicht ohne Taskevaluation übernommen werden.

[qwen/ram]

391. RAM

Lokaler Speicherbedarf besteht aus Gewichten, KV-/State-Cache, Runtime und multimodalen Encodern.

Eine reine Modelldateigröße ist kein vollständiger RAM-Bedarf.

[qwen/vram]

392. VRAM

GPU-Speicher bestimmt, ob ein Modell vollständig auf der GPU liegt oder Offloading benötigt.

MoE spart Rechenleistung pro Token, aber nicht zwangsläufig Gewichtsspeicher.

[qwen/unified-memory]

393. Unified Memory

Macs und andere Unified-Memory-Systeme können große quantisierte Qwen-Modelle ohne getrennten VRAM laden.

Bandbreite begrenzt die Tokens-pro-Sekunde-Leistung.

[qwen/q38-local]

394. Qwen3.8-27B lokal

Der offene 27B-Checkpoint ist die naheliegende aktuelle 3.8-Klasse für starke lokale Systeme.

Er ist multimodal und Apache-2.0-lizenziert.

[qwen/q38-max-local]

395. Qwen3.8-2.4T-A95B lokal

Das offene Max-Modell ist technisch herunterladbar, aber für einzelne Consumerrechner unrealistisch.

Verteiltes Datacenter-Serving ist die praktische Zielklasse.

[qwen/flashnext-local]

396. Qwen3.8-Flash-Next lokal

125B Hauptparameter plus N-Gram-Speicher und nur 6B aktive Parameter machen Flash-Next architektonisch besonders effizient.

Gesamtspeicher bleibt dennoch groß.

[qwen/ngram-offload]

397. N-Gram-Embedding im Host Memory

Flash-Next kann große deterministische Embeddingtabellen außerhalb des GPU-Speichers halten.

Asynchrones Prefetching soll GPU-Belastung reduzieren.

[qwen/q35-local]

398. Qwen3.5 lokal

0.8B bis 397B-A17B bieten eine sehr breite multimodale Größenleiter.

9B, 27B und 35B-A3B sind für lokale High-End-Systeme besonders interessant.

[qwen/q36-local]

399. Qwen3.6 lokal

27B dense und 35B-A3B MoE sind die offenen Hauptgrößen.

MoE bietet hohe Geschwindigkeit, dense 27B ein einfacheres Speicher-/Servingprofil.

[qwen/local-q3]

400. Qwen3 lokal

0.6B bis 32B dense sowie 30B-A3B bieten viele lokale Optionen.

Qwen3 bleibt wegen breiter Runtimeunterstützung auch 2026 praktisch relevant.

[qwen/q25-local]

401. Qwen2.5 lokal

Qwen2.5-7B/14B/32B bleiben sehr verbreitet, weil zahlreiche Finetunes und Quantisierungen existieren.

Neuere Generationen sind nicht für jede ältere Runtime stabiler.

[qwen/coder-local]

402. Qwen Coder lokal

Qwen2.5-Coder-7B/32B und kleinere Qwen3-Coder-Derivate eignen sich für private Codinghilfe.

Repositoryzugriff und Shelltools erhöhen lokale Sicherheitsrisiken.

[qwen/vl-local]

403. Vision lokal

Qwen2.5-VL, Qwen3-VL und Qwen3.5/3.6/3.8 multimodale Modelle können Bilder lokal analysieren.

Visionencoder und Bildtokens erhöhen Speicher und Latenz.

[qwen/tts-local]

404. TTS lokal

Qwen3-TTS-0.6B/1.7B lassen sich lokal zur Sprachsynthese verwenden.

Voice Clone sollte nur mit berechtigtem Referenzaudio erfolgen.

[qwen/image-local]

405. Qwen-Image lokal

Offene Qwen-Image-Varianten können auf eigener GPU betrieben werden.

Bildgeneratoren benötigen andere Pipelines als LLM-Serving.

[qwen/embed-local]

406. Embeddings lokal

Qwen3-Embedding 0.6B/4B/8B eignet sich hervorragend für private RAG-Systeme.

Lokales Embedding verhindert, dass Dokumenttexte an eine externe Embedding-API gesendet werden.

[qwen/rerank-local]

407. Reranker lokal

Lokale Qwen3-Reranker verbessern Retrieval ohne Cloudtransfer.

Sie sind rechenintensiver als reine Vektorsuche.

[qwen/model-hash]

408. Hashes

Gewichtsdateien, Config, Tokenizer und Template werden mit Hashes archiviert.

Nur der Modellname reicht für Reproduzierbarkeit nicht.

[qwen/revision]

409. Revision

Hugging-Face-/ModelScope-Commit oder Snapshotdatum wird festgehalten.

Upstream-Repositories können Dokumentation und Dateien nachträglich ändern.

[qwen/template]

410. Chattemplate

Qwen-Generationen unterscheiden sich bei Thinking, Tool Calls und Multimodalformaten.

Ein falsches Template kann ein gutes Modell massiv verschlechtern.

[qwen/sampling]

411. Sampling

Temperature, top_p, top_k, Seed und Reasoning Effort gehören zum Teststand.

Benchmarkvergleiche ohne Samplingangaben sind unvollständig.

[qwen/context-local]

412. Kontext

Maximale Kontextlänge kann nativ, extrapoliert oder cloudseitig unterschiedlich sein.

Für lokale Nutzung ist zusätzlich Speicherverbrauch entscheidend.

[qwen/local-privacy]

413. Datenschutz bei Self-Hosting

Vollständig lokaler Betrieb sendet Prompts nicht automatisch an Alibaba.

Websuche, Telemetrie, MCP oder externe Tools können dennoch Daten übertragen.

[qwen/local-safety]

414. Safety lokal

Lokale Gewichte können ohne Cloudmoderation betrieben werden.

Der Betreiber muss eigene Richtlinien und Aktionsgrenzen setzen.

[qwen/local-update]

415. Updates

Lokale Modelle verändern sich nicht automatisch.

Das verbessert Reproduzierbarkeit, erfordert aber manuelle Security- und Qualitätsupdates.

[qwen/privacy-overview]

416. Datenschutz hängt vom Qwen-Zugang ab

Qwen Studio, Alibaba Cloud Model Studio, Drittanbieter-Hosting und vollständig lokales Self-Hosting besitzen unterschiedliche Datenpfade.

Eine pauschale Aussage wie „Qwen speichert Daten in China“ ist für alle Varianten technisch falsch.

[qwen/studio-privacy]

417. Qwen Studio Consumer

Qwen Studio verweist auf eigene Terms of Service und Privacy Policy.

Consumerchat wird deshalb getrennt von Model-Studios Unternehmenskontrollen bewertet.

[qwen/modelstudio-privacy]

418. Model Studio

Alibaba Cloud erklärt für Model Studio, Kundengeschäftsdaten nicht ohne ausdrückliche Zustimmung für Modelltraining zu verwenden.

Diese Aussage ist besonders für API-/Enterprise-Nutzung relevant.

[qwen/modelstudio-encryption]

419. Verschlüsselung

Model Studio dokumentiert verschlüsselte Übertragung und AES-256-Schutz für übermittelte Anwendungs-/Trainingsdaten.

Verschlüsselung ersetzt keine korrekte Region- und Berechtigungswahl.

[qwen/eu-residency]

420. EU-Datenresidenz

Frankfurt kann einen EU-restricted Deployment Scope verwenden, bei dem Inferenz innerhalb der EU bleiben soll.

Der Workspace muss ausdrücklich entsprechend konfiguriert werden.

[qwen/global-residency]

421. Global ist nicht EU-only

Ein Frankfurt-Workspace mit Global-Scope nutzt einen größeren weltweiten Inferenzpool.

Der Standort des API-Endpunkts allein garantiert daher keine EU-only-Verarbeitung.

[qwen/region-key]

422. Regionale API Keys

Keys und Endpunkte sind regionsgebunden.

Ein versehentlich verwendeter Singapore-/Beijing-Key kann einen anderen Datenpfad erzeugen.

[qwen/workspace-isolation]

423. Workspace-Isolation

Model Studio isoliert Ressourcen und Zugriffe zwischen Workspaces.

Organisationen sollten Projekte und Teams nicht unnötig in einem gemeinsamen Workspace mischen.

[qwen/ram-iam]

424. RAM/IAM

Alibaba-Cloud-Berechtigungen können Rollen und Zugriffe auf Model Studio steuern.

Least Privilege wird auch für AI-Entwicklerkonten angewandt.

[qwen/training-public]

426. Öffentliche Trainingsdaten

Qwen-Training nutzt öffentlich verfügbare Webdaten neben Partner-, gelabelten und synthetischen Daten.

Öffentlich zugänglich bedeutet nicht automatisch frei von Urheberrecht oder personenbezogenen Informationen.

[qwen/training-partner]

427. Partnerdaten

Alibaba nennt auch nichtöffentliche Daten aus Partnervereinbarungen.

Solche Datenquellen können Nutzungsbeschränkungen besitzen.

[qwen/training-labeled]

428. Labeling-Daten

Bezahlte und vertraglich beschaffte gelabelte Daten ergänzen das Training.

Menschen können dabei sensible Inhalte sehen; Governance ist daher Teil der Datenpipeline.

[qwen/training-synthetic]

429. Synthetische Trainingsdaten

Qwen nutzt eigene Modelle zur Erzeugung zusätzlicher Trainingsbeispiele.

Dies kann Datenlücken füllen, aber auch bestehende Modellverzerrungen reproduzieren.

[qwen/pi-filter]

430. PI-Filtering

Alibaba beschreibt Filterung personenbezogener Informationen in der Pretrainingvorbereitung.

Kein Filterverfahren kann garantieren, dass sämtliche personenbezogenen Daten entfernt werden.

[qwen/usage-policy-current]

432. Usage Policy vom 9. April 2026

Qwen Studio veröffentlicht klare Regeln zu illegalen, schädlichen und hochriskanten Anwendungen.

Die Richtlinie umfasst auch APIs und offene Modelle als vom Anbieter formulierten Nutzungsstandard.

[qwen/health-policy]

433. Gesundheit

Qwen fordert bei medizinischer Diagnose oder Behandlung professionelle menschliche Aufsicht.

AI-Ausgaben werden nicht als autonome medizinische Entscheidung genutzt.

[qwen/critical-infra]

435. Kritische Infrastruktur

Die Nutzungsrichtlinie untersagt beziehungsweise beschränkt riskante Eingriffe in kritische Systeme.

Agentische Tools benötigen dort besonders strenge technische Freigaben.

[qwen/minors]

436. Minderjährige

Qwen-Regeln enthalten besondere Schutzanforderungen für Minderjährige.

Personenbezogene Daten von Kindern dürfen nicht leichtfertig in multimodale Systeme hochgeladen werden.

[qwen/face-recognition]

437. Biometrie

Unzulässige Überwachung oder biometrische Identifikation ohne Zustimmung wird in der Usage Policy beschränkt.

Visionmodelle können technisch Gesichter erkennen, rechtliche Nutzung ist eine andere Frage.

[qwen/prompt-injection]

438. Prompt Injection

Qwen-Agenten können untrusted Webseiten, E-Mails, Dateien und MCP-Resultate lesen.

Externe Inhalte dürfen keine Systemrechte überschreiben.

[qwen/visual-injection]

439. Visuelle Prompt Injection

Native multimodale Qwen3.5–3.8-Modelle können Text in Screenshots erkennen.

Auch ein Bild kann versteckte manipulative Agentenanweisungen enthalten.

[qwen/mcp-security]

440. MCP-Sicherheit

Qwen-Agent und Qwen Code unterstützen MCP.

Serverauthentizität, Toolscope und Datenquelle werden vor Aktivierung geprüft.

[qwen/qwen-code-shell]

441. Shellrechte

Qwen Code kann je nach Konfiguration Shellbefehle ausführen.

Repositories, Home-Verzeichnis und Produktionssysteme sollten nicht unnötig vollständig freigegeben werden.

[qwen/qwen-code-subagents-security]

442. Subagenten

Mehrere Subagenten können parallel unterschiedliche Tools einsetzen.

Rechte und Kontexte sollten pro Subagent begrenzt werden.

[qwen/code-secrets]

443. Secrets

API Keys, SSH-Schlüssel, Tokens und `.env`-Dateien gehören nicht in Modellkontext oder öffentliche Agentenlogs.

Bei Exposition werden Secrets rotiert.

[qwen/code-supply-chain]

444. Software Supply Chain

Ein Coding-Agent kann Abhängigkeiten installieren und Scripts ausführen.

Paketquelle, Version und Installationsscripts werden geprüft.

[qwen/generated-code]

445. Generierter Code

Qwen kann syntaktisch korrekten, aber unsicheren Code erzeugen.

Tests, Static Analysis und Security Review bleiben Pflicht.

[qwen/browser-actions]

446. Browseraktionen

Visuelle Agenten können Buttons oder Formulare bedienen.

Zahlung, Veröffentlichung und Accountänderungen brauchen Bestätigung.

[qwen/robot-safety]

447. Robotik

Qwen-VLA und Qwen-Robot erweitern AI in physische Aktionen.

Realwelt-Aktoren benötigen harte Sicherheitsgrenzen außerhalb des Foundation-Modells.

[qwen/voice-clone-risk]

448. Voice Clone

Qwen3-TTS kann Stimmen aus kurzer Referenz imitieren.

Einwilligung, Identitätsschutz und Betrugsprävention sind zentrale Einsatzbedingungen.

[qwen/image-deception]

449. Bildgenerierung

Qwen-Image kann realistische Personen, Interfaces und Dokumentlayouts erzeugen.

Generierte Darstellungen sollten nicht als dokumentarische Originale ausgegeben werden.

[qwen/deepfake]

450. Deepfakes

Bild-, Video- und Sprachmodelle können Identitätsimitation erleichtern.

Kennzeichnung und Zustimmung sind wichtiger als technische Perfektion.

[qwen/retrieval-privacy]

451. Embeddings und RAG

Embeddings können sensible semantische Informationen aus Dokumenten kodieren.

Lokale Embedding-/Reranker-Modelle sind bei vertraulichen Daten besonders nützlich.

[qwen/embedding-leak]

452. Vektorindizes

Ein Embedding ist kein anonymes Datenobjekt.

Zugriff auf Vektorindex und Quelldokumente wird genauso geschützt wie andere Unternehmensdaten.

[qwen/cache-privacy]

453. Context Cache

Prefix Caching kann Teile wiederkehrender Prompts temporär für Inferenzoptimierung verwenden.

Cachepolitik wird von dauerhaftem Chatverlauf und Training getrennt betrachtet.

[qwen/logs]

454. Logging

API-, Agenten- und Debuglogs können Prompts, Tools und sensible Resultate enthalten.

Redaction, Retention und Zugriffskontrolle gehören zur Produktionsarchitektur.

[qwen/audit]

455. Audit

Agentensysteme sollten Modell, Tool, Aktion, Zeit, Nutzer und Freigabe nachvollziehbar protokollieren.

Auditlogs selbst sind schützenswerte Daten.

[qwen/local-privacy-strong]

456. Self-Hosting als Datenschutzoption

Offene Qwen-Gewichte erlauben Inferenz ohne Alibaba-Cloudtransfer.

Das ist ein wesentlicher Vorteil gegenüber ausschließlich proprietären Modellen.

[qwen/local-telemetry]

457. Lokale Telemetrie

Ein lokales Modell garantiert nicht, dass Launcher, Betriebssystem oder Plugins keine Telemetrie senden.

Netzwerkpfade werden separat geprüft.

[qwen/china-hosted]

458. China-hosted Qwen

Beijing-Model-Studio-Scope verarbeitet Inferenz im chinesischen Mainland.

Für europäische personenbezogene Daten ist das eine andere Complianceklasse als Frankfurt/EU.

[qwen/international-scope]

459. International-Scope

Singapore schließt das chinesische Mainland aus, ist aber nicht auf die EU begrenzt.

Für EU-only-Anforderungen ist Frankfurt/EU die präzisere Wahl.

[qwen/model-bias]

460. Bias

Mehrsprachige und multimodale Trainingsdaten enthalten gesellschaftliche und kulturelle Verzerrungen.

Benchmarks messen nur einen Teil davon.

[qwen/political-content]

461. Politisch sensible Inhalte

Gehostete Qwen-Dienste können regionalen Inhaltsregeln und Plattformpolicies unterliegen.

Hosted Service und offener Checkpoint können deshalb unterschiedlich antworten.

[qwen/host-vs-weight]

462. Hosted vs. Weight

Systemprompt, Moderation, Search und Tooling können das Verhalten eines Cloudprodukts stark verändern.

Ein lokaler Test darf nicht automatisch als Qwen-Studio-Verhalten verallgemeinert werden.

[qwen/human-review]

463. Human in the Loop

Je höher das Risiko einer Aktion, desto stärker sollte menschliche Freigabe eingesetzt werden.

Das gilt besonders bei Code, Robotik, Finanzen, Kommunikation und Veröffentlichung.

[qwen/rollback]

464. Rollback

Agentische Änderungen an Dateien und Repositories werden versioniert.

Git, Backups und Entwurfszustände sind Sicherheitswerkzeuge.

[qwen/fail-safe]

465. Fail-safe

Bei unklarem Ziel oder unsicherem Toolzustand stoppt der Agent.

Er soll nicht durch plausibles Raten eine irreversible Aktion erzwingen.

[qwen/choose-studio]

466. Qwen einfach ausprobieren

Qwen Studio ist der unkomplizierteste Consumerzugang zu aktuellen Modellen und Medienfunktionen.

Für vertrauliche Geschäftsdaten ist ein kontrollierter Model-Studio- oder Self-Hosting-Pfad geeigneter.

[qwen/choose-max]

467. Maximale Cloudqualität

Qwen3.8-Max ist die aktuelle Qwen-Flagshipklasse.

Kosten und Latenz sind höher als bei Flash.

[qwen/choose-flash]

468. Günstige schnelle API

Qwen3.8-Flash eignet sich für hohe Anfragevolumen, Tool Workflows und Standardaufgaben.

Bei sehr komplexem Reasoning kann Max besser sein.

[qwen/choose-27]

469. Aktuell stark lokal

Qwen3.8-27B ist die naheliegende aktuelle offene 3.8-Größe für leistungsfähige lokale Systeme.

Apache 2.0 vereinfacht viele Entwicklungs- und kommerzielle Szenarien.

[qwen/choose-flashnext]

470. Architekturforschung

Qwen3.8-Flash-Next ist besonders interessant für Forschung an Qwen4-Vorläufertechnik, QSA, Gated Residual und N-Gram Memory.

Der Checkpoint ist eher Architektur-/Effizienzstudie als einfach nur „kleiner Qwen3.8-Max“.

[qwen/choose-q36moe]

471. Effizientes lokales Multimodalmodell

Qwen3.6-35B-A3B bietet nur 3B aktive Parameter bei starker multimodaler und agentischer Leistung.

Gesamtgewichte bleiben deutlich größer als 3B.

[qwen/choose-q3627]

472. Dense Workstationmodell

Qwen3.6-27B eignet sich für Nutzer, die eine dichte 27B-Architektur bevorzugen.

Sie ist gut vergleichbar mit Qwen3.8-27B als neuere Alternative.

[qwen/choose-q35small]

473. Kleines multimodales Modell

Qwen3.5-4B oder 9B sind gute lokale Kandidaten für Vision plus Text mit begrenzter Hardware.

Sehr kleine Modelle haben weniger robustes Reasoning.

[qwen/choose-q3]

474. Breit unterstütztes Text-/Reasoningmodell

Qwen3 besitzt ein extrem reifes lokales Ökosystem und viele Größen.

Für rein textuelle Aufgaben kann es trotz neuerer Multimodalmodelle praktisch bleiben.

[qwen/choose-coder]

475. Coding-Agent

Qwen3-Coder beziehungsweise aktuelle Qwen3.8-Modelle in Qwen Code eignen sich für Repositoryarbeit.

Der Harness und dessen Rechte sind genauso wichtig wie die Modellwahl.

[qwen/choose-embedding]

476. RAG

Qwen3-Embedding plus Qwen3-Reranker eignet sich für textbasierte Wissenssysteme.

Für Bilder, Screenshots und Video sind Qwen3-VL-Embedding/Reranker passender.

[qwen/choose-vl-embed]

477. Multimodales Retrieval

Qwen3-VL-Embedding kann Text, Bilder und Videos in einen gemeinsamen Suchraum abbilden.

Große Datenbestände profitieren von zweistufigem Retrieval.

[qwen/choose-vision]

478. Bild-/Dokumentanalyse

Qwen3.8-27B, Qwen3.6 oder Qwen3-VL sind geeignete offene Visionmodelle.

Das richtige Modell hängt von Hardware und Agentenbedarf ab.

[qwen/choose-video]

479. Langes Video

Qwen3.7-Plus/Flash und andere aktuelle Cloud-Multimodalmodelle sind für lange Videos ausgelegt.

Lokale Analyse langer Videos benötigt sehr viel Kontext- und Compute-Budget.

[qwen/choose-omni]

480. Audio + Vision + Sprache

Omni-Modelle sind sinnvoll, wenn mehrere Modalitäten in Echtzeit zusammenspielen sollen.

Für reine Textaufgaben ist der Omni-Stack unnötig schwer.

[qwen/choose-tts]

481. Sprachsynthese

Qwen3-TTS eignet sich für mehrsprachige TTS, Voice Design und berechtigtes Voice Cloning.

Ein allgemeines Qwen-LLM ersetzt kein spezialisiertes TTS-Modell.

[qwen/choose-image]

482. Bildgenerierung

Qwen-Image-3.0 ist die aktuelle Qwen-Bildgenerationslinie.

Bildverständnis wird dagegen von Qwen-VL beziehungsweise den nativ multimodalen Qwen3.x-Modellen übernommen.

[qwen/choose-eu]

483. EU-Datenresidenz

Für API-Daten mit EU-Anforderung ist ein Frankfurt-Workspace mit EU-Deployment-Scope der naheliegende Alibaba-Cloud-Pfad.

Global-Scope darf nicht versehentlich gewählt werden.

[qwen/choose-local-sensitive]

484. Sensible Daten

Vollständiges Self-Hosting mit lokalem Embedding, Reranking und Modell bietet maximale Datenkontrolle.

Externe Search-/MCP-Tools werden dann bewusst einzeln zugelassen.

[qwen/choose-api]

485. Produktions-API

Model Studio eignet sich für skalierbaren gehosteten Zugriff ohne eigene Inferenzcluster.

Snapshot-Modelle werden für reproduzierbare Produktionen bevorzugt.

[qwen/choose-research]

486. Historische Modellforschung

Offizielle Blogs, GitHub, Hugging Face und ModelScope sind die wichtigsten Primärquellen.

Qwen-Studio-Antworten selbst ersetzen keine Modellkarte.

[qwen/choose-robot]

487. Robotik

Qwen-VLA und Qwen-Robot sind für embodied AI geeignet.

Sie benötigen reale Sicherheitssteuerung und sind kein allgemeiner Chatersatz.

[qwen/choose-agentworld]

488. Agententraining

Qwen-AgentWorld eignet sich als Forschungsgrundlage für simulierte Agentenumgebungen.

Simulationserfolg muss gegen reale Umgebungen validiert werden.

[qwen/choose-old]

489. Ältere Qwen2.5-Modelle

Qwen2.5 bleibt sinnvoll, wenn eine stabile Runtime, bestehender Finetune oder geringe Migrationskosten wichtiger sind.

Neu ist nicht automatisch für jede Anwendung besser.

[qwen/choose-license]

490. Lizenzkritische Anwendung

Apache-2.0-Checkpoints wie Qwen3.8-27B sind oft einfacher zu bewerten als Modelle mit eigener Qwen-Lizenz.

Die konkrete LICENSE-Datei muss trotzdem gelesen werden.

[qwen/hilfe-model-missing]

491. Problemhilfe: Qwen-Modell wird nicht gefunden

Mögliche Ursache: Region, Scope oder Modellname passen nicht zusammen.

Sinnvolle Prüfung: aktuelle Modellliste der konkreten Region prüfen.

[qwen/hilfe-api-key]

492. Problemhilfe: API-Key funktioniert nicht

Mögliche Ursache: Key gehört zu anderer Region oder Workspace.

Sinnvolle Prüfung: Keyverwaltung und Base-URL gemeinsam prüfen.

[qwen/hilfe-frankfurt]

493. Problemhilfe: Frankfurt-Aufruf scheitert

Mögliche Ursache: workspace-dedizierte Domain oder Workspace-ID fehlt.

Sinnvolle Prüfung: eu-central-1-Domain prüfen.

[qwen/hilfe-eu-scope]

494. Problemhilfe: EU-Datenresidenz ist unklar

Mögliche Ursache: Workspace verwendet Global statt EU.

Sinnvolle Prüfung: Deployment Scope prüfen.

[qwen/hilfe-global-scope]

495. Problemhilfe: Anfrage läuft global

Mögliche Ursache: Global-Scope bewusst oder versehentlich gewählt.

Sinnvolle Prüfung: Workspace-Scope umstellen.

[qwen/hilfe-snapshot]

496. Problemhilfe: Alias verhält sich plötzlich anders

Mögliche Ursache: beweglicher Mainline-Name wurde aktualisiert.

Sinnvolle Prüfung: datierte Snapshot-ID pinnen.

[qwen/hilfe-retired]

497. Problemhilfe: Altes Modell liefert Fehler

Mögliche Ursache: Snapshot/Mainline wurde retired.

Sinnvolle Prüfung: Retirement-Hinweis und Nachfolger prüfen.

[qwen/hilfe-q38-max-local]

498. Problemhilfe: Qwen3.8-Max passt nicht lokal

Mögliche Ursache: 2.4T-A95B ist Datacenterklasse.

Sinnvolle Prüfung: 27B/Flash-Next oder Cloud verwenden.

[qwen/hilfe-q38-license]

499. Problemhilfe: Max-Lizenz passt nicht zum Projekt

Mögliche Ursache: 2.4T-Modell besitzt eigene Qwen3.8-Max-Lizenz.

Sinnvolle Prüfung: LICENSE direkt lesen.

[qwen/hilfe-q38-27-vision]

500. Problemhilfe: 27B verarbeitet Bild nicht

Mögliche Ursache: Runtime/Processor unterstützt Multimodalformat nicht.

Sinnvolle Prüfung: aktuelle Transformers/vLLM-Version nutzen.

[qwen/hilfe-flashnext]

501. Problemhilfe: Flash-Next wird als Qwen4 erkannt

Mögliche Ursache: Architektur ist nur Vorschau.

Sinnvolle Prüfung: Modellname Qwen3.8-Flash-Next beibehalten.

[qwen/hilfe-flashnext-memory]

502. Problemhilfe: Flash-Next braucht viel RAM

Mögliche Ursache: 125B Hauptmodell plus 51B N-Gram-Embeddings.

Sinnvolle Prüfung: Host-Memory-/Quantisierungspfad planen.

[qwen/hilfe-flashnext-context]

503. Problemhilfe: 1M lokal funktioniert schlecht

Mögliche Ursache: 262K ist nativ, 1M extrapoliert.

Sinnvolle Prüfung: YaRN/Runtime und Retrieval testen.

[qwen/hilfe-reasoning]

504. Problemhilfe: Antwort denkt zu lange

Mögliche Ursache: Thinking/Reasoning Effort zu hoch.

Sinnvolle Prüfung: Non-Thinking oder geringeren Effort wählen.

[qwen/hilfe-preserve]

505. Problemhilfe: Altes Thinking stört neuen Turn

Mögliche Ursache: preserve_thinking hält Reasoningkontext.

Sinnvolle Prüfung: Funktion gezielt deaktivieren.

[qwen/hilfe-q3-switch]

506. Problemhilfe: `/think` funktioniert nicht

Mögliche Ursache: neueres Modell/API nutzt andere Steuerung.

Sinnvolle Prüfung: Modellspezifische Doku prüfen.

[qwen/hilfe-tool-call]

507. Problemhilfe: Function Call hat falsche Argumente

Mögliche Ursache: Schema oder Modellinterpretation fehlerhaft.

Sinnvolle Prüfung: Parameter validieren.

[qwen/hilfe-parallel-tools]

508. Problemhilfe: Parallele Tools widersprechen sich

Mögliche Ursache: Agenten sehen unterschiedlichen Zustand.

Sinnvolle Prüfung: Ergebnisse synchronisieren.

[qwen/hilfe-mcp]

509. Problemhilfe: MCP-Server ist nicht erreichbar

Mögliche Ursache: Auth, URL oder Scope falsch.

Sinnvolle Prüfung: Server separat testen.

[qwen/hilfe-prompt-injection]

510. Problemhilfe: Agent folgt Webseitenanweisung

Mögliche Ursache: untrusted Content wurde als Instruktion behandelt.

Sinnvolle Prüfung: System-/Toolgrenzen erzwingen.

[qwen/hilfe-visual-injection]

511. Problemhilfe: Screenshot manipuliert Agenten

Mögliche Ursache: Bild enthält adversarialen Text.

Sinnvolle Prüfung: visuelle Inhalte als untrusted behandeln.

[qwen/hilfe-qwen-code-install]

512. Problemhilfe: Qwen Code startet nicht

Mögliche Ursache: Installer/Node/Plattformproblem.

Sinnvolle Prüfung: aktuelle offizielle Installation prüfen.

[qwen/hilfe-qwen-code-auth]

513. Problemhilfe: Qwen OAuth funktioniert nicht mehr

Mögliche Ursache: kostenloser OAuth-Pfad wurde April 2026 eingestellt.

Sinnvolle Prüfung: Coding Plan oder eigenen Provider konfigurieren.

[qwen/hilfe-qwen-code-shell]

514. Problemhilfe: Agent ändert falsche Datei

Mögliche Ursache: Workspace oder Shellrechte zu breit.

Sinnvolle Prüfung: Git und Working Directory prüfen.

[qwen/hilfe-subagent]

515. Problemhilfe: Subagent liefert widersprüchliches Ergebnis

Mögliche Ursache: eigener Kontext oder Tools unterscheiden sich.

Sinnvolle Prüfung: Hauptagent synthetisiert und prüft.

[qwen/hilfe-subagent-cost]

516. Problemhilfe: Zu viele Subagenten

Mögliche Ursache: Parallelisierung erhöht API- und Toolkosten.

Sinnvolle Prüfung: Agentenzahl begrenzen.

[qwen/hilfe-coder-context]

517. Problemhilfe: Repository passt nicht in Kontext

Mögliche Ursache: Repo > Modellfenster oder Dateiauswahl schlecht.

Sinnvolle Prüfung: Search/Index/RAG einsetzen.

[qwen/hilfe-coder-tests]

518. Problemhilfe: Code sieht gut aus, Tests scheitern

Mögliche Ursache: Modell hat Fachlogik oder API falsch verstanden.

Sinnvolle Prüfung: Tests und Diff prüfen.

[qwen/hilfe-secret]

519. Problemhilfe: Secret im Agentenlog

Mögliche Ursache: Agent durfte `.env` oder Credentialdateien lesen.

Sinnvolle Prüfung: Secret rotieren und Rechte reduzieren.

[qwen/hilfe-dependency]

520. Problemhilfe: Agent installiert unsichere Abhängigkeit

Mögliche Ursache: Paketname/Herkunft ungeprüft.

Sinnvolle Prüfung: Registry und Lockfile kontrollieren.

[qwen/hilfe-q3coder]

521. Problemhilfe: Qwen3-Coder schlechter als Qwen3.8

Mögliche Ursache: älteres Spezialmodell wird mit neuerem Generalisten verglichen.

Sinnvolle Prüfung: aktuelle Taskbenchmarks testen.

[qwen/hilfe-q25coder]

522. Problemhilfe: Qwen2.5-Coder wirkt alt

Mögliche Ursache: neuere Agentenmodelle sind stärker.

Sinnvolle Prüfung: bei stabilem Legacyworkflow behalten oder migrieren.

[qwen/hilfe-embedding]

523. Problemhilfe: RAG findet falsche Dokumente

Mögliche Ursache: Embedding/Chunking/Instruction ungeeignet.

Sinnvolle Prüfung: Retrievaltreffer direkt prüfen.

[qwen/hilfe-reranker]

524. Problemhilfe: Reranker verschlechtert Treffer

Mögliche Ursache: falsche Query-Dokument-Formatierung.

Sinnvolle Prüfung: Instruction und Kandidaten prüfen.

[qwen/hilfe-embed-dim]

525. Problemhilfe: Kürzere Embeddingdimension verliert Qualität

Mögliche Ursache: MRL-Dimension zu aggressiv reduziert.

Sinnvolle Prüfung: höhere Dimension vergleichen.

[qwen/hilfe-vl-embed]

526. Problemhilfe: Multimodale Suche verfehlt Text

Mögliche Ursache: VL-Embedding ist nicht optimal für reinen Text.

Sinnvolle Prüfung: Qwen3-Embedding gegenprüfen.

[qwen/hilfe-qwen-vl]

527. Problemhilfe: OCR liest Zahl falsch

Mögliche Ursache: Auflösung/Layout oder Modellfehler.

Sinnvolle Prüfung: Originalbild vergrößern und kontrollieren.

[qwen/hilfe-video]

528. Problemhilfe: Videoantwort verpasst Szene

Mögliche Ursache: Frame-/Tokenbudget priorisiert andere Abschnitte.

Sinnvolle Prüfung: Zeitbereich eingrenzen.

[qwen/hilfe-omni-audio]

529. Problemhilfe: Omni versteht Sprache falsch

Mögliche Ursache: Audioqualität, Dialekt oder Streamingfehler.

Sinnvolle Prüfung: Transkript gegenprüfen.

[qwen/hilfe-tts-pronunciation]

530. Problemhilfe: TTS spricht Namen falsch

Mögliche Ursache: Aussprache oder Sprache nicht eindeutig.

Sinnvolle Prüfung: phonetische/Sprachhinweise verwenden.

[qwen/hilfe-tts-clone]

531. Problemhilfe: Voice Clone klingt instabil

Mögliche Ursache: Referenzaudio zu kurz/rauschig.

Sinnvolle Prüfung: saubere berechtigte Referenz verwenden.

[qwen/hilfe-image-text]

532. Problemhilfe: Qwen-Image schreibt Text falsch

Mögliche Ursache: generative Typografie bleibt probabilistisch.

Sinnvolle Prüfung: Text im Output kontrollieren.

[qwen/hilfe-image-edit]

533. Problemhilfe: Bearbeitung verändert Hintergrund

Mögliche Ursache: generatives Editing rekonstruiert mehr als Zielbereich.

Sinnvolle Prüfung: Originalvergleich durchführen.

[qwen/hilfe-image-real]

534. Problemhilfe: Bild wirkt fotografisch echt

Mögliche Ursache: Qwen-Image-3.0 ist stark auf Realismus optimiert.

Sinnvolle Prüfung: AI-Herkunft dokumentieren.

[qwen/hilfe-qwen-agent-code]

535. Problemhilfe: Code Interpreter ist unsicher

Mögliche Ursache: lokaler Demoexecutor ist nicht zwingend sandboxed.

Sinnvolle Prüfung: isolierte Umgebung verwenden.

[qwen/hilfe-rag-region]

536. Problemhilfe: Built-in Knowledge Base fehlt in Frankfurt

Mögliche Ursache: Feature ist regional eingeschränkt.

Sinnvolle Prüfung: eigenes RAG aufbauen.

[qwen/hilfe-cache]

537. Problemhilfe: Context Cache trifft nicht

Mögliche Ursache: Prefix nicht identisch oder Cache abgelaufen.

Sinnvolle Prüfung: cache hit tokens aus Response prüfen.

[qwen/hilfe-cache-cost]

538. Problemhilfe: Kosten höher als erwartet

Mögliche Ursache: Cache-Miss oder Long-Context-Tier.

Sinnvolle Prüfung: Usage/Cache-Felder prüfen.

[qwen/hilfe-long-context]

539. Problemhilfe: 1M-Kontext wird teuer

Mögliche Ursache: Preis und Rechenaufwand steigen mit Tokens.

Sinnvolle Prüfung: Retrieval/Kompression einsetzen.

[qwen/hilfe-long-context-miss]

540. Problemhilfe: Modell übersieht Detail in 1M

Mögliche Ursache: Attention ist nicht perfektes Retrieval.

Sinnvolle Prüfung: kritische Passage referenzieren.

[qwen/hilfe-region-model]

541. Problemhilfe: Modell in Beijing vorhanden, Frankfurt nicht

Mögliche Ursache: regionale Modellkataloge unterscheiden sich.

Sinnvolle Prüfung: Frankfurt-Liste prüfen.

[qwen/hilfe-batch]

542. Problemhilfe: Batchantwort kommt nicht interaktiv

Mögliche Ursache: Batch ist asynchroner Kostenpfad.

Sinnvolle Prüfung: Realtime-Endpunkt verwenden.

[qwen/hilfe-fine-tune]

543. Problemhilfe: Fine-Tune wird schlechter

Mögliche Ursache: Trainingsdaten/Hyperparameter übersteuern Basismodell.

Sinnvolle Prüfung: Evalset und Baseline vergleichen.

[qwen/hilfe-dataset]

544. Problemhilfe: Trainingsdaten enthalten Geheimnisse

Mögliche Ursache: Workspace-Dataset wurde ungeprüft befüllt.

Sinnvolle Prüfung: Datenklassifikation und Rechte prüfen.

[qwen/hilfe-cloud-training]

545. Problemhilfe: Sorge, Businessdaten trainierten Qwen

Mögliche Ursache: Model Studio erklärt keine Nutzung ohne Zustimmung.

Sinnvolle Prüfung: Vertrag/Consent-Setting prüfen.

[qwen/hilfe-studio-vs-cloud]

546. Problemhilfe: Qwen Studio verhält sich anders als API

Mögliche Ursache: Produktoberfläche nutzt Tools/Routing/anderes Modell.

Sinnvolle Prüfung: Modell und Featurepfad dokumentieren.

[qwen/hilfe-studio-auto]

547. Problemhilfe: Auto liefert wechselnde Ergebnisse

Mögliche Ursache: Routingmodell kann wechseln.

Sinnvolle Prüfung: konkretes Modell auswählen.

[qwen/hilfe-research]

548. Problemhilfe: Deep Research zitiert schwache Quelle

Mögliche Ursache: Searchranking bevorzugt falsche Seite.

Sinnvolle Prüfung: Primärquelle öffnen.

[qwen/hilfe-research-date]

549. Problemhilfe: Research vermischt alt und neu

Mögliche Ursache: Publikationsdatum nicht sauber priorisiert.

Sinnvolle Prüfung: Ereignis- und Veröffentlichungsdatum prüfen.

[qwen/hilfe-q35-moe]

550. Problemhilfe: 35B-A3B ist langsamer als erwartet

Mögliche Ursache: Gewichtsladen/Memorybandbreite statt FLOPs limitiert.

Sinnvolle Prüfung: Runtime und Offload messen.

[qwen/hilfe-q36-dense]

551. Problemhilfe: 27B dense wirkt langsamer als A3B

Mögliche Ursache: alle 27B Parameter sind aktiv.

Sinnvolle Prüfung: dense/MoE passend zur Hardware wählen.

[qwen/hilfe-quant]

552. Problemhilfe: 4-Bit-Modell denkt schlechter

Mögliche Ursache: Quantisierung verändert Gewichte.

Sinnvolle Prüfung: 8-Bit/BF16 gegenprüfen.

[qwen/hilfe-gguf]

553. Problemhilfe: GGUF verhält sich anders

Mögliche Ursache: Communitytemplate oder Quantisierung weicht ab.

Sinnvolle Prüfung: Metadaten und Basisrevision prüfen.

[qwen/hilfe-mlx]

554. Problemhilfe: MLX liefert andere Ausgabe

Mögliche Ursache: Backend/Sampling/Quant unterscheiden sich.

Sinnvolle Prüfung: gleiche Parameter einstellen.

[qwen/hilfe-vllm]

555. Problemhilfe: vLLM erkennt Modell nicht

Mögliche Ursache: Version ist vor neuer Qwen-Architektur.

Sinnvolle Prüfung: Runtime aktualisieren.

[qwen/hilfe-transformers]

556. Problemhilfe: Transformers-Klasse fehlt

Mögliche Ursache: Bibliothek ist zu alt.

Sinnvolle Prüfung: offizielle Mindestversion prüfen.

[qwen/hilfe-license]

557. Problemhilfe: Kommerzielle Nutzung unklar

Mögliche Ursache: Qwen-Generation/Größe hat eigene Lizenz.

Sinnvolle Prüfung: konkrete LICENSE-Datei lesen.

[qwen/hilfe-q38max-license]

558. Problemhilfe: Qwen3.8-Max wird als Apache bezeichnet

Mögliche Ursache: Max-Checkpoint hat eigene Lizenz.

Sinnvolle Prüfung: Model Card prüfen.

[qwen/hilfe-medical]

559. Problemhilfe: Medizinische Antwort klingt kompetent

Mögliche Ursache: Modell ist keine Fachperson.

Sinnvolle Prüfung: Leitlinie und Arzt prüfen.

[qwen/hilfe-finance]

561. Problemhilfe: Finanzanalyse wirkt sicher

Mögliche Ursache: Marktdaten/Annahmen können fehlen.

Sinnvolle Prüfung: aktuelle Primärdaten prüfen.

[qwen/hilfe-robot]

562. Problemhilfe: VLA-Aktion ist gefährlich

Mögliche Ursache: Wahrnehmungs-/Planungsfehler.

Sinnvolle Prüfung: Safety Controller und Not-Aus verwenden.

[qwen/hilfe-model-retire]

563. Problemhilfe: Produktionsmodell wird abgekündigt

Mögliche Ursache: Lifecycle erreicht Retirement.

Sinnvolle Prüfung: Migration früh testen.

[qwen/myth-one]

564. Mythos: Qwen ist ein einzelnes Modell

Qwen ist eine große Familie aus LLMs, Vision, Audio, TTS, Image, Retrieval, Robotik und Agententools.

Der konkrete Modellname ist für jede technische Aussage notwendig.

[qwen/myth-studio-model]

565. Mythos: Qwen Studio ist das Modell

Qwen Studio ist die Consumeroberfläche.

Sie kann unterschiedliche Modelle, Search und Medienwerkzeuge orchestrieren.

[qwen/myth-modelstudio]

566. Mythos: Qwen Studio und Alibaba Cloud Model Studio sind dasselbe

Qwen Studio ist Consumerassistent; Model Studio ist Cloud-Entwicklerplattform.

Datenschutz- und Funktionsregeln unterscheiden sich.

[qwen/myth-open-all]

567. Mythos: Alle Qwen-Modelle sind Open Source

Viele Qwen-Gewichte sind offen, Max-/Plus-Cloudmodelle und einzelne Releases besitzen andere Zugangsmodelle.

Open Weight, Apache 2.0 und proprietär werden getrennt.

[qwen/myth-apache-all]

568. Mythos: Alle offenen Qwen-Modelle sind Apache 2.0

Qwen3.8-27B ist Apache 2.0, Qwen3.8-Max nutzt eine eigene Lizenz.

Die LICENSE-Datei des konkreten Repositories ist maßgeblich.

[qwen/myth-max-open-history]

569. Mythos: Qwen-Max war schon immer offen

Max war lange proprietäre Cloudklasse.

Qwen3.8 markiert erstmals die Öffnung einer Max-Klasse.

[qwen/myth-q4]

570. Mythos: Qwen4 wurde am 26. August 2026 veröffentlicht

Qwen3.8-Flash-Next ist eine Architekturvorschau auf Qwen4.

Der veröffentlichte Modellname bleibt Qwen3.8-Flash-Next.

[qwen/myth-6b]

571. Mythos: Flash-Next ist nur ein 6B-Modell

6B bezeichnet aktivierte Hauptmodellparameter pro Token.

Das Hauptmodell besitzt rund 125B plus zusätzliche 51B N-Gram-Embeddingparameter.

[qwen/myth-a3b]

572. Mythos: Qwen3.6-35B-A3B braucht nur Speicher wie 3B

A3B beschreibt aktive MoE-Parameter.

Die gesamten 35B Gewichte müssen trotzdem gespeichert beziehungsweise verteilt werden.

[qwen/myth-context-memory]

573. Mythos: 1M Kontext ist dauerhaftes Memory

Kontext ist temporäre Eingabe einer Inferenz.

Persistente Projekte, Chats oder Agentenmemory sind getrennte Systeme.

[qwen/myth-context-perfect]

574. Mythos: 1M Kontext ersetzt RAG

Sehr langer Kontext kann relevante Details übersehen und ist teuer.

Retrieval kann gezielter, günstiger und auditierbarer sein.

[qwen/myth-cache-memory]

575. Mythos: Context Cache ist Benutzer-Memory

Cache dient Wiederverwendung identischer Präfixe.

Er ist keine persönliche Erinnerung.

[qwen/myth-thinking-best]

576. Mythos: Thinking ist immer besser

Thinking verbessert schwierige Aufgaben, kostet aber Zeit und Tokens.

Non-Thinking ist für viele Extraktions- und Standardaufgaben sinnvoller.

[qwen/myth-reasoning-proof]

577. Mythos: Lange Reasoningkette beweist Richtigkeit

Modelle können Fehler ausführlich begründen.

Finale Fakten und Toolresultate werden unabhängig geprüft.

[qwen/myth-coder-best]

578. Mythos: Qwen3-Coder ist automatisch das beste Qwen für jede Programmieraufgabe

Neuere Qwen3.8-Modelle können bei Agentic Coding stärker sein.

Der Task und Harness entscheiden.

[qwen/myth-vl-imagegen]

579. Mythos: Qwen-VL generiert Bilder

Qwen-VL versteht Bilder und erzeugt Text.

Bildgenerierung gehört zur Qwen-Image-Linie.

[qwen/myth-image-vl]

580. Mythos: Qwen-Image ist das Vision-Verständnismodell

Qwen-Image erzeugt beziehungsweise bearbeitet Bilder.

Qwen3.x/VL analysieren visuelle Eingaben.

[qwen/myth-omni-tts]

581. Mythos: Omni und TTS sind dasselbe

Omni verarbeitet mehrere Modalitäten end-to-end.

Qwen3-TTS ist eine spezialisierte Sprachsynthesefamilie.

[qwen/myth-voiceclone-free]

582. Mythos: Technisch mögliche Voice Clones dürfen beliebig genutzt werden

Stimmimitation kann Identitäts-, Betrugs- und Persönlichkeitsrechtsrisiken erzeugen.

Einwilligung bleibt notwendig.

[qwen/myth-embedding-chat]

583. Mythos: Embeddingmodelle können normal chatten

Embeddings erzeugen Vektorrepräsentationen.

Reranker erzeugen Relevanzscores; beide sind keine normalen Assistenzchatmodelle.

[qwen/myth-reranker-index]

584. Mythos: Ein Reranker ersetzt einen Vektorindex

Reranking ist zu teuer für Millionen Dokumente.

Embedding erledigt Recall, Reranker präzisiert eine kleinere Kandidatenmenge.

[qwen/myth-openai]

585. Mythos: OpenAI-kompatible API macht Qwen zu OpenAI

Kompatibilität betrifft Request-/Responseformen.

Modell, Provider, Datenpfad und Toolsemantik bleiben Alibaba/Qwen.

[qwen/myth-anthropic]

586. Mythos: Claude Code mit Qwen benutzt Claude

Claude Code kann über Anthropic-kompatible Qwen-Endpunkte ein Qwen-Modell ansprechen.

Client und Foundation-Modell sind getrennt.

[qwen/myth-frankfurt]

587. Mythos: Jeder Frankfurt-Aufruf bleibt automatisch in der EU

Frankfurt kann Global oder EU als Deployment Scope nutzen.

Nur EU-Scope begrenzt Inferenz entsprechend.

[qwen/myth-singapore-eu]

588. Mythos: Singapore International ist EU-konform, weil China ausgeschlossen ist

International schließt Mainland China aus, ist aber nicht EU-only.

Für reine EU-Residenz ist Frankfurt/EU vorgesehen.

[qwen/myth-business-training]

589. Mythos: Alibaba trainiert Model Studio automatisch mit allen Kundendaten

Alibaba erklärt, Kundengeschäftsdaten nicht ohne ausdrückliche Zustimmung zum Modelltraining zu verwenden.

Consumerprodukte und andere Verträge werden getrennt bewertet.

[qwen/myth-local-alibaba]

590. Mythos: Ein lokal geladenes Qwen sendet Prompts automatisch an Alibaba

Die Gewichte selbst brauchen keine Alibaba-Verbindung.

Runtime, Telemetrie oder externe Tools können trotzdem Netzwerkzugriffe verursachen.

[qwen/myth-quant-same]

591. Mythos: Quantisiertes Qwen ist exakt identisch

Quantisierung verändert numerische Repräsentation.

Reasoning, Vision und Tool Use sollten neu getestet werden.

[qwen/myth-gguf-official]

592. Mythos: Jeder GGUF mit Qwen im Namen ist offiziell

Viele GGUFs stammen aus der Community.

Uploader, Basisrevision und Hash werden geprüft.

[qwen/myth-benchmark]

593. Mythos: Ein Herstellerbenchmark entscheidet die Modellwahl

Benchmarksetup, Harness und Prompt beeinflussen Ergebnisse.

Eigene produktive Aufgaben sind der entscheidende Test.

[qwen/myth-more-params]

594. Mythos: Mehr Gesamtparameter bedeuten automatisch mehr Kosten pro Token

MoE aktiviert nur einen Teil der Experten.

Speicher, FLOPs und aktive Parameter müssen getrennt bewertet werden.

[qwen/myth-dense-moe]

595. Mythos: Dense und MoE gleicher Gesamtgröße sind direkt vergleichbar

Bei dense Modellen sind alle Parameter aktiv; MoE aktiviert nur Teilmengen.

Hardware- und Latenzprofile unterscheiden sich stark.

[qwen/myth-next]

596. Mythos: Qwen3-Next ist einfach eine Beta von Qwen3

Next führte neue Architekturkomponenten ein, die später Qwen3.5 prägten.

Es ist ein eigenständiger Forschungs-/Übergangsrelease.

[qwen/myth-agent-model]

597. Mythos: Qwen Code und Qwen-Agent sind Modelle

Beides sind Agenten-/Frameworkschichten.

Sie können unterschiedliche Qwen- oder Drittmodelle nutzen.

[qwen/myth-safety-open]

598. Mythos: Offene Gewichte besitzen dieselben Cloud-Safetyfilter

Self-Hosting kann Servermoderation vollständig umgehen.

Der Betreiber übernimmt eigene Safety.

[qwen/myth-new-best]

599. Mythos: Die neueste Qwen-Version ist immer die beste Wahl

Ältere Modelle können kleiner, stabiler, besser unterstützt oder lizenzseitig einfacher sein.

Modellwahl hängt von Aufgabe, Hardware und Risiko ab.

[qwen/archive-q7]

600. Qwen-7B als Anfang sichern

Der 3. August 2023 ist der zentrale Startpunkt der offenen Qwen-Sprachmodellgeschichte.

Original-Checkpoint, Tech Memo, Lizenz und Chatvariante gehören zusammen.

[qwen/archive-vl1]

601. Qwen-VL 2023

Der frühe Visionrelease dokumentiert Grounding, OCR und Multi-Image-Fähigkeit.

Spätere native Multimodalität darf diesen Stand nicht rückwirkend überschreiben.

[qwen/archive-agent1]

602. Qwen-Agent 2023

Das Agentenframework zeigt, dass Tool Use früh zur Qwen-Strategie gehörte.

Frameworkversion und Modellgeneration werden getrennt archiviert.

[qwen/archive-audio1]

603. Qwen-Audio 2023

Die erste Audio-Language-Generation zeigt den Übergang von Text zu universeller Wahrnehmung.

Audioverständnis und spätere TTS/Omni-Ausgabe werden getrennt gehalten.

[qwen/archive-q15]

604. Qwen1.5

Qwen1.5 ist besonders wegen Transformerintegration, Quantisierung und Größenvielfalt historisch wichtig.

32B und 110B dokumentieren unterschiedliche Scalingpfade.

[qwen/archive-q2]

605. Qwen2

Qwen2 erweitert Mehrsprachigkeit, 128K Kontext und MoE.

57B-A14B ist der frühe große MoE-Hauptcheckpoint.

[qwen/archive-q25]

606. Qwen2.5

Die Modellparty aus General, Coder, Math und VL bildet einen der größten offenen Releaseblöcke der Qwen-Geschichte.

Lizenzen werden pro Größe gesichert.

[qwen/archive-qwq]

607. QwQ

QwQ dokumentiert die getrennte Reasoningphase vor Qwen3 Hybrid Thinking.

Preview und reifer 32B-Stand werden nicht vermischt.

[qwen/archive-omni]

608. Qwen2.5-Omni

Thinker/Talker und End-to-End-Multimodalität sind wichtige Architekturmerkmale.

Omni bleibt getrennt von TTS- und VL-Spezialmodellen.

[qwen/archive-q3]

609. Qwen3

Hybrid Thinking, 119 Sprachen und die breite dense/MoE-Reihe markieren den nächsten Hauptsprung.

Originalrelease und 2507-Revisionen werden separat notiert.

[qwen/archive-coder3]

610. Qwen3-Coder

480B-A35B, 7.5T Tokens, Agent RL und Qwen Code machen den Juli-2025-Release besonders wichtig.

Harness- und Modellversion gehören gemeinsam zum Agentenbenchmark.

[qwen/archive-embed]

611. Qwen3-Embedding/Reranker

Die Retrievalmodelle dokumentieren Qwens Entwicklung vom Generator zum kompletten RAG-Stack.

Embeddingdimension, Instruction und Modellgröße gehören zum Teststand.

[qwen/archive-vl3]

612. Qwen3-VL

Der September-2025-Release verbindet Thinking und visuelle Agenten.

235B-A22B Instruct und Thinking werden getrennt archiviert.

[qwen/archive-next]

613. Qwen3-Next

80B-A3B und Gated DeltaNet sind der direkte Architekturvorläufer von Qwen3.5.

Der Name darf nicht rückwirkend zu Qwen4 umgedeutet werden.

[qwen/archive-image]

614. Qwen-Image

Bildgeneration und Editing besitzen eigene Modellhistorie von 2025 über 2.0 bis 3.0.

Prompts, Modellrevision und Originalinput werden bei Edits gemeinsam aufbewahrt.

[qwen/archive-tts]

615. Qwen3-TTS

Cloud-TTS, Voice Design, Voice Clone und offene 0.6B/1.7B-Checkpoints bilden eine eigene Sprachgenerationslinie.

Referenzaudio bleibt aus Datenschutzgründen getrennt geschützt.

[qwen/archive-q35]

616. Qwen3.5

Native Multimodalität, GDN+MoE und 201 Sprachen machen 3.5 zum Fundament der 2026er Serie.

397B-A17B und kleinere Größen werden separat identifiziert.

[qwen/archive-q36]

617. Qwen3.6

35B-A3B und 27B dokumentieren die Stabilitäts-/Coding-Iteration.

Qwen3.6-Max-Preview bleibt ausdrücklich proprietärer Previewstand.

[qwen/archive-q37]

618. Qwen3.7

Plus, Max und Flash bilden eine Cloudgeneration mit datierten Snapshots.

Mainline-Aliase und Snapshotnamen werden gemeinsam dokumentiert.

[qwen/archive-q38max]

619. Qwen3.8-Max

Der 2. August 2026 markiert die neue Spitzenklasse; offene 2.4T-A95B-Gewichte folgen am 12. August.

Die spezielle Qwen3.8-Max-Lizenz gehört zwingend zum Archivpaket.

[qwen/archive-q3827]

620. Qwen3.8-27B

Der 14. August 2026 liefert eine wesentlich leichter selbsthostbare Apache-2.0-Alternative.

Multimodalität und Generation Config werden mitgesichert.

[qwen/archive-flashnext]

621. Qwen3.8-Flash-Next

Der 26. August 2026 ist am Stichtag der jüngste große offene Architekturrelease.

QSA, Gated Residual, N-Gram Embedding, Muon und Qwen4-Vorschau sind Kernmerkmale.

[qwen/archive-q4-boundary]

622. Qwen4-Grenze

Am 1. September 2026 existiert Qwen4 als angekündigte Architekturfolge, nicht als vollständige veröffentlichte Familie.

Dieser Grenzstand verhindert spätere rückwirkende Datierungsfehler.

[qwen/archive-cloud]

623. Model Studio

Cloudmodellnamen, Regionen, Scopes und Preise verändern sich schnell.

Datierte Dokumentationssnapshots sind für eine Webarchivseite wichtiger als nur Produktmarketing.

[qwen/archive-eu]

624. Frankfurt/EU

Die 2026 dokumentierte EU-restricted Inferenz ist ein wichtiger regionaler Infrastrukturstand.

Workspace-, Region- und Scope-Konfiguration werden gemeinsam festgehalten.

[qwen/archive-code]

625. Qwen Code

Terminalagent, Authentifizierungsmodell, Subagenten und Toolset entwickeln sich unabhängig vom Foundation-Modell.

CLI-Version und Modellprovider werden daher separat dokumentiert.

[qwen/archive-agentworld]

626. Qwen-AgentWorld

Language World Models markieren den Schritt, Agentenumgebungen selbst modellieren zu lassen.

Paper, Checkpoint und AgentWorldBench gehören zusammen.

[qwen/archive-robot]

627. Qwen-VLA / Robot

Embodied-AI-Modelle zeigen den Übergang von Bildschirmagenten zu physischer Aktion.

Hardware, Robotertyp und Safety Controller werden mit dem Modellstand archiviert.

[qwen/compare-deepseek]

628. Vergleich mit DeepSeek

Die DeepSeek-Chronik zeigt eine ähnlich starke Open-Weight- und Effizienzlinie mit MoE, MLA, R1 und V4.

Qwen ist breiter multimodal diversifiziert und besitzt deutlich mehr Modellgrößen und Spezialfamilien.

[qwen/compare-meta]

629. Vergleich mit Llama/Muse

Die Meta-AI-/Llama-/Muse-Chronik verbindet Open Weights mit einem großen Social-Ökosystem.

Qwen verbindet Open Weights stattdessen eng mit Alibaba Cloud, Coding, Multimodalität und Robotik.

[qwen/compare-chatgpt]

630. Vergleich mit ChatGPT

Die ChatGPT-Chronik ist stärker produkt- und cloudzentriert.

Qwen bietet wesentlich mehr vollständig herunterladbare Modellgrößen.

[qwen/compare-claude]

631. Vergleich mit Claude

Die Claude-Chronik fokussiert wenige proprietäre Spitzenmodelle und professionelle Agentenwerkzeuge.

Qwen deckt parallel kleine lokale Modelle bis 2.4T-MoE ab.

[qwen/compare-gemini]

632. Vergleich mit Gemini

Die Gemini-Chronik zeigt ebenfalls ein extrem breites Multimodal-, Search- und Agentenökosystem.

Qwens besonderer Unterschied ist die umfangreiche Open-Weight-Reihe über fast alle Größenklassen.

[qwen/compare-perplexity]

633. Vergleich mit Perplexity

Die Perplexity-Chronik ist Search-/Orchestrierungszentriert und kann verschiedene Foundationmodelle einbinden.

Qwen ist selbst ein Foundation-Modell- und Cloudprovider.

[qwen/compare-grok]

634. Vergleich mit Grok

Die Grok-Chronik ist enger mit X und Echtzeit-Social-Kontext verbunden.

Qwen setzt stärker auf offene Modellverteilung und Alibaba-Cloud-Infrastruktur.

[qwen/compare-copilot]

635. Vergleich mit Copilot

Die Microsoft-Copilot-Chronik integriert KI tief in Windows und Microsoft 365.

QwenWork und Qwen Code verfolgen ähnliche Agentenarbeitsziele, aber mit einer großen offenen Modellbasis.

[qwen/compare-tools]

636. Zur KI-Werkzeugübersicht

Die Seite KI-Werkzeuge bleibt der übergreifende Vergleich von Methoden, Stärken und Risiken.

Diese Chronik vertieft ausschließlich Alibaba Qwen.

[qwen/future]

637. Wohin Qwen zeigt

Qwen3.8-Flash-Next kündigt Qwen4 als nächste Architekturphase an: noch effizientere Long-Context-Attention, skalierbare Pattern-Memory und agentische Multimodalität.

Parallel wächst die Familie in Robotik, Retrieval, Sprache, Bild und Cowork weiter.

[qwen/fazit]

638. Fazit: Qwen ist 2026 eines der breitesten offenen KI-Ökosysteme

Zwischen Qwen-7B im August 2023 und Qwen3.8-Flash-Next im August 2026 liegen nur drei Jahre, aber mehrere vollständige Architektur- und Produktgenerationen.

Die besondere Stärke ist die Kombination aus Open Weights, sehr vielen Größen, nativer Multimodalität, Cloudbereitstellung, Coding-Agenten und spezialisierter Forschung.

[qwen/weiterlesen]

Weiterführende interne Themen

Die übergreifende Methoden- und Sicherheitsseite bleibt KI-Werkzeuge. Die parallelen großen Chroniken dokumentieren OpenAI ChatGPT, Anthropic Claude, Google Gemini, xAI / SpaceXAI Grok, Meta AI / Llama / Muse, Perplexity AI, DeepSeek und Microsoft Copilot.

↑