Google: Gemini 3.6 Flash und Gemini 3.5 Flash-Lite erreichen allgemeine Verfügbarkeit mit 17 % weniger Token und neuem Cyber-Modell
Google hat Gemini 3.6 Flash und Gemini 3.5 Flash-Lite für allgemein verfügbar erklärt. Gemini 3.6 Flash verbraucht 17 % weniger Output-Token als der Vorgänger zum Preis von 1,50/7,50 US-Dollar pro Million Token, während Flash-Lite mit 350 Token pro Sekunde für 0,30/2,50 US-Dollar läuft. Zudem wurde das spezialisierte Modell Gemini 3.5 Flash Cyber für Behörden und Partner eingeführt.
Dieser Artikel wurde mithilfe von künstlicher Intelligenz aus Primärquellen erstellt.
Was ist Gemini 3.6 Flash und wie unterscheidet es sich vom Vorgänger?
Gemini 3.6 Flash ist Googles schnelles, günstigeres Modell aus der Gemini-Familie — die Flash-Stufe ist für Aufgaben gedacht, die geringere Latenz und niedrigere Kosten als die „Pro”-Modelle benötigen, bei nur geringem Qualitätsverlust. Google hat das Modell für General Availability (allgemein verfügbar) erklärt, das heißt, es hat die Beta-Phase verlassen und steht allen Entwicklern für den produktiven Einsatz über die API zur Verfügung. Der Preis liegt bei 1,50 US-Dollar pro Million Input-Token und 7,50 US-Dollar pro Million Output-Token. Die zentrale Änderung gegenüber Gemini 3.5 Flash ist die Effizienz: Das neue Modell verbraucht bei vergleichbaren Aufgaben 17 % weniger Output-Token, was die Kosten pro Anfrage direkt senkt. Für Unternehmen, die produktive KI-Produkte entwickeln, bedeutet der Status General Availability auch vertragliche Garantien zur API-Stabilität — keine plötzlichen Änderungen im Modellverhalten, wie sie in der Preview-Phase möglich sind.
Benchmarks: große Sprünge bei DeepSWE, MLE-Bench und OSWorld
Im DeepSWE-Benchmark, der die Fähigkeit misst, Softwareaufgaben selbstständig zu lösen, erzielt Gemini 3.6 Flash 49 % gegenüber 37 % bei Gemini 3.5 Flash. Bei MLE-Bench, einem Benchmark für Machine-Learning-Aufgaben, steigt das Ergebnis von 49,7 % auf 63,9 %. Bei OSWorld-Verified, einem Test zur Steuerung von Computeroberflächen, erzielt das Modell 83,0 % gegenüber zuvor 78,4 %. Alle drei Sprünge zeigen eine durchgängige Verbesserung der agentischen Fähigkeiten — nicht nur der Antwortgeschwindigkeit, sondern auch der Genauigkeit bei mehrstufigen Aufgaben wie Codeschreiben und Oberflächensteuerung. Zusammen decken DeepSWE, MLE-Bench und OSWorld-Verified drei unterschiedliche agentische Aufgaben ab — Codeschreiben, Machine-Learning-Engineering und die Navigation grafischer Computeroberflächen —, sodass die durchgängige Verbesserung auf allen drei Benchmarks darauf hindeutet, dass sie nicht eng auf einen Aufgabentyp spezialisiert ist, sondern aus einem allgemein besseren Reasoning des Modells resultiert.
Gemini 3.5 Flash-Lite: die günstigste Stufe mit großem Sprung bei Terminal-Bench
Neben dem größeren Flash-Modell erreicht auch Gemini 3.5 Flash-Lite, die günstigste und schnellste Stufe der Gemini-Familie, allgemeine Verfügbarkeit: 0,30 US-Dollar pro Million Input-Token, 2,50 US-Dollar pro Million Output-Token, bei einer Geschwindigkeit von 350 Token pro Sekunde. Bei Terminal-Bench 2.1, einem Test zur Ausführung von Terminalbefehlen, erzielt Flash-Lite 54 % gegenüber 31 % beim Vorgänger — eine nahezu doppelte Verbesserung. Bei SWE-Bench Pro steigt das Ergebnis von 49,6 % auf 54,2 %. Für Entwickler, die zwischen den beiden Stufen wählen, ist der Kompromiss klar: Flash-Lite opfert einen Teil der rohen Leistungsfähigkeit für niedrigere Kosten und schnellere Generierung, während das vollwertige Gemini 3.6 Flash höhere Präzision bei höheren Kosten pro Token beibehält.
Cyber-Modell nur für Behörden und das angekündigte Gemini 3.5 Pro
Innerhalb des Tools CodeMender hat Google zudem Gemini 3.5 Flash Cyber angekündigt, ein spezialisiertes Modell zur automatischen Behebung von Sicherheitslücken im Code, das bald über ein Pilotprogramm mit eingeschränktem Zugang für Behörden und Partnerorganisationen verfügbar sein wird, nicht jedoch für die breitere Entwicklergemeinschaft. Gleichzeitig hat Google Gemini 3.5 Pro angekündigt, das sich derzeit in der Partner-Testphase vor einem breiteren Launch befindet. Damit erhält die Gemini-Familie an einem Tag zwei General-Availability-Ankündigungen (3.6 Flash und 3.5 Flash-Lite), ein angekündigtes Cybersecurity-Modell und ein Pro-Modell in Vorbereitung — ein Schritt, der die Bandbreite von der günstigsten bis zur spezialisierten Hochsicherheitsstufe abdeckt.
Häufig gestellte Fragen
- Was bedeutet General Availability (allgemeine Verfügbarkeit) bei Gemini-Modellen?
- General Availability bedeutet, dass das Modell die Beta-/Preview-Phase verlassen hat und allen Entwicklern über die Google-API für den produktiven Einsatz zur Verfügung steht, ohne Zugriffsbeschränkungen.
- Um wie viel ist Gemini 3.6 Flash schneller und günstiger als der Vorgänger?
- Gemini 3.6 Flash verbraucht 17 % weniger Output-Token als Gemini 3.5 Flash zum Preis von 1,50 US-Dollar pro Million Input- und 7,50 US-Dollar pro Million Output-Token und erzielt im DeepSWE-Benchmark 49 % gegenüber 37 % beim Vorgänger.
- Was ist Gemini 3.5 Flash Cyber?
- Gemini 3.5 Flash Cyber ist ein spezialisiertes Modell innerhalb des Tools CodeMender zur automatischen Behebung von Sicherheitslücken im Code, das in Kürze über ein Pilotprogramm mit eingeschränktem Zugang für Behörden und Partner verfügbar sein wird.
📬 KI-News in dein Postfach
Ein täglicher Digest nach deinen Regeln — Themen, Quellen und Rhythmus wählbar. Abmeldung mit einem Klick.
Verwandte Nachrichten
arXiv:2607.18100: SOPHIA-Activation-Steering befreit Sprachmodelle aus sich selbst wiederholenden Reasoning-Schleifen
arXiv:2607.15686: S1-Omni vereint Wissenschaft in einem multimodalen Modell und übertrifft GPT-5.5 und Gemini
xAI: Grok 4.5 auf der API verfügbar mit einstellbaren Reasoning-Effort-Stufen und Preisen ab 2 Dollar pro Token