// WAS ES BEDEUTET
Du hast die Anfragegrenze pro Minute überschritten — 60 Anfragen pro Minute im Gratis-Tarif. Es ist ein Burst-Limit, getrennt vom 5-Stunden-Fenster und der Wochenobergrenze. Der Agent-Modus ist die übliche Ursache: Ein Prompt fächert sich innerhalb von Sekunden in viele Modellanfragen auf.
Siehst du „Switching to fallback model", ist die CLI automatisch auf ein günstigeres Modell ausgewichen, um weiterzumachen; deine Ergebnisse für diese Züge kamen vom Fallback.
// WANN ES ZURÜCKGESETZT WIRD
Innerhalb einer Minute. Die Grenze ist ein gleitendes Ein-Minuten-Fenster, einfaches Warten oder Verlangsamen der Aufgabe löst sie. Sie hat keine Reset-Zeit im Sinne des Kontingents.
Auf Googles Seite gibt es nichts abzuwarten — das ist kein Ausfall und kein Zustand für alle.
// WAS JETZT TUN
- 01 60 Sekunden warten und erneut versuchen. Wiederholt es sich, die Aufgabe so aufteilen, dass weniger Tools pro Zug feuern.
- 02 Nicht mehrere Gemini-CLI-Sessions parallel auf demselben Konto laufen lassen — sie teilen die Minutengrenze.
- 03 Bezahlte Stufen Google AI Pro / Ultra haben höhere Minutengrenzen; den Wert deines Kontos zeigt die Quotas-Seite in der Google Cloud Console.
- 04 Wurdest du still auf ein Fallback-Modell umgestellt, die wichtigen Züge wiederholen, sobald die Grenze frei ist.
// BETRIFFT ES MEIN WOCHENKONTINGENT?
Nein. Abgelehnte Anfragen werden nicht gezählt, ein Burst-Limit kostet dich also nichts vom 5-Stunden-Fenster oder der Wochenobergrenze. Lautet die Meldung stattdessen „Quota exceeded", ist das das Kontingent — siehe jene Seite.
// ERSCHEINT AUCH ALS
- “Rate limiting detected. Switching to fallback model”
- “429 Too Many Requests”
- “Attempt 1 failed with status 429”