Token Kotaları ve Hız Sınırlaması
Kapsam Hiyerarşisi
Bir istek aynı anda birden fazla katmanda değerlendirilir; etkin sınır, tanımlı tüm katmanların en düşüğüdür.
| Katman | Kapsam |
|---|---|
| Kimlik Bilgisi | Tek bir LLM sağlayıcı bağlantısı |
| Kuruluş | Bağlı kimlik bilgilerini kapsayan üst kuruluş |
| Uygulama | Bir kimlik bilgisinin belirli bir API Proxy üzerinden kullanımı |
| Proje | Projedeki tüm AI istekleri (çok-kiracılı ortamda kiracı sınırı) |
Örnek:
| Katman | Aylık USD Bütçe |
|---|---|
| Kimlik bilgisi (OpenAI bağlantısı) | $500 |
| Kuruluş | $5.000 |
| Uygulama | $1.000 |
| Proje | $2.000 |
Etkin bütçe = Min($500, $5.000, $1.000, $2.000) = $500
Bir katman için sınır tanımlanmamışsa o katman değerlendirmeye katılmaz; sadece tanımlı katmanların en düşüğü uygulanır.
Pencere Türleri
Zaman Tabanlı Token Kovaları
- Dakika başına, saat başına, gün başına, ay başına — her biri bağımsız olarak yapılandırılabilir
- Pencere, kayan bir sürü (bucket) algoritmasıyla uygulanır; istekler tam olarak kabul veya reddedilir, kısmi kabul yoktur
USD Bütçesi
- Saatlik / günlük / aylık üst harcama limiti
- Bütçe, sistem tarafından tanımlı model birim fiyatlarına göre hesaplanır
- Aylık bütçe her ay başında sıfırlanır; önceki ayın kullanımından devreden kota yoktur
Model Bazlı Sınırlar
Kimlik bilgisi katmanında, hangi modellerin kullanılabileceğini ve her modele ayrı sınır uygulanmasını sağlayabilirsiniz:
- İzin verilen model kimlikleri — bağlantıda yalnızca belirtilen modellere izin verilir (örn. sadece
gpt-4o,gpt-4-turbo) - Hariç tutulan model kimlikleri — belirli modelleri devre dışı bırakır (örn. maliyeti yüksek bir modeli kapatmak için)
- Model başına saat/gün/ay sınırları ve USD bütçesi — her modele kendi zaman penceresi ve harcama tavanı tanımlanabilir
Bir kimlik bilgisi, aynı sağlayıcının birden fazla modelini (örn. OpenAI'nin gpt-4o, gpt-4-turbo, gpt-3.5-turbo modelleri) kullanabilen tek bir bağlantıya karşılık gelir. Model sınırları bu bağlantı içindeki modeller arasında ayrım yapmak için kullanılır.
Kota Aşımı Davranışı
Bir istek herhangi bir katmanda sınırı aşarsa, o katman için tanımlı davranış devreye girer:
| Davranış | Açıklama |
|---|---|
| Engelle | İstek HTTP 429 (Çok Fazla İstek) ile reddedilir. Sıkı maliyet tavanı için varsayılan seçimdir. |
| Failover sağlayıcıya yönlendir | İstek, yapılandırılmış yedek hedefe otomatik olarak yönlendirilir. |
| Yalnızca uyar | İstek normal şekilde işlenir; aşım yalnızca izleme ve alarm amacıyla kaydedilir (engelleme yapılmaz). |
| Daha ucuz modele düş | Aynı sağlayıcı içinde önceden tanımlanmış daha ucuz bir modele otomatik olarak geçilir. Geçilecek model tanımlanmamışsa istek güvenli tarafta kalınarak engellenir. |
{
"error": {
"message": "Token quota exceeded",
"type": "quota_exceeded",
"param": "tokens",
"quota_scope": "team",
"remaining_tokens": 0,
"reset_time": "2026-06-17T00:00:00Z"
}
}
Tek İstek Sınırı: Bağlam Penceresi Taşması
Yukarıdaki kota aşımı davranışı bir zaman penceresi veya bütçe toplamının aşılmasını yönetir. Bundan ayrı olarak, bir AI Gateway'ine eklenen Token Rate Limit politikasında tek bir isteğin boyutuna üst sınır tanımlanabilir; bu kontrol, yukarıdaki zaman-pencereli kota kontrolünden önce çalışan ucuz bir ön-kontroldür ve Token Kotaları ekranından bağımsız yönetilir.
Sınırın kaynağı iki şekilde belirlenebilir:
| Sınır Kaynağı | Açıklama |
|---|---|
| Açık (varsayılan) | Politikada elle girilen sabit bir istek başına maksimum token sayısı kullanılır |
| Model Kataloğu | Sınır, seçili modelin katalogdaki bağlam penceresinden türetilir: bağlam penceresi eksi modelin maksimum çıktı token'ı eksi bir güvenlik payı (512 token). Modelin bağlam penceresi katalogda bilinmiyorsa, bu istek için sınır kontrolü engellemek yerine atlanır. |
Sınır aşıldığında iki davranıştan biri uygulanır:
| Davranış | Açıklama |
|---|---|
| Engelle (varsayılan) | İstek reddedilir |
| En Eski Mesajları Kes | Konuşmanın en eski kullanıcı/asistan turları, tahmini token sayısı sınıra sığana kadar sırayla atılır. Sistem mesajları ve konuşmanın son kullanıcı mesajı asla atılmaz; bunlar tek başına sınırı aşıyorsa istek yine engellenir. |
İstek başına maksimum karakter sınırı bu ikinci davranışı desteklemez — o sınır her zaman isteği engeller, mesaj kesme uygulamaz.
Bir istek kesildiğinde yanıtta X-Apinizer-AI-Truncated header'ı döner (atılan mesaj sayısını taşır) ve durum Raporlar ve Analitik sayfasındaki Guardrail Tetiklenme raporunda görünür hale gelir.
Eşik Alarmları
Her zaman tabanlı veya USD kotası için %50 / %80 / %90 / %100 doluluk eşiklerinde otomatik alarm tetiklenir.
Eşik alarmları yalnızca bilgilendirme amaçlıdır — alarm mekanizmasında bir sorun oluşsa bile isteğin işlenmesi bundan etkilenmez.
Rezervasyon ve Uzlaştırma
İstek başladığında, tahmini token sayısı üzerinden geçici bir ön-rezervasyon yapılır; bu, aynı anda gelen çok sayıda isteğin kota sınırını aşmasını önler. Yanıt akışı tamamlandığında gerçek token kullanımı ile uzlaştırma yapılır: fark iade edilir ya da ek olarak düşülür. Rezervasyon süresi dolmadan yanıt tamamlanmazsa rezerve edilen miktar otomatik olarak serbest bırakılır.
Kota Oluşturma ve Yönetme
AI Gateway → Token Kotaları sayfasına gidin.
Yeni Kota düğmesine tıklayın ve pencere türünü seçin (zaman tabanlı veya USD bütçe).
Kotanın uygulanacağı katmanı seçin: Kimlik Bilgisi, Kuruluş, Uygulama veya Proje.
Zaman tabanlı kotalar için dakika/saat/gün/ay sınırlarını, USD bütçesi için saatlik/günlük/aylık üst harcamayı girin.
Sınır aşıldığında uygulanacak davranışı seçin: Engelle, Failover, Yalnızca uyar veya Daha ucuz modele düş.
Kimlik bilgisi kapsamında, hangi modellere izin verileceğini veya hangilerinin hariç tutulacağını belirleyin.
Kotayı Kaydet'e tıklayın. Yeni istekler bu kota altında değerlendirilir; devam etmekte olan istekler etkilenmez.
Kota İstatistikleri ve İzleme
Analitik sayfasının Kullanım Raporları tab'ının Kota Kullanımı bölümünde:
- Her katman için kullanılan ve kalan token miktarı
- Aylık bütçe kullanımı (örn. $2.500 / $5.000)
- Kota sınırına ulaşan ve reddedilen istek sayıları
Raporlar kişi, ekip, model ve sağlayıcı başına ayrıştırılabilir.
En İyi Uygulamalar
- Kademeli kotalar tanımlayın: Düşük sayılarla başlayın (test amaçlı) ve ihtiyaca göre artırın
- Model başına sınırlar kullanın: Pahalı modelleri daha kısıtlayın, ucuz modelleri daha serbest bırakın
- Katmanları birlikte kullanın: Kişi/uygulama düzeyinde bütçe kontrolü için kimlik bilgisi katmanını, kuruluş çapında dengeleme için kuruluş katmanını kullanın
- Eşik alarmlarını izleyin: %80 ve %90 eşiklerini erken uyarı sinyali olarak takip edin
Sorun Giderme
Kota Sınırı Beklenmedik Şekilde Aşıldı
- Katman hiyerarşisini kontrol edin — daha düşük bir katmanda kısıtlama olabilir
- Model başına sınırları kontrol edin — kota modele özgü olabilir
Kota Değişikliği Etkili Olmuyor
- Kaydettikten sonra yalnızca yeni istekler yeni kotayı kullanır; devam eden istekler etkilenmez
- Katman ve model kimliğinin doğru girildiğini doğrulayın
Token kotaları APIops REST API ile de görüntülenip güncellenebilir; bkz. API Referansı: AI Budgets.