Ana içeriğe geç

Token Kotaları ve Hız Sınırlaması

Kapsam Hiyerarşisi

Bir istek aynı anda birden fazla katmanda değerlendirilir; etkin sınır, tanımlı tüm katmanların en düşüğüdür.

KatmanKapsam
Kimlik BilgisiTek bir LLM sağlayıcı bağlantısı
KuruluşBağlı kimlik bilgilerini kapsayan üst kuruluş
UygulamaBir kimlik bilgisinin belirli bir API Proxy üzerinden kullanımı
ProjeProjedeki tüm AI istekleri (çok-kiracılı ortamda kiracı sınırı)

Örnek:

KatmanAylık USD Bütçe
Kimlik bilgisi (OpenAI bağlantısı)$500
Kuruluş$5.000
Uygulama$1.000
Proje$2.000

Etkin bütçe = Min($500, $5.000, $1.000, $2.000) = $500

Bir katman için sınır tanımlanmamışsa o katman değerlendirmeye katılmaz; sadece tanımlı katmanların en düşüğü uygulanır.

Pencere Türleri

Zaman Tabanlı Token Kovaları

  • Dakika başına, saat başına, gün başına, ay başına — her biri bağımsız olarak yapılandırılabilir
  • Pencere, kayan bir sürü (bucket) algoritmasıyla uygulanır; istekler tam olarak kabul veya reddedilir, kısmi kabul yoktur

USD Bütçesi

  • Saatlik / günlük / aylık üst harcama limiti
  • Bütçe, sistem tarafından tanımlı model birim fiyatlarına göre hesaplanır
  • Aylık bütçe her ay başında sıfırlanır; önceki ayın kullanımından devreden kota yoktur

Model Bazlı Sınırlar

Kimlik bilgisi katmanında, hangi modellerin kullanılabileceğini ve her modele ayrı sınır uygulanmasını sağlayabilirsiniz:

  • İzin verilen model kimlikleri — bağlantıda yalnızca belirtilen modellere izin verilir (örn. sadece gpt-4o, gpt-4-turbo)
  • Hariç tutulan model kimlikleri — belirli modelleri devre dışı bırakır (örn. maliyeti yüksek bir modeli kapatmak için)
  • Model başına saat/gün/ay sınırları ve USD bütçesi — her modele kendi zaman penceresi ve harcama tavanı tanımlanabilir
not

Bir kimlik bilgisi, aynı sağlayıcının birden fazla modelini (örn. OpenAI'nin gpt-4o, gpt-4-turbo, gpt-3.5-turbo modelleri) kullanabilen tek bir bağlantıya karşılık gelir. Model sınırları bu bağlantı içindeki modeller arasında ayrım yapmak için kullanılır.

Kota Aşımı Davranışı

Bir istek herhangi bir katmanda sınırı aşarsa, o katman için tanımlı davranış devreye girer:

DavranışAçıklama
Engelleİstek HTTP 429 (Çok Fazla İstek) ile reddedilir. Sıkı maliyet tavanı için varsayılan seçimdir.
Failover sağlayıcıya yönlendirİstek, yapılandırılmış yedek hedefe otomatik olarak yönlendirilir.
Yalnızca uyarİstek normal şekilde işlenir; aşım yalnızca izleme ve alarm amacıyla kaydedilir (engelleme yapılmaz).
Daha ucuz modele düşAynı sağlayıcı içinde önceden tanımlanmış daha ucuz bir modele otomatik olarak geçilir. Geçilecek model tanımlanmamışsa istek güvenli tarafta kalınarak engellenir.
{
"error": {
"message": "Token quota exceeded",
"type": "quota_exceeded",
"param": "tokens",
"quota_scope": "team",
"remaining_tokens": 0,
"reset_time": "2026-06-17T00:00:00Z"
}
}

Tek İstek Sınırı: Bağlam Penceresi Taşması

Yukarıdaki kota aşımı davranışı bir zaman penceresi veya bütçe toplamının aşılmasını yönetir. Bundan ayrı olarak, bir AI Gateway'ine eklenen Token Rate Limit politikasında tek bir isteğin boyutuna üst sınır tanımlanabilir; bu kontrol, yukarıdaki zaman-pencereli kota kontrolünden önce çalışan ucuz bir ön-kontroldür ve Token Kotaları ekranından bağımsız yönetilir.

Sınırın kaynağı iki şekilde belirlenebilir:

Sınır KaynağıAçıklama
Açık (varsayılan)Politikada elle girilen sabit bir istek başına maksimum token sayısı kullanılır
Model KataloğuSınır, seçili modelin katalogdaki bağlam penceresinden türetilir: bağlam penceresi eksi modelin maksimum çıktı token'ı eksi bir güvenlik payı (512 token). Modelin bağlam penceresi katalogda bilinmiyorsa, bu istek için sınır kontrolü engellemek yerine atlanır.

Sınır aşıldığında iki davranıştan biri uygulanır:

DavranışAçıklama
Engelle (varsayılan)İstek reddedilir
En Eski Mesajları KesKonuşmanın en eski kullanıcı/asistan turları, tahmini token sayısı sınıra sığana kadar sırayla atılır. Sistem mesajları ve konuşmanın son kullanıcı mesajı asla atılmaz; bunlar tek başına sınırı aşıyorsa istek yine engellenir.
not

İstek başına maksimum karakter sınırı bu ikinci davranışı desteklemez — o sınır her zaman isteği engeller, mesaj kesme uygulamaz.

Bir istek kesildiğinde yanıtta X-Apinizer-AI-Truncated header'ı döner (atılan mesaj sayısını taşır) ve durum Raporlar ve Analitik sayfasındaki Guardrail Tetiklenme raporunda görünür hale gelir.

Eşik Alarmları

Her zaman tabanlı veya USD kotası için %50 / %80 / %90 / %100 doluluk eşiklerinde otomatik alarm tetiklenir.

not

Eşik alarmları yalnızca bilgilendirme amaçlıdır — alarm mekanizmasında bir sorun oluşsa bile isteğin işlenmesi bundan etkilenmez.

Rezervasyon ve Uzlaştırma

İstek başladığında, tahmini token sayısı üzerinden geçici bir ön-rezervasyon yapılır; bu, aynı anda gelen çok sayıda isteğin kota sınırını aşmasını önler. Yanıt akışı tamamlandığında gerçek token kullanımı ile uzlaştırma yapılır: fark iade edilir ya da ek olarak düşülür. Rezervasyon süresi dolmadan yanıt tamamlanmazsa rezerve edilen miktar otomatik olarak serbest bırakılır.

Kota Oluşturma ve Yönetme

Yönetim Konsoluna Gidin

AI GatewayToken Kotaları sayfasına gidin.

Kota Ekle'ye Tıklayın

Yeni Kota düğmesine tıklayın ve pencere türünü seçin (zaman tabanlı veya USD bütçe).

Katmanı Seçin

Kotanın uygulanacağı katmanı seçin: Kimlik Bilgisi, Kuruluş, Uygulama veya Proje.

Limitleri Ayarlayın

Zaman tabanlı kotalar için dakika/saat/gün/ay sınırlarını, USD bütçesi için saatlik/günlük/aylık üst harcamayı girin.

Aşım Davranışını Seçin

Sınır aşıldığında uygulanacak davranışı seçin: Engelle, Failover, Yalnızca uyar veya Daha ucuz modele düş.

Model Sınırlamaları (İsteğe Bağlı)

Kimlik bilgisi kapsamında, hangi modellere izin verileceğini veya hangilerinin hariç tutulacağını belirleyin.

Kaydet ve Etkinleştir

Kotayı Kaydet'e tıklayın. Yeni istekler bu kota altında değerlendirilir; devam etmekte olan istekler etkilenmez.

Token Kotaları — Overflow Policies, token limitleri ve aylık bütçe

Kota İstatistikleri ve İzleme

Analitik sayfasının Kullanım Raporları tab'ının Kota Kullanımı bölümünde:

  • Her katman için kullanılan ve kalan token miktarı
  • Aylık bütçe kullanımı (örn. $2.500 / $5.000)
  • Kota sınırına ulaşan ve reddedilen istek sayıları

Raporlar kişi, ekip, model ve sağlayıcı başına ayrıştırılabilir.

En İyi Uygulamalar

ipucu
  1. Kademeli kotalar tanımlayın: Düşük sayılarla başlayın (test amaçlı) ve ihtiyaca göre artırın
  2. Model başına sınırlar kullanın: Pahalı modelleri daha kısıtlayın, ucuz modelleri daha serbest bırakın
  3. Katmanları birlikte kullanın: Kişi/uygulama düzeyinde bütçe kontrolü için kimlik bilgisi katmanını, kuruluş çapında dengeleme için kuruluş katmanını kullanın
  4. Eşik alarmlarını izleyin: %80 ve %90 eşiklerini erken uyarı sinyali olarak takip edin

Sorun Giderme

Kota Sınırı Beklenmedik Şekilde Aşıldı

  • Katman hiyerarşisini kontrol edin — daha düşük bir katmanda kısıtlama olabilir
  • Model başına sınırları kontrol edin — kota modele özgü olabilir

Kota Değişikliği Etkili Olmuyor

  • Kaydettikten sonra yalnızca yeni istekler yeni kotayı kullanır; devam eden istekler etkilenmez
  • Katman ve model kimliğinin doğru girildiğini doğrulayın

Token kotaları APIops REST API ile de görüntülenip güncellenebilir; bkz. API Referansı: AI Budgets.

Sonraki Adımlar