AI Gateway nedir sorusu, bir uygulamanın birden fazla büyük dil modeli ve yapay zekâ sağlayıcısıyla çalışmaya başlamasıyla önem kazanır.
İlk prototip aşamasında uygulama doğrudan tek bir model API’sine bağlanabilir. Ancak sistem büyüdükçe farklı ekipler farklı sağlayıcıları kullanmaya, API anahtarlarını ayrı ayrı saklamaya ve her model için farklı loglama yöntemleri geliştirmeye başlayabilir.
Bir müşteri destek uygulaması metin üretimi için bir model, görsel analizi için başka bir model, düşük maliyetli sınıflandırma işleri için ise daha küçük bir açık kaynak modeli kullanabilir. Bir sağlayıcıda kesinti yaşandığında trafiğin başka sağlayıcıya yönlendirilmesi de gerekebilir.
Bu yapı kontrol edilmezse uygulamalarda dağınık API anahtarları, görünmeyen token harcamaları, tutarsız güvenlik politikaları, farklı hata formatları ve sağlayıcı bağımlılığı ortaya çıkabilir.
AI Gateway veya LLM Gateway, yapay zekâ uygulamalarıyla model sağlayıcıları arasında çalışan merkezi trafik ve politika katmanıdır.
Uygulama bütün model sağlayıcılarına ayrı ayrı bağlanmak yerine AI Gateway’e istek gönderir. Gateway; kimlik doğrulama, model seçimi, yönlendirme, hız sınırı, maliyet kontrolü, güvenlik denetimi, loglama ve alternatif sağlayıcıya geçiş gibi işlemleri merkezi olarak uygular.
AI Gateway temel modelin kendisi değildir. Kullanıcının promptunu anlayıp cevap üreten katman modeldir. Gateway ise bu isteğin hangi modele, hangi yetkiyle, hangi bütçeyle ve hangi güvenlik kontrollerinden geçirilerek gönderileceğini yönetir.
Bu rehberde AI Gateway mimarisini, klasik API Gateway’den farkını, model yönlendirme yöntemlerini, token bütçelerini, önbellekleme risklerini, LLM gözlemlenebilirliğini, prompt güvenliğini ve üretim ortamına geçiş adımlarını inceleyeceğiz.
Önemli: AI Gateway bütün güvenlik ve kalite sorunlarını otomatik olarak çözmez. Modelin ürettiği bilginin doğruluğu, RAG belgelerinin yetkilendirilmesi, ajan araçlarının güvenliği ve kullanıcıya gösterilen nihai çıktının doğrulanması ayrıca yönetilmelidir.
İçindekiler
- AI Gateway Nedir?
- AI Gateway Neden Gereklidir?
- AI Gateway Nasıl Çalışır?
- AI Gateway Mimarisinin Bileşenleri
- AI Gateway ile API Gateway Arasındaki Fark
- Reverse Proxy ile Farkı
- Model Soyutlama Katmanı
- Model Routing Nedir?
- Model Yönlendirme Yöntemleri
- Fallback ve Sağlayıcı Geçişi
- Retry Politikaları
- LLM Load Balancing
- Rate Limiting
- Token ve Harcama Bütçeleri
- Yapay Zekâ Maliyet Yönetimi
- LLM Caching Nedir?
- Semantic Cache
- LLM Observability
- İzlenmesi Gereken Metrikler
- OpenTelemetry Entegrasyonu
- Prompt ve Cevap Loglama
- AI Gateway Güvenliği
- API Anahtarı Yönetimi
- DLP ve Hassas Veri Kontrolü
- Guardrails ve İçerik Güvenliği
- Prompt Injection Koruması
- Model Çıktısı Doğrulama
- Çok Kiracılı Sistemlerde İzolasyon
- RAG Sistemlerinde AI Gateway
- Yapay Zekâ Ajanlarında AI Gateway
- MCP Gateway ile İlişkisi
- Dağıtım Modelleri
- Yönetilen ve Self-Hosted Karşılaştırması
- Örnek İstek Akışı
- Örnek Yönlendirme Politikası
- Örnek Kurumsal Senaryo
- Kurulum Yol Haritası
- AI Gateway Seçim Kriterleri
- AI Gateway Sınırlamaları
- AI Gateway Kontrol Listesi
- Sık Yapılan Hatalar
- Sık Sorulan Sorular
AI Gateway Nedir?
AI Gateway, uygulamalardan gelen üretken yapay zekâ isteklerini karşılayan ve uygun model ya da sağlayıcıya ileten merkezi kontrol katmanıdır.
Bir AI Gateway şu görevlerden bir bölümünü gerçekleştirebilir:
- Kullanıcı ve uygulama kimliğini doğrulamak
- Model sağlayıcı API anahtarlarını korumak
- İstek formatlarını ortak bir yapıya dönüştürmek
- İsteği uygun modele yönlendirmek
- Birincil model çalışmazsa alternatif modele geçmek
- Token ve para bütçesi uygulamak
- Kullanıcı veya ekip bazında hız sınırı koymak
- Prompt ve cevaplarda hassas veri aramak
- İçerik güvenliği kurallarını uygulamak
- Token kullanımı, maliyet ve gecikmeyi ölçmek
- İstekleri önbellekten cevaplamak
- Denetim ve güvenlik logları oluşturmak
Basit Tanım
AI Gateway, yapay zekâ uygulamasının bütün model çağrılarını tek bir denetlenebilir ve yönetilebilir giriş noktasından geçiren ara katmandır.
AI Gateway Model midir?
Hayır. Gateway cevap üretmez; isteğin gerçek modele güvenli ve kontrollü biçimde ulaşmasını sağlar.
AI Gateway Zorunlu mudur?
Tek model kullanan küçük bir prototip doğrudan sağlayıcı API’sine bağlanabilir. Model sayısı, ekip sayısı, trafik, maliyet veya güvenlik gereksinimi arttığında merkezi gateway yaklaşımı daha anlamlı hâle gelir.
AI Gateway Neden Gereklidir?
Sağlayıcı Bağımlılığını Azaltmak
Uygulamanın bütün kodu tek sağlayıcının SDK’sına ve cevap yapısına bağlıysa başka modele geçmek zorlaşabilir.
Gateway ortak bir istemci arayüzü sunarak sağlayıcıya özel ayrıntıları uygulama kodundan uzaklaştırabilir.
Dağınık API Anahtarlarını Toplamak
Her uygulamanın model anahtarlarını kendi ortam değişkenlerinde saklaması anahtar sayısını ve sızıntı riskini artırır.
Gateway, sağlayıcı anahtarlarını merkezi gizli bilgi deposunda saklayabilir. Uygulama doğrudan model sağlayıcısının anahtarına sahip olmak zorunda kalmaz.
Görünmeyen Harcamaları Ortaya Çıkarmak
Birden fazla ekip ve uygulama aynı sağlayıcı hesabını kullandığında hangi ürünün ne kadar token tükettiği anlaşılamayabilir.
Gateway her isteğe ekip, proje, kullanıcı ve maliyet merkezi metadata’sı ekleyerek harcamaların ayrıştırılmasını sağlayabilir.
Tek Tip Güvenlik Politikası Uygulamak
Hassas veri temizleme veya içerik kontrolü her uygulama tarafından ayrı ayrı geliştirildiğinde kontroller tutarsızlaşabilir.
Gateway merkezi bir güvenlik politikası uygulayarak temel korumaların bütün model çağrılarında çalışmasını sağlayabilir.
Kesintilere Karşı Dayanıklılık
Birincil sağlayıcı hata verdiğinde veya hız sınırına ulaştığında istekler aynı görevi yapabilen başka sağlayıcıya aktarılabilir.
Model Kullanımını Yönetişim Altına Almak
Hangi ekiplerin hangi modelleri, hangi veri türleriyle ve hangi amaçlarla kullanabileceği merkezi politikalarla sınırlandırılabilir.
AI Gateway Nasıl Çalışır?
Tipik bir AI Gateway isteği şu akıştan geçer:
- Kullanıcı yapay zekâ destekli uygulamada bir işlem başlatır.
- Uygulama isteği doğrudan modele değil AI Gateway’e gönderir.
- Gateway uygulamanın veya kullanıcının kimliğini doğrular.
- İstek boyutu, hız sınırı ve bütçe kontrol edilir.
- Prompt içerisinde hassas veri veya yasaklı içerik aranabilir.
- Yönlendirme motoru uygun model ve sağlayıcıyı seçer.
- İstek sağlayıcının beklediği formata dönüştürülür.
- Model isteği işler ve cevap üretir.
- Gateway cevabı güvenlik ve biçim kurallarından geçirir.
- Token, maliyet, gecikme ve hata metrikleri kaydedilir.
- Uygulamaya standartlaştırılmış cevap gönderilir.
Gateway Veri Yolunda mı Çalışır?
Çoğu mimaride evet. İstek ve model cevabı gateway üzerinden geçtiği için bu katman yüksek güvenlik ve erişilebilirlik gerektirir.
Gateway’in devre dışı kalması bütün yapay zekâ özelliklerinin durmasına neden olabileceğinden yüksek erişilebilirlik ve geri dönüş planı hazırlanmalıdır.
AI Gateway Mimarisinin Temel Bileşenleri
| Bileşen | Görevi |
|---|---|
| Gateway endpoint | Uygulamaların model çağrıları için kullandığı ortak adres |
| Kimlik doğrulama | Uygulama, kullanıcı ve servis kimliğini doğrular |
| Model kataloğu | Kullanılabilen model ve sağlayıcıları kayıt altında tutar |
| Routing engine | İsteğin gönderileceği model ve bölgeyi seçer |
| Provider adapters | Farklı sağlayıcıların istek ve cevap formatlarını dönüştürür |
| Policy engine | Bütçe, erişim, veri ve içerik politikalarını uygular |
| Guardrail katmanı | Prompt ve çıktılarda güvenlik kontrolleri gerçekleştirir |
| Cache | Uygun istekleri model çağrısı yapmadan cevaplayabilir |
| Observability katmanı | Token, maliyet, hata ve gecikme metriklerini toplar |
| Secret manager | Model sağlayıcı anahtarlarını güvenli biçimde saklar |
| Audit log | Politika, yönetim ve erişim değişikliklerini kaydeder |
AI Gateway ile API Gateway Arasındaki Fark
Klasik API Gateway ve AI Gateway benzer şekilde istemciyle arka uç servisleri arasında çalışır. Ancak üretken yapay zekâ trafiği farklı kontrol gereksinimleri oluşturur.
| Özellik | API Gateway | AI Gateway |
|---|---|---|
| Temel hedef | Genel API ve mikroservis trafiği | Model çıkarımı ve yapay zekâ trafiği |
| Trafik ölçümü | İstek ve veri boyutu | Token, model, prompt ve çıkarım maliyeti |
| Yönlendirme | URL, servis ve sürüm | Model yeteneği, fiyatı, gecikmesi ve bağlam boyutu |
| Önbellek | URL ve parametre bazlı | Prompt veya anlamsal benzerlik bazlı olabilir |
| Güvenlik | Kimlik, WAF ve şema kontrolü | PII, prompt injection, içerik ve çıktı kontrolü |
| Observability | Durum kodu ve servis gecikmesi | Token kullanımı, TTFT, model sonucu ve tool call |
| Sağlayıcı geçişi | Benzer servisler arasında | Farklı model sağlayıcıları arasında |
Bir kuruluş mevcut API Gateway’ini genişleterek AI Gateway özellikleri ekleyebilir veya ayrı bir özel LLM Gateway kullanabilir.
Klasik mimarinin ayrıntıları için API Gateway Nedir? rehberini inceleyebilirsiniz.
AI Gateway ile Reverse Proxy Arasındaki Fark
Reverse proxy gelen istekleri arka uç sistemlerine aktarır ve TLS sonlandırma, yük dengeleme veya temel önbellekleme yapabilir.
AI Gateway ise bunlara ek olarak model ve token farkındalığına sahip olabilir:
- Prompt token sayısını hesaplamak
- Model maliyetini tahmin etmek
- İsteği model yeteneğine göre yönlendirmek
- Model sağlayıcı formatlarını dönüştürmek
- Prompt ve çıktılara güvenlik politikası uygulamak
- Tool call ve model yanıtı metadata’sını izlemek
Model Soyutlama Katmanı
Farklı sağlayıcılar model çağrıları için farklı endpoint, kimlik doğrulama, parametre ve cevap yapıları kullanabilir.
Model soyutlama katmanı uygulamaya ortak bir istek ve cevap formatı sunar.
Ortaklaştırılabilecek Alanlar
- Model adı
- Mesajlar
- Sistem talimatı
- Temperature
- Maksimum çıktı tokenı
- Streaming seçeneği
- Tool tanımları
- Yapılandırılmış çıktı şeması
- Kullanım ve maliyet bilgisi
Soyutlama Kaybı
Bütün sağlayıcı özellikleri birbirinin aynısı değildir. Ortak arayüz yalnızca en düşük ortak özellik kümesini desteklerse sağlayıcıya özel gelişmiş özellikler kullanılamayabilir.
Bu nedenle gateway hem ortak arabirim hem de gerektiğinde sağlayıcıya özel parametre geçişi sunmalıdır.
Model Routing Nedir?
Model routing, her yapay zekâ isteği için kullanılacak modelin veya sağlayıcının kurallara göre seçilmesidir.
Bütün istekleri en güçlü ve pahalı modele göndermek maliyeti artırabilir. Bütün işleri küçük modele göndermek ise kaliteyi düşürebilir.
Routing Kararında Kullanılabilecek Bilgiler
- Görevin türü
- İstenen çıktı kalitesi
- Gerekli bağlam penceresi
- Görsel veya ses desteği
- Tool calling gereksinimi
- Kullanıcının planı
- Veri bölgesi
- Model maliyeti
- Mevcut gecikme
- Sağlayıcı hata oranı
- Kalan bütçe
Model Yönlendirme Yöntemleri
Sabit Yönlendirme
Belirli uygulama veya endpoint her zaman aynı modeli kullanır.
Basit ve öngörülebilirdir ancak kesinti ve maliyet değişimlerine karşı esnek değildir.
Öncelik Bazlı Yönlendirme
İlk tercih edilen model kullanılır; kullanılamazsa listedeki sıradaki modele geçilir.
Maliyet Bazlı Yönlendirme
Görevin gereksinimini karşılayan modeller arasından tahmini maliyeti en düşük olan seçilir.
Gecikme Bazlı Yönlendirme
Güncel ölçümlere göre en hızlı cevap veren model veya bölge tercih edilir.
Yetenek Bazlı Yönlendirme
Görsel analiz, ses üretimi, uzun bağlam veya araç kullanımı gibi ihtiyaçlara göre uygun model seçilir.
Kullanıcı Planına Göre Yönlendirme
Ücretsiz kullanıcılar düşük maliyetli modele, kurumsal müşteriler daha güçlü modele yönlendirilebilir.
Coğrafi Yönlendirme
Veri yerleşimi, gecikme ve sözleşme koşullarına göre belirli bölgedeki sağlayıcı ya da dağıtım seçilir.
Semantik Yönlendirme
Gateway isteğin içeriğini sınıflandırarak kodlama, özetleme, müşteri desteği veya çeviri gibi uygun uzman modele gönderebilir.
Fallback ve Sağlayıcı Geçişi
Fallback, birincil model çağrısı başarısız olduğunda isteğin alternatif model veya sağlayıcıya gönderilmesidir.
Fallback’i Tetikleyebilecek Durumlar
- Model sağlayıcısının erişilememesi
- İstek zaman aşımı
- Hız sınırına ulaşılması
- Modelin geçici olarak kapasite dışında olması
- Belirli bölgede hizmet kesintisi
- İstenen özelliğin model tarafından desteklenmemesi
- Kuruluşun harcama limitine yaklaşması
Her Model Birbirinin Yerine Geçer mi?
Hayır. Modellerin sistem talimatlarına uyumu, araç çağrısı formatı, token sınırı ve güvenlik davranışları farklı olabilir.
Fallback modelleri üretime alınmadan önce aynı değerlendirme ve regresyon testlerinden geçirilmelidir.
Cevap Tutarlılığı
Birincil ve yedek model farklı cevap biçimleri üretirse uygulama hata verebilir. Gateway nihai cevabı ortak bir şemaya dönüştürmelidir.
Retry Politikaları
Geçici ağ ve servis hatalarında istek yeniden denenebilir. Ancak model çağrılarını kontrolsüz biçimde tekrar etmek maliyeti artırabilir.
Retry İçin Uygun Durumlar
- Geçici sunucu hatası
- Bağlantı kesilmesi
- Kısa süreli kapasite problemi
- Belirli hız sınırı cevapları
Retry Uygulanmaması Gereken Durumlar
- Geçersiz kimlik bilgisi
- İzin verilmeyen model erişimi
- Desteklenmeyen istek formatı
- Güvenlik politikası ihlali
- Bağlam sınırının aşılması
Exponential Backoff
Yeniden denemeler arasında giderek artan bekleme süresi kullanmak sağlayıcıya aşırı yük bindirmeyi önleyebilir.
Çift İşlem Riski
Model çağrısı bir ajan aracını tetikliyorsa aynı isteğin yeniden çalıştırılması iki e-posta gönderilmesi veya iki kayıt oluşturulması gibi sonuçlar doğurabilir.
Kritik işlemlerde idempotency anahtarları ve işlem durumu kontrolü kullanılmalıdır.
LLM Load Balancing
LLM load balancing, isteklerin aynı görevi gerçekleştirebilen birden fazla model endpoint’i arasında dağıtılmasıdır.
Yöntemler
- Round robin
- Ağırlıklı dağıtım
- En düşük gecikme
- En düşük kullanım
- Öncelik sırası
- Bölge yakınlığı
- Sağlayıcı sağlık durumuna göre dağıtım
Model Kalitesi Dengesi
Klasik yük dengelemede iki sunucunun aynı uygulamayı çalıştırdığı varsayılabilir. LLM ortamında iki modelin cevap kalitesi ve davranışı aynı olmayabilir.
Bu nedenle yük dengeleme yalnızca teknik sağlık durumuna değil, kalite ölçümlerine de dayanmalıdır.
AI Gateway Rate Limiting
Rate limiting, belirli kullanıcı, uygulama veya proje tarafından yapılabilecek çağrı sayısını sınırlar.
Uygulanabilecek Limitler
- Dakika başına istek
- Dakika başına giriş tokenı
- Dakika başına çıkış tokenı
- Eş zamanlı istek sayısı
- Günlük model çağrısı
- Aylık para bütçesi
- Belirli model için kullanım sınırı
Neden Yalnızca İstek Sayısı Yeterli Değildir?
Bir kısa sınıflandırma isteğiyle yüzlerce sayfalık belgeyi özetleyen istek aynı maliyete sahip değildir.
Token ve model fiyatı farkındalığı bulunan limitler daha doğru kontrol sağlar.
Token ve Harcama Bütçeleri
Gateway, kullanıcı ve uygulamalar için token ya da para bütçeleri uygulayabilir.
Bütçe Seviyeleri
- Kuruluş geneli
- Departman
- Proje
- Uygulama
- Müşteri hesabı
- Son kullanıcı
- Model
Soft Limit
Bütçeye yaklaşıldığında uyarı gönderilir fakat istekler çalışmaya devam eder.
Hard Limit
Belirlenen sınır aşıldığında yeni istek engellenir veya daha düşük maliyetli modele yönlendirilir.
Bütçe Aşımında Alternatifler
- Daha ucuz model kullanmak
- Maksimum çıktı tokenını düşürmek
- Promptu sıkıştırmak
- Önbelleği kullanmak
- Düşük öncelikli işleri ertelemek
- Kullanıcıdan yükseltme istemek
AI Gateway ile Maliyet Yönetimi
Yapay zekâ maliyeti yalnızca çağrı sayısından oluşmaz.
Maliyet Bileşenleri
- Giriş tokenları
- Çıkış tokenları
- Önbelleğe yazma veya okuma
- Görsel ve ses işleme
- Embedding işlemleri
- Model sağlayıcı fiyatı
- Gateway ve ağ maliyeti
- Log ve telemetri depolama
Cost Attribution
Her isteğe aşağıdaki metadata alanları eklenebilir:
- Proje kimliği
- Departman
- Müşteri hesabı
- Özellik adı
- Ortam
- Kullanıcı planı
Böylece “toplam yapay zekâ faturası” yerine hangi ürün özelliğinin ne kadar maliyet oluşturduğu görülebilir.
LLM Caching Nedir?
LLM caching, daha önce cevaplanan uygun bir isteğin yeniden modele gönderilmeden önbellekten karşılanmasıdır.
Exact Cache
Prompt, model ve ilgili parametreler tamamen aynıysa önceki cevap kullanılır.
Avantajları
- Model maliyetini azaltabilir.
- Cevap süresini kısaltabilir.
- Sağlayıcı kesintisinin etkisini azaltabilir.
- Aynı sorularda tutarlı cevap sağlayabilir.
Cache Anahtarına Dahil Edilebilecek Alanlar
- Model adı ve sürümü
- Sistem promptu
- Kullanıcı promptu
- Temperature
- Tool tanımları
- Kullanıcı veya tenant kimliği
- RAG belge sürümü
- Güvenlik politikası sürümü
Hassas Veri Riski
Bir kullanıcıya verilen özel cevabın başka kullanıcıya sunulmaması gerekir. Çok kiracılı sistemlerde cache anahtarına tenant ve yetki bağlamı eklenmelidir.
Semantic Cache Nedir?
Semantic cache, metin tamamen aynı olmasa bile anlamsal olarak benzer istekleri eşleştirip önceki cevabı kullanmayı amaçlar.
Örnek
“Kargo kaç günde gelir?” ve “Siparişim ne kadar sürede ulaşır?” soruları benzer kabul edilebilir.
Riskler
- Farklı bağlama sahip soruların yanlış eşleştirilmesi
- Güncelliğini kaybeden cevabın sunulması
- Kullanıcıya özel bilginin başka kullanıcıya verilmesi
- Yanlış veya hatalı cevabın tekrar yayılması
- Güvenlik politikasını aşan önbellek sonucu
Güvenli Uygulama
Semantik cache yalnızca düşük riskli, genel ve sık tekrar eden sorularda kullanılmalıdır. Finansal karar, sağlık, kullanıcı hesabı ve gerçek zamanlı bilgi gerektiren cevaplar önbellekten sunulmamalıdır.
LLM Observability Nedir?
LLM observability, yapay zekâ isteklerinin teknik, mali ve davranışsal özelliklerini görünür hâle getirme yaklaşımıdır.
Klasik uygulama izleme yalnızca HTTP 200 cevabı alındığını gösterebilir. Ancak model teknik olarak başarılı cevap verirken boş, hatalı veya istenmeyen içerik üretebilir.
Üç Görünürlük Katmanı
- Teknik: Gecikme, hata ve bağlantı durumu
- Ekonomik: Token ve para maliyeti
- Davranışsal: Cevap kalitesi, güvenlik ve görev başarısı
Genel sistem gözlemlenebilirliği için Observability Nedir? rehberini inceleyebilirsiniz.
AI Gateway’de İzlenmesi Gereken Metrikler
| Metrik | Açıklama |
|---|---|
| Request count | Toplam model çağrısı sayısı |
| Success rate | Başarıyla tamamlanan çağrı oranı |
| End-to-end latency | İsteğin gateway’e ulaşmasından cevabın bitmesine kadar geçen süre |
| Time to first token | Streaming cevabın ilk parçasına kadar geçen süre |
| Input tokens | Modele gönderilen toplam token miktarı |
| Output tokens | Modelin ürettiği token miktarı |
| Cost per request | Tek bir isteğin tahmini veya gerçek maliyeti |
| Cache hit rate | Önbellekten cevaplanan istek oranı |
| Fallback rate | Alternatif modele geçen istek oranı |
| Guardrail block rate | Güvenlik politikası nedeniyle engellenen istek oranı |
| Model error rate | Model ve sağlayıcı bazında hata oranı |
| Tool call rate | Araç çağrısı üreten isteklerin oranı |
Kalite Metrikleri
Teknik metriklerin yanında görev başarısını ölçen uygulamaya özel metrikler kullanılmalıdır:
- Doğru sınıflandırma oranı
- Kaynaklı cevap oranı
- İnsan düzeltmesi gerektiren cevap oranı
- Kullanıcı memnuniyeti
- Yanlış araç çağrısı oranı
- Şema doğrulamasından geçen çıktı oranı
OpenTelemetry Entegrasyonu
AI Gateway, model çağrılarını mevcut dağıtık izleme sistemine OpenTelemetry trace ve metrikleri olarak aktarabilir.
Trace İçinde Görülebilecek Aşamalar
- Kullanıcı isteği
- RAG araması
- Gateway politika kontrolü
- Birincil model çağrısı
- Retry veya fallback
- Tool call
- Çıktı doğrulama
- Nihai kullanıcı cevabı
Trace Correlation
Model çağrısı, uygulamanın mevcut request ID veya trace ID değeriyle ilişkilendirilirse yavaşlığın uygulama, veri tabanı, RAG veya model sağlayıcısından kaynaklanıp kaynaklanmadığı anlaşılabilir.
Prompt ve Cevap Loglama
Prompt logları hata ayıklama ve kalite analizi için yararlı olabilir. Ancak müşteri verisi, kişisel bilgi, parola ve ticari sır içerebilir.
Loglama Modelleri
- Tam prompt ve cevap loglama
- Hassas alanları temizleyerek loglama
- Yalnızca metadata kaydetme
- Örnekleme ile sınırlı kayıt
- Hata durumunda geçici ayrıntılı kayıt
Metadata-Only Yaklaşımı
Aşağıdaki veriler prompt içeriği kaydedilmeden tutulabilir:
- Model ve sağlayıcı
- Token sayısı
- Maliyet
- Gecikme
- Durum ve hata kodu
- Proje ve tenant kimliği
- Guardrail sonucu
Saklama Süresi
Prompt ve cevap logları süresiz tutulmamalıdır. İş amacı, güvenlik gereksinimi ve kişisel veri politikası doğrultusunda saklama ve silme süresi belirlenmelidir.
AI Gateway Güvenliği
AI Gateway bütün model trafiğini gördüğü için yüksek değerli bir güvenlik hedefidir.
Korunması Gereken Varlıklar
- Model sağlayıcı anahtarları
- Kullanıcı promptları
- Model cevapları
- Sistem talimatları
- RAG bağlamı
- Tenant ve kullanıcı kimlikleri
- Maliyet ve kullanım kayıtları
- Gateway yönetim API’si
Temel Kontroller
- TLS ile şifreli iletişim
- Servis kimliği doğrulama
- Rol tabanlı erişim
- Ağ segmentasyonu
- Secret manager
- Değiştirilemez audit logları
- Yönetim arayüzünde çok faktörlü doğrulama
- Düzenli zafiyet ve bağımlılık taraması
Model API Anahtarı Yönetimi
Sağlayıcı API anahtarları uygulama koduna, mobil uygulamaya veya istemci tarayıcısına yerleştirilmemelidir.
Güvenli Anahtar Modeli
- Uygulama kendi servis kimliğiyle gateway’e bağlanır.
- Gateway kullanıcının hangi modele erişebileceğini kontrol eder.
- Sağlayıcı anahtarı secret manager’dan çalışma zamanında alınır.
- İstek modele gönderilir.
- Anahtar uygulama veya son kullanıcıya gösterilmez.
Anahtar Rotasyonu
Sağlayıcı anahtarları düzenli değiştirilmeli ve sızıntı durumunda hızlı biçimde iptal edilebilmelidir.
Uygulama Başına Kimlik
Bütün şirketin ortak bir gateway anahtarı kullanması yerine her uygulama ve ortam için ayrı kimlik kullanılmalıdır.
DLP ve Hassas Veri Kontrolü
Data Loss Prevention kontrolleri modele gönderilmeden önce prompt içinde hassas veri arayabilir.
Tespit Edilebilecek Veriler
- Kimlik numarası
- Kredi kartı bilgisi
- Telefon ve e-posta
- API anahtarı
- Parola
- Sağlık bilgisi
- Kuruma özel gizli ifadeler
Politika Sonuçları
- İsteği tamamen engellemek
- Hassas alanı maskelemek
- Değeri token ile değiştirmek
- Onay için güvenlik ekibine yönlendirmek
- Yalnızca özel model ortamına göndermek
Yanlış Pozitif Riski
DLP kuralları normal iş verilerini yanlışlıkla engelleyebilir. Kurallar test verisiyle değerlendirilmeli ve kullanıcıya anlaşılır hata mesajı sunulmalıdır.
Guardrails ve İçerik Güvenliği
Guardrail, model girdisi veya çıktısı üzerinde güvenlik ve iş politikası uygulayan kontrol katmanıdır.
Girdi Guardrail’leri
- Yasaklı konu kontrolü
- Hassas veri tespiti
- Prompt injection sinyalleri
- Maksimum prompt boyutu
- İzin verilen dil ve içerik türü
Çıktı Guardrail’leri
- Zararlı içerik kontrolü
- Kişisel veri sızıntısı
- Şema doğrulama
- Kaynak bulunma kontrolü
- Marka ve iletişim politikası
- Yasaklı araç çağrısı
Gateway Seviyesinde Guardrail Yeterli mi?
Hayır. Kontroller model sağlayıcısı, uygulama, veri erişimi ve araç katmanlarında savunma derinliği şeklinde uygulanmalıdır.
Prompt Injection Koruması
Prompt injection saldırısı modelin güvenilir talimatlarını değiştirmeyi veya modelin bağlı araçlarını kötüye kullanmayı amaçlayabilir.
Gateway’in Uygulayabileceği Kontroller
- Şüpheli talimat kalıplarını işaretlemek
- Dış kaynaktan gelen içeriği ayrı bağlam olarak etiketlemek
- Sistem promptunu istemci girdisinden ayırmak
- Tool call listesini kullanıcı rolüne göre sınırlamak
- Hassas veri içeren araç sonuçlarını maskelemek
- Yüksek riskli işlemlerde insan onayı istemek
Prompt Injection Tamamen Engellenebilir mi?
Tek bir filtreyle bütün prompt injection saldırılarını engellemek mümkün değildir. Araç yetkilerinin sınırlandırılması ve model çıktısına doğrudan güvenilmemesi en önemli kontroller arasındadır.
Model Çıktısı Doğrulama
Modelden gelen cevap güvenilir uygulama komutu olarak doğrudan çalıştırılmamalıdır.
Doğrulama Türleri
- JSON şeması kontrolü
- Alan türü ve uzunluk kontrolü
- İzin verilen değer listesi
- SQL ve kod güvenliği kontrolü
- URL ve alan adı allowlist’i
- Tool parametresi doğrulama
- İş kuralı kontrolü
Örnek
Model para transferi aracı için miktar ve alıcı üretirse gateway yalnızca biçimi kontrol etmemelidir. Kullanıcının yetkisi, hesap sahipliği, günlük limit ve açık insan onayı da sunucu tarafında doğrulanmalıdır.
Çok Kiracılı Sistemlerde Tenant İzolasyonu
Bir SaaS uygulaması farklı müşterilerin yapay zekâ trafiğini aynı gateway üzerinden geçirebilir.
İzolasyon Gerektiren Alanlar
- API anahtarı ve servis kimliği
- Model erişim listesi
- Harcama bütçesi
- Prompt ve cevap logları
- Cache kayıtları
- RAG kaynakları
- Guardrail politikaları
- Dashboard ve raporlar
Cache İzolasyonu
Tenant A’ya ait cevap Tenant B’nin önbellek sorgusuna dönmemelidir. Cache anahtarı ve depolama bölümleri tenant bağlamını içermelidir.
Log İzolasyonu
Müşteri yöneticisi yalnızca kendi kuruluşuna ait model çağrılarını görebilmelidir.
RAG Sistemlerinde AI Gateway
RAG sisteminde gateway model çağrısını görür fakat belge erişim yetkisini tek başına belirlememelidir.
RAG Akışı
- Kullanıcının kimliği doğrulanır.
- Yetkili olduğu belgeler aranır.
- Seçilen bağlam modele gönderilir.
- Gateway model çağrısını güvenlik ve maliyet kontrollerinden geçirir.
- Cevap kaynaklarla birlikte kullanıcıya sunulur.
Önemli Güvenlik Kuralı
Belge yetkilendirmesi arama ve veri katmanında uygulanmalıdır. “Model bu belgeyi göstermesin” şeklindeki prompt talimatı gerçek erişim kontrolü değildir.
Yapay Zekâ Ajanlarında AI Gateway
Yapay zekâ ajanları bir görev sırasında birden fazla model ve araç çağrısı yapabilir.
Gateway şu alanlarda görünürlük sağlayabilir:
- Ajanın hangi modeli kullandığı
- Her görevde kaç model çağrısı yaptığı
- Hangi araçları çalıştırdığı
- Toplam token ve görev maliyeti
- Retry ve döngü sayısı
- Engellenen güvenlik işlemleri
Ajan Döngüleri
Ajan sonuç üretemeyip aynı modeli ve aracı tekrar tekrar çağırırsa yüksek maliyet oluşturabilir.
Gateway görev başına maksimum model çağrısı, token ve süre sınırı koyabilir.
Ajan mimarisinin genel yapısı için Yapay Zekâ Ajanları rehberini inceleyebilirsiniz.
AI Gateway ile MCP Gateway İlişkisi
Model Context Protocol, yapay zekâ istemcilerinin araç ve veri kaynaklarına standart yöntemle bağlanmasını sağlar.
AI Gateway model trafiğini, MCP Gateway ise araç ve MCP sunucu trafiğini yönetebilir. Bazı platformlar iki yeteneği aynı ürün içinde birleştirebilir.
MCP Trafiğinde Uygulanabilecek Kontroller
- Kullanıcıya göre araç erişimi
- Sunucu kimlik doğrulaması
- Tool call loglama
- Parametre ve cevap boyutu sınırı
- Hassas veri kontrolü
- Araç bazında rate limit
- İzin verilen MCP sunucuları
Protokolün ayrıntıları için Model Context Protocol Nedir? rehberini inceleyebilirsiniz.
AI Gateway Dağıtım Modelleri
Yönetilen Bulut Hizmeti
Gateway altyapısı hizmet sağlayıcı tarafından çalıştırılır. Kurulum ve ölçeklendirme daha kolay olabilir.
Self-Hosted Gateway
Kuruluş gateway’i kendi Kubernetes, sanal makine veya özel bulut ortamında çalıştırır.
Hibrit Model
Kontrol paneli yönetilen hizmette, veri yolu ise kuruluşun kendi ortamında çalışabilir.
Edge Gateway
Gateway kullanıcıya yakın edge bölgelerinde çalışarak gecikmeyi azaltabilir. Veri bölgesi ve loglama koşulları ayrıca değerlendirilmelidir.
Uygulama İçine Gömülü Gateway
Küçük sistemlerde ortak LLM istemci kütüphanesi gateway benzeri görevler yapabilir. Ancak bütün uygulamaların aynı sürümü kullanmasını ve merkezi politika uygulanmasını sağlamak zorlaşabilir.
Yönetilen ve Self-Hosted AI Gateway Karşılaştırması
| Özellik | Yönetilen Hizmet | Self-Hosted |
|---|---|---|
| Kurulum | Daha hızlı | Altyapı çalışması gerekir |
| Ölçeklendirme | Sağlayıcı yönetebilir | Kuruluş yönetir |
| Veri kontrolü | Sağlayıcı mimarisine bağlı | Daha ayrıntılı kontrol sağlanabilir |
| Bakım | Daha düşük operasyon yükü | Güncelleme ve izleme kuruluşa aittir |
| Özelleştirme | Sunulan özelliklerle sınırlı olabilir | Özel politikalar geliştirilebilir |
| Maliyet | Kullanıma veya trafiğe bağlı | Altyapı ve ekip maliyeti |
| Uyum | Bölge ve sözleşmeye bağlı | Özel veri yerleşimi sağlanabilir |
Örnek AI Gateway İstek Akışı
Bir kurumsal belge asistanının soruya cevap verdiğini düşünelim.
- Kullanıcı uygulamada soru sorar.
- Uygulama kullanıcı ve tenant kimliğini gateway’e gönderir.
- Gateway kullanıcının yapay zekâ özelliğine erişimini kontrol eder.
- DLP katmanı prompt içinde hassas veri arar.
- RAG sistemi yalnızca kullanıcının yetkili olduğu belgeleri getirir.
- Routing motoru uzun bağlam destekleyen uygun modeli seçer.
- Model sağlayıcısına istek gönderilir.
- Birincil sağlayıcı zaman aşımına uğrarsa yedek modele geçilir.
- Cevap JSON ve kaynak formatı açısından doğrulanır.
- Token, maliyet ve gecikme metadata’sı kaydedilir.
- Cevap kullanıcıya gösterilir.
Örnek AI Gateway Yönlendirme Politikası
Aşağıdaki örnek, belirli bir üründe uygulanabilecek sağlayıcıdan bağımsız basitleştirilmiş politika yapısını gösterir:
{
"route": "customer-support",
"authentication": {
"required": true,
"allowed_roles": ["support-agent", "support-manager"]
},
"budget": {
"monthly_limit_usd": 1500,
"per_request_max_output_tokens": 800
},
"routing": {
"primary_model": "support-model-primary",
"fallback_models": [
"support-model-secondary",
"support-model-economy"
],
"timeout_ms": 20000,
"max_retries": 1
},
"security": {
"pii_detection": true,
"redact_api_keys": true,
"block_unapproved_tools": true
},
"logging": {
"store_prompt_content": false,
"store_usage_metadata": true,
"retention_days": 30
}
}
Politika Neden Kod Olarak Saklanmalıdır?
Gateway kuralları sürüm kontrolünde tutulursa değişiklikler incelenebilir, test edilebilir ve geri alınabilir.
Örnek Kurumsal AI Gateway Senaryosu
Başlangıç Durumu
Bir e-ticaret şirketinde üç ekip farklı yapay zekâ özellikleri geliştiriyor:
- Müşteri destek asistanı
- Ürün açıklaması üretimi
- Sipariş yorumlarını sınıflandırma
Her ekip ayrı model sağlayıcısı anahtarı kullanıyor. Maliyetler ortak faturada görünüyor ve hangi ekibin ne kadar harcadığı anlaşılamıyor.
Sorunlar
- API anahtarları farklı uygulamalara dağılmış durumda.
- Tek bir sağlayıcı kesintisi bütün destek sistemini durduruyor.
- Prompt loglarında müşteri bilgileri bulunuyor.
- Basit sınıflandırma işleri pahalı modele gönderiliyor.
- Departman bazında bütçe sınırı uygulanamıyor.
Gateway Sonrası Mimari
- Bütün uygulamalar tek gateway endpoint’ini kullanır.
- Her uygulamaya ayrı servis kimliği verilir.
- Sınıflandırma istekleri düşük maliyetli modele yönlendirilir.
- Destek asistanında birincil ve yedek sağlayıcı tanımlanır.
- Promptlar loglanmadan önce kişisel veriler temizlenir.
- Her istek maliyet merkeziyle etiketlenir.
- Departman bazında aylık bütçe sınırı uygulanır.
Elde Edilen Görünürlük
Şirket hangi özelliğin en fazla token kullandığını, hangi modelin daha hızlı olduğunu ve fallback’in hangi sıklıkta devreye girdiğini izleyebilir.
AI Gateway Kurulum Yol Haritası
Aşama 1: Model Envanteri
- Kullanılan model ve sağlayıcıları listeleyin.
- Hangi uygulamanın hangi anahtarı kullandığını belirleyin.
- Aylık token ve maliyet verisini çıkarın.
- Veri ve bölge gereksinimlerini yazın.
Aşama 2: Ortak Endpoint
- Uygulamaları merkezi gateway adresine yönlendirin.
- Her uygulama için ayrı kimlik oluşturun.
- Sağlayıcı anahtarlarını secret manager’a taşıyın.
Aşama 3: Gözlemlenebilirlik
- Model ve sağlayıcı metadata’sını kaydedin.
- Token ve maliyet ölçümünü etkinleştirin.
- Gecikme, hata ve fallback dashboard’u oluşturun.
Aşama 4: Bütçe ve Rate Limit
- Proje bazında aylık harcama sınırı belirleyin.
- Kullanıcı ve tenant bazında token limiti koyun.
- Bütçe uyarıları oluşturun.
Aşama 5: Dayanıklılık
- Yedek model ve sağlayıcıları test edin.
- Retry ve timeout değerlerini belirleyin.
- Circuit breaker mekanizması ekleyin.
Aşama 6: Güvenlik
- DLP ve hassas veri politikalarını ekleyin.
- Prompt ve cevap loglama kurallarını daraltın.
- Model ve araç erişim listeleri hazırlayın.
- Yönetim işlemlerini audit loglarına aktarın.
Aşama 7: Kalite Yönlendirmesi
- Görev bazında model değerlendirmeleri yapın.
- Kalite ve maliyete göre routing politikası oluşturun.
- Model değişikliklerini A/B testleriyle doğrulayın.
AI Gateway Platformu Seçim Kriterleri
Sağlayıcı Desteği
- Kullandığınız model sağlayıcılarını destekliyor mu?
- Özel ve self-hosted modellere bağlanabiliyor mu?
- Görsel, ses ve embedding istekleriyle çalışıyor mu?
Routing ve Dayanıklılık
- Fallback tanımlanabiliyor mu?
- Gecikme ve maliyete göre yönlendirme var mı?
- Retry ve circuit breaker destekleniyor mu?
- Model sağlık durumu izleniyor mu?
Maliyet Yönetimi
- Token maliyetleri otomatik hesaplanıyor mu?
- Proje ve tenant bazında bütçe uygulanabiliyor mu?
- Model fiyatları özelleştirilebiliyor mu?
Güvenlik
- API anahtarları güvenli saklanıyor mu?
- SSO ve rol tabanlı erişim var mı?
- PII ve DLP kontrolleri bulunuyor mu?
- Prompt ve cevap logları kapatılabiliyor mu?
- Audit logları dış SIEM sistemine aktarılabiliyor mu?
Observability
- OpenTelemetry desteği var mı?
- Time to first token ölçülüyor mu?
- Tool call ve agent trace bilgileri görülebiliyor mu?
- Özel metadata eklenebiliyor mu?
Dağıtım ve Veri Konumu
- Self-hosted seçeneği bulunuyor mu?
- Hangi bölgelerde çalışıyor?
- Prompt verileri nerede işleniyor?
- Log saklama süresi kontrol edilebiliyor mu?
AI Gateway’in Sınırlamaları
Ek Gecikme Oluşturabilir
Her istek yeni bir ağ ve politika katmanından geçer. Ağ konumu ve ağır güvenlik taramaları gecikmeyi artırabilir.
Tek Hata Noktasına Dönüşebilir
Gateway yüksek erişilebilir çalıştırılmazsa bütün model çağrıları etkilenebilir.
Sağlayıcı Özelliklerini Gizleyebilir
Aşırı ortaklaştırılmış arabirim gelişmiş model özelliklerinin kullanılmasını zorlaştırabilir.
Yanlış Routing Kaliteyi Düşürebilir
Yalnızca maliyet odaklı seçim karmaşık görevlerin yetersiz modele gönderilmesine neden olabilir.
Gizlilik Riski Oluşturabilir
Gateway prompt ve cevapları gördüğü için ele geçirilmesi geniş veri sızıntısına yol açabilir.
Guardrail’ler Kusursuz Değildir
Hassas veri ve zararlı içerik tespiti yanlış pozitif veya yanlış negatif üretebilir.
Model Kalitesini Kendiliğinden Artırmaz
Gateway trafik ve politika katmanıdır. Doğru model, iyi prompt, güvenilir veri ve değerlendirme süreçlerinin yerini almaz.
AI Gateway Kontrol Listesi
| Kontrol Maddesi | Durum |
|---|---|
| Kullanılan bütün model ve sağlayıcılar envantere alındı mı? | Evet / Hayır |
| Uygulamalar ortak gateway endpoint’ini kullanıyor mu? | Evet / Hayır |
| Her uygulamanın ayrı servis kimliği var mı? | Evet / Hayır |
| Sağlayıcı anahtarları merkezi secret manager’da mı? | Evet / Hayır |
| Model erişimleri rol ve projeye göre sınırlandırıldı mı? | Evet / Hayır |
| Token ve maliyetler uygulama bazında ölçülüyor mu? | Evet / Hayır |
| Aylık bütçe ve harcama uyarıları bulunuyor mu? | Evet / Hayır |
| Kullanıcı ve tenant bazında rate limit var mı? | Evet / Hayır |
| Birincil model için fallback tanımlandı mı? | Evet / Hayır |
| Fallback modeli kalite testinden geçirildi mi? | Evet / Hayır |
| Retry sayısı ve timeout değerleri sınırlandırıldı mı? | Evet / Hayır |
| Prompt ve cevaplarda hassas veri kontrolü yapılıyor mu? | Evet / Hayır |
| Prompt içerik logları gerçekten gerekli mi? | Evet / Hayır |
| Log saklama ve silme süresi tanımlandı mı? | Evet / Hayır |
| Çok kiracılı cache ve log izolasyonu sağlandı mı? | Evet / Hayır |
| Model çıktıları şema ve iş kurallarıyla doğrulanıyor mu? | Evet / Hayır |
| Tool call izinleri kullanıcı rolüne göre sınırlandırıldı mı? | Evet / Hayır |
| OpenTelemetry veya eş değer izleme etkin mi? | Evet / Hayır |
| Gateway yüksek erişilebilir şekilde çalışıyor mu? | Evet / Hayır |
| Gateway devre dışı kalırsa geri dönüş planı var mı? | Evet / Hayır |
AI Gateway Kullanımında Sık Yapılan Hatalar
- AI Gateway’i yalnızca basit reverse proxy olarak kurmak
- Bütün uygulamalara aynı gateway anahtarını vermek
- Sağlayıcı anahtarlarını hâlâ uygulama içinde saklamak
- Yalnızca istek sayısını ölçüp token maliyetini izlememek
- Bütün işleri en pahalı modele göndermek
- Yalnızca ucuzluk için yetersiz model seçmek
- Fallback modellerini önceden test etmemek
- Retry mekanizmasını sınırsız bırakmak
- Kritik ajan işlemlerinde idempotency kullanmamak
- Prompt ve cevapların tamamını süresiz loglamak
- Cache anahtarında tenant ve yetki bağlamını kullanmamak
- Semantik cache’i kişiye özel cevaplarda kullanmak
- DLP filtresini anonimleştirme garantisi sanmak
- Model çıktısını doğrulamadan komut olarak çalıştırmak
- RAG belge yetkisini yalnızca sistem promptuna bırakmak
- Gateway’i yüksek erişilebilir tasarlamamak
- Gateway yönetim arayüzünü internete açık bırakmak
- Model sürümü değiştiğinde değerlendirmeleri tekrarlamamak
AI Gateway İçin Güvenilir Kaynaklar
- Cloudflare AI Gateway Documentation
- Kong AI Gateway Documentation
- LiteLLM Documentation
- OpenTelemetry Generative AI Semantic Conventions
- OWASP GenAI Security Project
- TeknoTürkiye – API Gateway Nedir?
- TeknoTürkiye – Observability Nedir?
- TeknoTürkiye – Yapay Zekâ Ajanları
- TeknoTürkiye – Model Context Protocol
AI Gateway Hakkında Sık Sorulan Sorular
AI Gateway nedir?
Yapay zekâ uygulamalarıyla model sağlayıcıları arasında çalışan; yönlendirme, güvenlik, bütçe, loglama ve gözlemlenebilirlik sağlayan merkezi trafik katmanıdır.
LLM Gateway nedir?
Büyük dil modeli çağrılarını yöneten gateway yapısıdır. AI Gateway ve LLM Gateway ifadeleri çoğu kullanımda benzer anlam taşır.
AI Gateway ne işe yarar?
Farklı modellere tek endpoint üzerinden erişim, model yönlendirme, fallback, token takibi, harcama sınırı ve güvenlik politikası sağlar.
AI Gateway bir yapay zekâ modeli midir?
Hayır. Model cevap üretir; gateway isteğin hangi modele ve hangi kurallarla gönderileceğini yönetir.
AI Gateway ile API Gateway aynı mı?
Hayır. Benzer trafik yönetimi görevleri bulunsa da AI Gateway token maliyeti, model seçimi, prompt güvenliği ve LLM gözlemlenebilirliği gibi özel işlevler sunar.
Mevcut API Gateway AI Gateway olarak kullanılabilir mi?
Gerekli eklenti ve özel politikalar geliştirildiğinde kullanılabilir. Token, model routing ve guardrail özelliklerinin ayrıca eklenmesi gerekir.
AI Gateway kullanmak zorunlu mu?
Küçük prototiplerde zorunlu değildir. Model, ekip ve trafik sayısı arttığında merkezi yönetim önemli avantaj sağlar.
AI Gateway model sağlayıcısını değiştirmeyi kolaylaştırır mı?
Ortak arayüz ve provider adapter kullanılıyorsa kolaylaştırabilir. Sağlayıcıya özel gelişmiş özellikler yine kod değişikliği gerektirebilir.
Model routing nedir?
İsteğin maliyet, gecikme, yetenek, kalite veya kullanıcı planına göre uygun modele gönderilmesidir.
Fallback model nedir?
Birincil model kullanılamadığında veya politika koşulunu karşılamadığında isteğin gönderildiği alternatif modeldir.
AI Gateway kesintileri önler mi?
Alternatif sağlayıcıya geçişle bazı kesintilerin etkisini azaltabilir. Gateway’in kendisi de yüksek erişilebilir çalıştırılmalıdır.
AI Gateway maliyeti azaltır mı?
Ucuz model yönlendirmesi, önbellek, token sınırı ve bütçe politikalarıyla azaltabilir. Yanlış yapılandırma ek maliyet de oluşturabilir.
Token bütçesi nedir?
Bir kullanıcı, uygulama veya projenin belirli dönemde tüketebileceği maksimum giriş ve çıkış token miktarıdır.
Semantic cache nedir?
Tam olarak aynı olmayan fakat anlamsal açıdan benzer sorular için önceki cevabın kullanılmasını sağlayan önbellek yöntemidir.
Semantic cache güvenli midir?
Genel ve düşük riskli sorularda kullanılabilir. Kullanıcıya özel, güncel veya hassas cevaplarda veri sızıntısı ve yanlış cevap riski taşır.
Time to first token nedir?
İsteğin gönderilmesinden streaming model cevabının ilk parçasının alınmasına kadar geçen süredir.
AI Gateway promptları görür mü?
Veri yolunda çalışan gateway genellikle prompt ve cevapları işleyebilir. Loglama ve veri saklama politikası dikkatle yapılandırılmalıdır.
AI Gateway kişisel verileri engeller mi?
DLP ve PII filtreleri yardımcı olabilir ancak bütün hassas verileri kusursuz tespit etmez. Veri minimizasyonu ve erişim kontrolü ayrıca gerekir.
AI Gateway prompt injection saldırısını engeller mi?
Bazı saldırı sinyallerini tespit edebilir ve araç izinlerini sınırlandırabilir. Tek başına bütün prompt injection yöntemlerini engelleyemez.
Model çıktısı neden doğrulanmalıdır?
Model yanlış biçim, uydurulmuş değer veya izin verilmeyen araç parametresi üretebilir. Çıktı sunucu tarafında şema ve iş kurallarıyla kontrol edilmelidir.
AI Gateway RAG güvenliğini sağlar mı?
Model çağrısına politika uygulayabilir fakat belge erişim yetkisi RAG ve veri katmanında uygulanmalıdır.
AI Gateway yapay zekâ ajanlarında kullanılır mı?
Evet. Ajanların model ve araç trafiğini izlemek, görev başına bütçe koymak ve riskli işlemleri sınırlandırmak için kullanılabilir.
MCP Gateway ile AI Gateway aynı mıdır?
AI Gateway model trafiğine, MCP Gateway ise araç ve MCP sunucu trafiğine odaklanır. Bazı platformlar ikisini birlikte sunar.
AI Gateway self-hosted kurulabilir mi?
Evet. Açık kaynak veya ticari gateway çözümleri kuruluşun kendi bulut ya da Kubernetes ortamında çalıştırılabilir.
Yönetilen AI Gateway güvenli midir?
Güvenlik sağlayıcının mimarisi, veri konumu, log politikası ve sözleşmesine bağlıdır. Kuruluş kendi risk değerlendirmesini yapmalıdır.
AI Gateway logları ne kadar saklanmalıdır?
İş ve güvenlik ihtiyacı için gereken en kısa süre belirlenmelidir. Prompt içeriği ve kişisel veriler gereksiz yere tutulmamalıdır.
AI Gateway OpenTelemetry destekler mi?
Bazı gateway ürünleri model çağrılarını OpenTelemetry trace ve metriklerine aktarabilir. Desteklenen alanlar ürüne göre değişir.
AI Gateway için hangi metrikler önemlidir?
Token kullanımı, maliyet, hata oranı, toplam gecikme, time to first token, cache hit ve fallback oranı önemlidir.
AI Gateway kaliteyi ölçebilir mi?
Teknik telemetri toplayabilir ve değerlendirme araçlarına veri sağlayabilir. Cevap doğruluğu için uygulamaya özel test setleri gerekir.
AI Gateway ücretsiz olabilir mi?
Açık kaynak çözümler ücretsiz lisansla kullanılabilir fakat sunucu, bakım, güvenlik ve ekip maliyetleri devam eder.
Küçük işletmeler AI Gateway kullanmalı mı?
Tek model ve düşük trafik varsa doğrudan bağlantı yeterli olabilir. Birden fazla ürün veya bütçe kontrolü varsa gateway değerlendirilebilir.
AI Gateway seçerken en önemli kriter nedir?
Tek bir kriter yoktur. Sağlayıcı desteği, veri gizliliği, routing, maliyet yönetimi, gözlemlenebilirlik ve işletme yükü birlikte değerlendirilmelidir.
AI Gateway Nedir? Sonuç
AI Gateway nedir sorusunun temel cevabı; yapay zekâ uygulamalarından gelen model çağrılarını tek bir güvenli, gözlemlenebilir ve yönetilebilir katmandan geçiren merkezi ağ geçididir.
Gateway farklı model sağlayıcılarını ortak arabirim altında toplayabilir, istekleri maliyet veya yeteneğe göre yönlendirebilir ve birincil sağlayıcı çalışmadığında alternatif modele geçebilir.
Token kullanımı ve para maliyeti proje, departman, tenant veya kullanıcı düzeyinde izlenebilir. Harcama bütçeleri ve rate limit politikaları beklenmeyen faturaları azaltabilir.
Önbellekleme maliyet ve gecikme avantajı sağlar; fakat kullanıcıya özel ve hassas cevaplarda tenant izolasyonu ve güncellik kontrolleri uygulanmalıdır.
AI Gateway’in en önemli katkılarından biri model çağrılarını görünür hâle getirmesidir. Gecikme, time to first token, token sayısı, maliyet, fallback ve güvenlik engellemeleri merkezi olarak izlenebilir.
DLP, guardrail ve prompt filtreleri savunma katmanı oluşturur fakat gerçek yetkilendirme, RAG belge erişimi ve araç güvenliğinin yerine geçmez.
Üretim ortamında gateway’in kendisi kritik altyapı olarak ele alınmalı; yüksek erişilebilirlik, secret management, audit loglama, ağ koruması ve geri dönüş planı uygulanmalıdır.
Doğru tasarlanan bir AI Gateway, kuruluşların tek bir modele bağlı kalmadan yapay zekâ kullanımını maliyet, güvenlik ve operasyon açısından sürdürülebilir biçimde büyütmesine yardımcı olur.
