Şirket içi açık kaynak yapay zekâ kurulumu, kurumsal verilerin üçüncü taraf bulut sağlayıcılarına iletilmeden yerel altyapıda işlenmesini sağlar. Veri gizliliği, uyumluluk gereksinimleri ve maliyet kontrolü açısından giderek daha fazla şirket, OpenAI veya Google Gemini gibi bulut tabanlı çözümler yerine kendi sunucularında çalışan büyük dil modellerini (LLM) tercih etmektedir. Bu rehberde Ollama ve vLLM araçlarıyla güvenli bir kurumsal AI altyapısını nasıl kuracağınızı adım adım ele alıyoruz.

Neden Şirket İçi Açık Kaynak Yapay Zekâ?
Bulut tabanlı AI hizmetleri hızlı başlangıç sunarken, hassas verileri işleyen finans, sağlık, hukuk ve kamu kurumları için ciddi riskler barındırır. Şirket içi yapay zekâ kurulumu şu avantajları sağlar:
- Veri egemenliği: Müşteri verileri, sözleşmeler ve ticari sırlar kurumun kendi ağından çıkmaz.
- Uyumluluk: KVKK, GDPR ve sektörel düzenlemelerle daha kolay uyum sağlanır.
- Maliyet öngörülebilirliği: Token başına ücretlendirme yerine sabit donanım yatırımıyla sınırsız sorgu yapılabilir.
- Özelleştirme: Model ince ayarı (fine-tuning) ve RAG (Retrieval-Augmented Generation) altyapısı tamamen kontrol altında tutulur.
- Gecikme (latency) avantajı: LAN üzerinde çalışan model, internet bağlantısına bağlı olmaksızın düşük gecikmeyle yanıt verir.
Özellikle DORA ve NIS2 direktifleri gibi düzenleyici çerçeveler, kritik sistemlerde üçüncü taraf bağımlılığını sınırlandırma yükümlülüğü getirdiğinden, şirket içi AI kurulumu yasal uyumluluk açısından da stratejik önem taşımaktadır.
Temel Araçlar: Ollama ve vLLM Nedir?
Ollama
Ollama, açık kaynak LLM’leri yerel sunucularda veya geliştirici makinelerinde kolayca çalıştırmak için tasarlanmış bir araçtır. Docker benzeri bir komut satırı arayüzüyle Llama 3, Mistral, Phi-3, Gemma ve Qwen gibi popüler modeller tek komutla indirilerek çalıştırılabilir.
- REST API arayüzü (OpenAI uyumlu endpoint’ler)
- CPU ve GPU (NVIDIA CUDA, Apple Metal) desteği
- Model yönetimi ve çoklu model koşturma
- Düşük kurulum karmaşıklığı — küçük ve orta ölçekli ekipler için idealdir
vLLM
vLLM, UC Berkeley tarafından geliştirilen ve yüksek verimli LLM çıkarımı (inference) için tasarlanmış açık kaynak bir kütüphanedir. Özellikle PagedAttention mekanizması sayesinde GPU belleğini çok daha verimli kullanır ve yüksek eşzamanlı istek sayısında üstün performans sergiler.
- Yüksek throughput (saniyede çok sayıda token üretimi)
- OpenAI uyumlu API sunucusu
- Tensor parallelism ile çok GPU desteği
- Büyük ölçekli kurumsal dağıtımlar ve production ortamları için tercih edilir
| Özellik | Ollama | vLLM |
|---|---|---|
| Kurulum kolaylığı | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ |
| Üretim ölçeği | Orta | Yüksek |
| GPU verimliliği | İyi | Çok İyi |
| Eşzamanlı istek | Sınırlı | Yüksek |
| OpenAI uyumlu API | Evet | Evet |
| Hedef kitle | Geliştirici / KOBİ | Kurumsal / Büyük ölçek |

Adım Adım Kurulum Rehberi
1. Donanım Gereksinimlerini Belirleyin
Kullanmak istediğiniz modelin boyutu, donanım seçimini doğrudan etkiler:
- 7B parametre modeller (örn. Mistral 7B): 8 GB VRAM yeterli; NVIDIA RTX 3080/4070 veya A10G.
- 13B parametre modeller: 16-24 GB VRAM; RTX 3090/4090 veya A100 40GB.
- 70B parametre modeller (örn. Llama 3 70B): Çok GPU (2x A100 80GB) veya CPU offloading ile yavaş çalışır.
- CPU kurulumu: Ollama ile CPU üzerinde quantize (GGUF) modeller çalıştırılabilir; ancak gecikme süresi artar.
2. Ollama Kurulumu (Linux/macOS)
Tek satırlık kurulum komutuyla Ollama yüklenebilir ve model hemen çalıştırılabilir:
curl -fsSL https://ollama.com/install.sh | sh
ollama run llama3
Kurumsal ortamlarda Docker ile izole etmek önerilir:
docker run -d --gpus all \
-v ollama:/root/.ollama \
-p 11434:11434 \
--name ollama ollama/ollama
Bu sayede http://localhost:11434 üzerinden OpenAI uyumlu REST API’ye erişilir.
3. vLLM Kurulumu
vLLM, Python pip ile kurulur ve Hugging Face model ağırlıklarını doğrudan kullanır:
pip install vllm
python -m vllm.entrypoints.openai.api_server \
--model mistralai/Mistral-7B-Instruct-v0.3 \
--host 0.0.0.0 \
--port 8000
Çok GPU kullanımı için --tensor-parallel-size 2 parametresi eklenir.
4. Güvenlik Katmanlarını Yapılandırın
Şirket içi açık kaynak yapay zekâ kurulumunda güvenlik kritik öneme sahiptir:
- Ağ izolasyonu: AI sunucusunu yalnızca iç ağa açın; internete doğrudan erişimi engelleyin.
- API kimlik doğrulama: Nginx reverse proxy + API key ile erişimi kısıtlayın. Güvenli token doğrulama için RFC 7521 OAuth Assertion Framework standartlarını inceleyebilirsiniz.
- TLS şifrelemesi: İç ağda bile HTTPS kullanımı önerilir; sertifika yönetimi için Let’s Encrypt veya kurumsal CA kullanın.
- Rol tabanlı erişim: Hangi ekiplerin hangi modellere erişebileceğini tanımlayın.
- Günlük kaydı (logging): Tüm sorguları audit log olarak saklayın; uyumluluk denetimleri için gereklidir.
- Model doğrulama: Kullandığınız model ağırlıklarını yalnızca resmi Hugging Face veya model kartı kaynaklarından indirin; checksum doğrulaması yapın.
5. Mevcut Araçlarla Entegrasyon
Her iki araç da OpenAI uyumlu API sunduğu için mevcut uygulamalarınıza entegrasyon oldukça kolaydır:
- LangChain / LlamaIndex:
base_urlparametresini yerel sunucuya yönlendirin. - Open WebUI: Ollama için tarayıcı tabanlı ChatGPT benzeri arayüz sağlar.
- VS Code Eklentileri (Continue.dev): Geliştirici kod asistanı olarak yerel model kullanımını destekler.
- Slack / Teams Bot: API entegrasyonuyla kurumsal mesajlaşma araçlarına bağlanabilir.
Kurumsal AI Altyapısında Dikkat Edilmesi Gerekenler
- Model lisansları: Ticari kullanım için Llama 3, Mistral ve Qwen lisans koşullarını mutlaka okuyun.
- Yedekleme ve yük dengeleme: Production ortamında tek nokta arızasını önlemek için en az iki sunucu kullanın.
- Performans izleme: Prometheus + Grafana ile GPU kullanımı, gecikme ve hata oranlarını takip edin.
- Model güncellemeleri: Güvenlik açıkları için model sürümlerini düzenli olarak takip edin.
- RAG mimarisi: Şirket belgelerinizi modele bağlamak için vektör veritabanı (Qdrant, Chroma, Weaviate) entegrasyonu planlayın.
Sık Sorulan Sorular (SSS)
Ollama mı, vLLM mi tercih etmeliyim?
Küçük ekipler, geliştirme ortamları ve hızlı prototipleme için Ollama ideal seçimdir. Yüksek eşzamanlı kullanıcı sayısı olan production ortamları ve enterprise dağıtımlar için vLLM daha uygun performans sunar.
GPU olmadan şirket içi LLM çalıştırılabilir mi?
Evet. Ollama, GGUF formatında quantize edilmiş modelleri CPU üzerinde çalıştırabilir. Ancak GPU ile karşılaştırıldığında yanıt süreleri önemli ölçüde uzar. Küçük modeller (3B-7B) makul CPU performansıyla kullanılabilir.
Hangi açık kaynak modeller kurumsal kullanım için önerilir?
Llama 3.1 8B/70B (Meta), Mistral 7B/Mixtral 8x7B, Qwen2.5 ve Phi-3 Medium modelleri hem performans hem de lisans esnekliği açısından kurumsal ortamlarda sıkça tercih edilmektedir. Ticari kullanım koşullarını ilgili model kartından doğrulayın.
Şirket içi AI kurulumu KVKK uyumluluğunu garanti eder mi?
Şirket içi kurulum, kişisel verilerin yurt dışına iletilmesi riskini ortadan kaldırır; ancak tek başına KVKK uyumluluğunu garanti etmez. Veri minimizasyonu, erişim logları, silme prosedürleri ve kullanıcı bilgilendirmesi gibi ek uyumluluk adımları da gereklidir.
Model fine-tuning (ince ayar) şirket içinde nasıl yapılır?
LoRA veya QLoRA yöntemleriyle kısıtlı GPU kaynaklarında bile ince ayar yapılabilir. Hugging Face TRL ve LLaMA-Factory kütüphaneleri bu süreç için yaygın kullanılan açık kaynak araçlardır. Fine-tuning için eğitim verisi hazırlama ve veri kalitesi kritik başarı faktörleridir.
