361 Local · Saha Rehberi

Şirket İçinde Çalışan AI —
Saha Rehberi

"Air-gap" ve "sıfır token maliyeti" güzel cümleler. Bu sayfa asıl soruların cevabını veriyor: yerel modeller hangi işte yeterli, hangi donanım gerekir, ne zaman buluta gitmelisiniz — ve şirket dışına veri çıkmadığını nasıl garanti ediyoruz.

Bölüm 1

Üç yerel çalıştırma yolu

Yerel AI tek bir kurulum biçimi değil. 361 üç yolu da destekler ve üçü birbirini dışlamaz — aynı kurumda yan yana çalışabilirler.

YolNe demek
361 Local (gömülü) llama.cpp platformun içine gömülüdür. Harici kurulum gerekmez: çalıştırıcı ikili dosya otomatik indirilir, API anahtarı istenmez. Yerel AI'ı açmak için ayrı bir ürün satın almanız veya sunucuya el ile yazılım kurmanız gerekmiyor.
Ollama Ekibinizde zaten Ollama varsa, yerel adres üzerinden bağlanır. Harici kurulum sizin tarafınızda; 361 onu bir sağlayıcı gibi kullanır.
LM Studio Harici kurulum, OpenAI-uyumlu arayüz üzerinden bağlanır. Masaüstünde model deneyen ekipler için tanıdık bir yol.
Üçü birbirini dışlamaz. Aynı kurumda gömülü motorla üretim iş yükünü, Ollama veya LM Studio ile ekip denemelerini paralel yürütebilirsiniz.

Bölüm 2

Donanım: neyle başlarsınız, neyle rahat edersiniz

IT ekibinin ilk sorduğu şey. Aşağıdakiler platformun kendi gereksinimleri — tahmin değil.

BaşlıkGereksinim
İşletim sistemi Windows Server 2019+ veya Windows 10/11 · .NET Framework 4.8
Minimum 16 GB RAM   8 CPU çekirdeği
Küçük modellerle çalışmaya, deneme ve pilot iş yüklerine yeter.
Önerilen 32 GB+ RAM   CUDA destekli NVIDIA GPU
Kalite modelleri ve yoğun belge/OCR hattı için rahat çalışma alanı.

Makineyi platform otomatik tarar

Donanımı sizin çıkarmanız gerekmez. Platform kurulumda makineyi tarar ve neyi kullanabileceğine kendisi karar verir.

  • RAM miktarı — hangi model boyutunun sığacağını belirler.
  • CPU komut setleri — AVX2 / AVX512 desteği tespit edilir; uygun çalıştırıcı seçilir.
  • CUDA ve VRAM miktarı — GPU varsa kapasitesi ölçülür.
  • Vulkan desteği — CUDA yoksa alternatif hızlandırma yolu aranır.
CUDA Vulkan CPU
Hızlandırma sırası budur. Biri başarısız olursa sistem sessizce bir alttakine düşer — kurulum GPU sürücüsü yüzünden çakılıp kalmaz.
"Donanıma sığar mı" rozeti. Model seçerken tahmin yürütmezsiniz: her model dosyasının boyutu makinenin RAM/VRAM kapasitesine karşı hesaplanır ve sığmayan model listede işaretlenir. Yanlış modeli indirip sunucuyu kilitleme riski baştan kapanır.

Gömülü başlangıç seti

Kutudan çıkan model seti. Hangisiyle başlayacağınız donanımınıza ve işin tipine göre değişir.

ModelBoyutKullanım
Qwen2.5 0.5B ~398 MB Düşük donanım / hızlı deneme. "Yerel AI çalışıyor mu" sorusunu dakikalar içinde cevaplar.
Qwen2.5 3B Varsayılan ~2 GB Türkçe dahil çok dilli, araç çağırma destekli, CPU'da makul çalışır. Çoğu kurumun başlangıç noktası.
Qwen2.5 7B ~4,7 GB Kalite seçeneği. En az 6 GB VRAM'li GPU önerilir.
Qwen2-VL 2B ~2,2 GB Görsel anlayan sohbet — ekran görüntüsü, form fotoğrafı, saha fotoğrafı üzerinden konuşma.
Dürüst not. Somut hız ve eşzamanlılık rakamlarını bu sayfada vermiyoruz — çünkü bunlar tamamen sizin donanımınıza bağlıdır. POC sırasında kendi makinenizde ölçülür ve rakamlar size ait olur.

Bölüm 3

Yerel yığın sadece sohbet değil

Yerel AI denince akla tek başına bir sohbet kutusu gelir. 361'in yerel yığını bir belge–ses–görüntü hattıdır: hepsi makine içinde çalışır, token maliyeti sıfırdır.

YetenekNasıl
Sohbet + araç çağırma + akış (streaming) Gömülü llama.cpp motoru. Cevap kelime kelime akar; model iş modüllerinizdeki araçları çağırabilir.
Görsel anlayan sohbet Görsel-dil modeli. Fotoğraf ve ekran görüntüsü üzerinden soru sorulur.
Gömme / RAG (anlamsal arama) ONNX Runtime + çok dilli gömme modeli (~470 MB ve ~1,11 GB seçenekleri). Kurum belgeleriniz üzerinde anlam bazlı arama.
OCR — taranmış PDF ve görüntüden metin Yerel OCR motoru (~12,6 MB modeller). Arşivdeki taranmış evrak metne dönüşür, dışarı gitmeden.
Konuşmadan metne Whisper small (~500 MB). Toplantı ve çağrı kayıtları yazıya çevrilir.
Metinden konuşmaya Piper — Türkçe ses modeli varsayılan olarak gelir.
Görsel üretimi SDXL-Turbo (~6,6 GB).
Not: Görsel üretim modelinin lisansı ticari kullanımda ayrıca değerlendirilir.
Hepsi makine içinde. Belge okuma, anlamsal arama, ses çözümleme ve seslendirme için dışarıya tek bir istek gitmez — dolayısıyla bu iş yüklerinde kullanım başına ücret de yoktur.

Bölüm 4

Ne yerel, ne bulut?

Bu bir yönlendirmedir, ölçüm iddiası değil. Kesin kural değil; POC'ta kendi verinizle birlikte belirleriz.

İşÖneriNeden
KVKK / regülasyon hassas veri işleme Yerel Veri makineden çıkmaz.
Belge özetleme, sınıflandırma, etiketleme Yerel Küçük modeller bu işlerde yeterli, hacim yüksek, maliyet sıfır.
Anlamsal arama / RAG gömme üretimi Yerel Gömme modeli zaten yerel çalışır, token maliyeti yok.
OCR, ses çözümleme, seslendirme Yerel Tamamı yerel yığında.
Uzun ve çok adımlı akıl yürütme, karmaşık kod üretimi Bulut Daha büyük modeller gerekir.
Çok geniş bağlam (yüzlerce sayfa tek seferde) Bulut Yerel bağlam penceresi sınırlıdır (varsayılan 4096).
Hibrit varsayılandır. Yerel mi bulut mu diye tek seferlik bir seçim yapmak zorunda değilsiniz: aynı yönetişim kapısından hem yerel hem bulut modele gidebilirsiniz. Hassas iş yerelde kalır, ağır akıl yürütme buluta çıkar — kural sizindir.

Bölüm 5

localOnly = sözleşmeye yazılabilir garanti

Bu bir politika metni değil, teknik bir anahtar. Açıldığında sistemin davranışı değişir.

Kategorik ret

Bulut modeli listelenmez

localOnly açıkken bulut modelleri seçim listesinde görünmez. Biri yine de bulut modeli istese, istek kategorik olarak reddedilir — "yanlışlıkla dışarı gitti" senaryosu kalmaz.

Air-gap

Tam internetsiz kurulum

Her katman — çalıştırıcı ikili, dil modeli, gömme modeli, OCR, ses ve görsel — kendi yerel kaynak listesinden beslenebilir. Dış internet erişimi tamamen kapatılabilir.

Ek yönetişim

İzin listesi ve kota

Hibrit çalışsanız bile alan adı bazlı izin listesi ve günlük istek kotası tanımlanabilir. Nereye, ne kadar gidileceği yönetim kararıdır.

Anahtar yönetimi

Bulut anahtarları aşağı inmez

Bulut sağlayıcı anahtarları platform yöneticisinde kalır; müşteri alanına asla inmez ve panelde her zaman maskeli görünür.

Bölüm 6

Dayanıklılık — IT ekibinin gerçek sorusu

"Model çökerse ne olur, sunucumu kim koruyor, diskimi kim doldurur?" Cevaplar burada.

  • Model ayrı bir alt süreçte çalışır. Model çökmesi platformu asla durduramaz — iş modülleriniz çalışmaya devam eder.
  • Çökme döngüsü koruması. 5 dakikada 3 çökme olursa model durdurulur ve "daha küçük model deneyin veya GPU katman sayısını düşürün" yönlendirmesi verilir. Sonsuz yeniden başlatma döngüsü oluşmaz.
  • Boşta kalan model bellekten düşer. Varsayılan 30 dakika sonra otomatik boşaltılır; aynı anda çalışacak model sayısı sınırlanabilir.
  • Paylaşımlı model. 100'den fazla müşteri alanı aynı yüklü modeli paylaşabilir — her alan için ayrı kopya belleğe yüklenmez.
  • Model indirmeleri otomatik başlamaz. Hangi modelin ineceği ve bunun disk maliyeti operatörün kararıdır; sistem arkanızdan gigabaytlarca dosya indirmez.

Rakamları Tahmin Etmeyelim Kendi Makinenizde Ölçelim

2 haftalık POC'ta yerel modeli kendi donanımınızda çalıştırır, hangi işin yerelde hangi işin bulutta kalacağına birlikte karar veririz.

Ücretsiz POC Başvurusu