Sayfa başlığı dekoratif desen Sayfa başlığı dekoratif dalga

Kimi K3 Rehberi 2026: Moonshot AI'ın 2.8 Trilyon Parametreli Açık Ağırlık Modeli, API Kullanımı ve Self-Hosting

Ana SayfaHaberler › Kimi K3 Rehberi 2026: Moonshot AI'ın 2.8 Trilyon Par...

Kimi K3 Rehberi 2026: Moonshot AI'ın 2.8 Trilyon Parametreli Açık Ağırlık Modeli, API Kullanımı ve Self-Hosting

13.08.2026 8 görüntülenme

Açık ağırlıklı (open-weight) modeller uzun süre "ücretsiz ama zayıf" kategorisindeydi. Kimi K3 bu algıyı ciddi biçimde sarstı: Moonshot AI'ın 2,8 trilyon parametreli modeli, kodlama kıyaslamalarında kapalı kaynaklı devlerle aynı masada oturuyor. Yayınlandığı gün ön uç kod üretimi sıralamasında birinciliğe yükseldi. Alesta Web olarak bu rehberde Kimi K3 modelinin ne yaptığını, Python ile nasıl kullanacağınızı, gerçek maliyetini ve "kendi sunucumda çalıştırayım" fikrinin neden çoğu ekip için gerçekçi olmadığını rakamlarla anlatıyoruz.

Kimi K3 Nedir? (What is Kimi K3)

Kimi K3, Çinli yapay zekâ şirketi Moonshot AI tarafından Temmuz 2026'da tanıtılan büyük dil modeli. Model ağırlıkları 27 Temmuz 2026'da yayınlandı ve aynı anda vLLM tarafında üretime hazır destek geldi.

Öne çıkan üç özellik:

  • 2,8 trilyon toplam parametre — seyrek Mixture-of-Experts (MoE) mimarisi
  • 1 milyon token bağlam penceresi (tam olarak 1.048.576 token)
  • Açık ağırlık — indirebilir, inceleyebilir, ince ayar yapabilirsiniz

1 milyon token neye denk geliyor? Kabaca 700-800 bin kelime. Yani orta ölçekli bir kod tabanının tamamını, ya da bir kitabın birkaç katını tek seferde modele verebilirsiniz. Bu, uzun süren kodlama görevleri ve büyük doküman analizleri için tasarlanmış bir kapasite.

💡 Bilgi / Info:

"Açık ağırlık" (open-weight) ile "açık kaynak" (open source) aynı şey değildir. Açık ağırlık, model dosyalarının indirilebilir olması demektir. Açık kaynak ise eğitim verisi, eğitim kodu ve izin verici bir lisansı da kapsar. Bu ayrımı ticari kullanım planlıyorsanız mutlaka gözetin.

Mimari: Seyrek MoE ve Delta Attention (Architecture)

2,8 trilyon parametre rakamı korkutucu görünüyor ama işin sırrı "seyrek" (sparse) kelimesinde. Model her istek için bu parametrelerin tamamını kullanmıyor.

Mixture-of-Experts nasıl çalışır?

Toplam uzman (expert) sayisi   : 896
Her cikarim icin etkin uzman   : 16
Toplam parametre               : 2.8 trilyon
Etkin parametre                : ~%2 civari (yayinlanmadi)

Basitçe: model içinde 896 ayrı "uzman" alt ağ var. Gelen her token için bir yönlendirici (router) hangi 16 uzmanın devreye gireceğine karar veriyor. Böylece devasa bir bilgi kapasitesini, çok daha küçük bir hesaplama maliyetiyle kullanabiliyorsunuz. Matematik dersi soruyorsanız matematik uzmanları, Python kodu yazıyorsanız kod uzmanları çalışıyor — kabaca böyle düşünebilirsiniz.

Kimi Delta Attention

Modelin ikinci yeniliği dikkat mekanizmasında. Klasik dikkat (attention) mekanizmasında maliyet, dizi uzunluğunun karesiyle artar. 1 milyon token bağlamda bu, pratikte imkânsız bir hesaplama yükü demek. Kimi Delta Attention, uzun dizilerde bu maliyeti düşürmek için tasarlanmış bir yaklaşım.

Buna ek olarak "attention residuals" adı verilen bir teknik, çok derin ağlarda eğitim kararlılığını artırıyor. Bu tür modellerde eğitim sırasında sinyalin kaybolması (ya da patlaması) klasik bir problemdir; artık bağlantılar bunu yumuşatıyor.

Kıyaslama Sonuçları: Gerçekten İyi mi? (Benchmarks)

Rakamlara bakalım. Aşağıdaki sonuçlar Moonshot'ın kendi yayınladığı ve bağımsız kıyaslama platformlarının ölçtüğü değerlerin karışımı — kaynağını belirterek veriyoruz.

Kıyaslama / Benchmark Skor Ne ölçüyor
Terminal-Bench 2.1 88,3 Terminal/ajan görevleri
FrontierSWE 81,2 Yazılım mühendisliği görevleri
ProgramBench (ham başarı) 77,8 Program yazma
Vals Index %74,70 (2. sıra) Bağımsız genel değerlendirme
DeepSWE 67,5 Derin yazılım görevleri
Artificial Analysis Index 57 (4. sıra) Bağımsız zekâ endeksi
SWE Marathon 42,0 Uzun soluklu görevler

Yayınlandığı gün Arena ön yüz kod üretimi sıralamasında birinci sıraya çıkması, özellikle arayüz kodu üretiminde güçlü olduğunu gösteriyor. Genel zekâ endekslerinde ise dördüncü sırada — yani en iyi değil, ama en iyilerin arasında. Alesta Web olarak yaptığımız denemelerde de en belirgin fark, uzun bağlamlı görevlerde ortaya çıktı: küçük ve izole bir fonksiyon yazdırırken aradaki fark hissedilmiyor, ama binlerce satırlık bir modülü analiz ettirdiğinizde açılıyor.

⚠️ Dikkat / Warning:

Kıyaslama skorlarını mutlak gerçek olarak okumayın. Model geliştiricileri kendi ölçümlerini yayınlarken en iyi yapılandırmayı kullanır. Ayrıca üretim hızı da önemli: ölçümlerde çıktı hızı saniyede ~62 token, ilk token'a kadar geçen süre ~2 saniye. İnteraktif bir sohbet arayüzü için bu iyi; saniyeler mertebesinde yanıt bekleyen bir üretim servisi için değerlendirme yapmanız gerekir.

Python ile API Kullanımı (API Usage with Python)

İyi haber: API, OpenAI uyumlu bir arayüz sunuyor. Mevcut kodunuzda yalnızca base_url ve model adını değiştirmeniz yeterli.

Adım 1: Kurulum

pip install openai
export MOONSHOT_API_KEY="anahtariniz"

Adım 2: İlk istek

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.ai/v1",
)

yanit = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "system", "content": "Sen deneyimli bir Python gelistiricisisin."},
        {"role": "user", "content": "Bir CSV dosyasini okuyup eksik degerleri "
                                    "sutun ortalamasiyla dolduran fonksiyon yaz."}
    ],
    reasoning_effort="medium",
)

print(yanit.choices[0].message.content)

Adım 3: Uzun bağlam kullanımı

# 1 milyon token'lik pencereyi kullanma ornegi
def kod_tabani_yukle(dizin):
    parcalar = []
    for kok, _, dosyalar in os.walk(dizin):
        for d in dosyalar:
            if d.endswith((".py", ".js", ".ts")):
                yol = os.path.join(kok, d)
                with open(yol, encoding="utf-8", errors="ignore") as f:
                    parcalar.append(f"# DOSYA: {yol}\n" + f.read())
    return "\n\n".join(parcalar)

kod = kod_tabani_yukle("./src")

yanit = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "user", "content": f"{kod}\n\nBu kod tabaninda guvenlik "
                                    f"acigi olabilecek yerleri listele."}
    ],
    reasoning_effort="high",
)

Adım 4: Akış (streaming) ile yanıt alma

akis = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Redis onbellek stratejilerini anlat."}],
    stream=True,
)

for parca in akis:
    icerik = parca.choices[0].delta.content
    if icerik:
        print(icerik, end="", flush=True)

reasoning_effort parametresi modelin ne kadar "düşüneceğini" ayarlıyor. Basit görevlerde low, karmaşık hata ayıklamada high ya da max kullanın. Bu doğrudan maliyetinizi etkiler — daha fazla düşünme, daha fazla çıktı token'ı demektir.

Maliyet Hesabı ve Önbellek (Pricing and Caching)

Token Türü Milyon token başına
Girdi — önbellek isabeti (cache hit) 0,30 $
Girdi — önbellek ıskası (cache miss) 3,00 $
Çıktı (output) 15,00 $

Buradaki en kritik satır ilk ikisi arasındaki fark: 10 kat. Önbellek isabeti, aynı girdi ön ekini tekrar gönderdiğinizde devreye giriyor. Uzun bağlamlı senaryolarda bu fark, faturanızı belirleyen tek unsur haline gelebilir.

Örnek hesap: kod tabanı analizi

Senaryo: 500.000 token'lik kod tabani, gunde 20 soru

Onbelleksiz (her seferinde tam gonderim):
  500.000 x 20 = 10.000.000 girdi token
  10 x 3,00 $ = 30,00 $ / gun

Onbellekli (kod tabani sabit, sadece soru degisiyor):
  Ilk istek : 0,5 x 3,00 $ =  1,50 $
  19 istek  : 9,5 x 0,30 $ =  2,85 $
  Toplam    : 4,35 $ / gun

Kazanc: yaklasik 7 kat
✅ Alesta Web İpucu:

Önbelleği kullanabilmek için değişmeyen içeriği (sistem talimatı, doküman, kod tabanı) mesaj dizisinin başına, değişen kısmı (kullanıcı sorusu) sonuna koyun. Sırayı karıştırırsanız önbellek ön eki tutmaz ve tam ücret ödersiniz. Müşteri projelerinde en sık gördüğümüz maliyet hatası budur.

Kendi Sunucunuzda Çalıştırmak (Self-Hosting Reality Check)

"Açık ağırlık, o zaman kendi sunucuma kurarım" cümlesi kulağa hoş geliyor. Rakamlara bakalım.

Donanım gereksinimleri

Model agirliklari (MXFP4)  : ~1,4 TB
Onerilen yapilandirma      : 64+ hizlandiriciya sahip supernode
Tek H100 / H200 / B200     : YETERSIZ
Tuketici donanimi          : Soz konusu degil

1,4 terabaytlık model ağırlığından bahsediyoruz. Bu, tek bir sunucuya sığmaz; birden fazla düğüme dağıtılmış, yüksek hızlı ara bağlantıya sahip bir küme gerekir. Böyle bir donanımın satın alma maliyeti milyonlarca dolar, bulut üzerinden kiralama maliyeti ise saatlik yüzlerce dolar seviyesindedir.

vLLM ile dağıtım (uygun donanımınız varsa)

# vLLM kurulumu
pip install vllm

# Cok dugumlu sunum (ornek iskelet)
vllm serve moonshotai/Kimi-K3 \
  --tensor-parallel-size 8 \
  --pipeline-parallel-size 8 \
  --max-model-len 1048576 \
  --trust-remote-code

# OpenAI uyumlu uc nokta: http://localhost:8000/v1
⚠️ Gerçekçi olalım / Reality check:

Kimi K3'ü kendi altyapınızda çalıştırmak, veri egemenliği zorunluluğu olan büyük kuruluşlar dışında ekonomik değil. Küçük ve orta ölçekli ekipler için doğru yol API kullanmaktır. Açık ağırlık olmasının asıl değeri "herkes kurabilir" değil, tek bir sağlayıcıya kilitlenmemeniz — istediğiniz zaman başka bir barındırma sağlayıcısına taşıyabilirsiniz.

Yerel çalıştırma isteğiniz varsa gerçekçi alternatif, daha küçük açık modelleri kullanmaktır. 7B-70B aralığındaki modeller tüketici ya da tek sunucu donanımında çalışır ve birçok görev için fazlasıyla yeterlidir.

Lisans Durumu ve Dikkat Edilecekler (License Notes)

Burada dürüst olmak gerekiyor: kaynaklar arasında tutarsızlık var. Bazı analizler ağırlıkların 27 Temmuz 2026'da yayınlandığını belirtirken, bazıları yayın tarihinde lisans metninin henüz kamuya açılmadığını not düşüyor.

Pratik tavsiyemiz şu:

  • ✅ Ticari kullanım öncesi resmî model deposundaki lisans dosyasını okuyun
  • ✅ İnce ayar (fine-tuning) yapıp dağıtacaksanız türev çalışma koşullarına bakın
  • ✅ Müşteri verisiyle çalışacaksanız API sağlayıcısının veri saklama politikasını inceleyin
  • ✅ Kurumsal projede kullanacaksanız hukuk biriminizden görüş alın

Alesta Web olarak müşteri projelerinde model seçerken teknik performans kadar lisans netliğine de bakıyoruz. Kıyaslamada birinci olan bir model, kullanım koşulları belirsizse kurumsal bir projede risk demektir.

Kimin İçin Uygun? (Who Should Use Kimi K3)

✅ Uygun senaryolar

* Buyuk kod tabanlarinda analiz ve refactor gorevleri
* Uzun dokuman isleme (sozlesme, teknik dokumantasyon)
* Ajan tabanli otomasyon (terminal gorevleri)
* On yuz kod uretimi
* Saglayici bagimliligini azaltmak isteyen ekipler

❌ Daha az uygun senaryolar

* Milisaniye seviyesinde yanit gereken uygulamalar
* Cok basit siniflandirma/etiketleme isleri (pahali kalir)
* Tuketici donaniminda yerel calistirma hedefi
* Lisans netligi zorunlu, katii regulasyonlu sektorler

📚 Kaynaklar ve Referanslar / Sources and References

Bu rehberdeki teknik veriler aşağıdaki kaynaklardan derlenmiş, çelişkili noktalar makale içinde ayrıca belirtilmiştir:

✅ Özetle: Kullanmalı mısınız? (Should You Use It?)

Kimi K3, açık ağırlıklı modellerin artık ikinci lig olmadığını gösteren bir örnek. Özellikle uzun bağlam gerektiren kodlama görevlerinde güçlü. Alesta Web olarak önerimiz: API üzerinden başlayın, önbelleği doğru kurgulayın, self-hosting fikrini ancak gerçek bir zorunluluk varsa masaya koyun.

Hızlı Özet / Quick Summary:

  • ✅ 2,8 trilyon parametre, 896 uzman, çıkarım başına 16 aktif uzman
  • ✅ 1 milyon token bağlam — kod tabanı ölçeğinde analiz mümkün
  • ✅ Terminal-Bench 2.1'de 88,3; ön yüz kod üretiminde ilk sıra
  • ✅ OpenAI uyumlu API — mevcut kodda sadece base_url değişiyor
  • 💰 Önbellek isabeti ile girdi maliyeti 10 kat düşüyor — sıralamaya dikkat
  • ⚠️ Self-hosting için ~1,4 TB ağırlık + 64+ hızlandırıcı gerekiyor
  • ⚠️ Ticari kullanım öncesi lisans metnini mutlaka doğrulayın

Faydalı Bağlantılar / Useful Links:

  • Alesta Web Ana Sayfa: alestaweb.com — yapay zekâ entegrasyonu ve yazılım çözümleri
  • Diğer Yapay Zekâ Rehberleri: alestaweb.com/haberler — model, API ve otomasyon içerikleri

Kendi uygulamanıza yapay zekâ entegrasyonu planlıyor ve hangi modelin işinize uygun olduğuna karar veremiyorsanız, Alesta Web ekibi alestaweb.com üzerinden maliyet ve performans analizi yapabilir.

© 2026 Alesta Web — Tüm hakları saklıdır.

Etiketler: Haberler