Ulaşım
- Adres: Kazımdirik Mah. 296.Sokak Ofis:1 No:314 Folkart Time | Bornova / İzmir
- Telefon:
0505 532 36 38 - eMail: admin@alestaweb.com
Açık ağırlıklı (open-weight) modeller uzun süre "ücretsiz ama zayıf" kategorisindeydi. Kimi K3 bu algıyı ciddi biçimde sarstı: Moonshot AI'ın 2,8 trilyon parametreli modeli, kodlama kıyaslamalarında kapalı kaynaklı devlerle aynı masada oturuyor. Yayınlandığı gün ön uç kod üretimi sıralamasında birinciliğe yükseldi. Alesta Web olarak bu rehberde Kimi K3 modelinin ne yaptığını, Python ile nasıl kullanacağınızı, gerçek maliyetini ve "kendi sunucumda çalıştırayım" fikrinin neden çoğu ekip için gerçekçi olmadığını rakamlarla anlatıyoruz.
Kimi K3, Çinli yapay zekâ şirketi Moonshot AI tarafından Temmuz 2026'da tanıtılan büyük dil modeli. Model ağırlıkları 27 Temmuz 2026'da yayınlandı ve aynı anda vLLM tarafında üretime hazır destek geldi.
Öne çıkan üç özellik:
1 milyon token neye denk geliyor? Kabaca 700-800 bin kelime. Yani orta ölçekli bir kod tabanının tamamını, ya da bir kitabın birkaç katını tek seferde modele verebilirsiniz. Bu, uzun süren kodlama görevleri ve büyük doküman analizleri için tasarlanmış bir kapasite.
"Açık ağırlık" (open-weight) ile "açık kaynak" (open source) aynı şey değildir. Açık ağırlık, model dosyalarının indirilebilir olması demektir. Açık kaynak ise eğitim verisi, eğitim kodu ve izin verici bir lisansı da kapsar. Bu ayrımı ticari kullanım planlıyorsanız mutlaka gözetin.
2,8 trilyon parametre rakamı korkutucu görünüyor ama işin sırrı "seyrek" (sparse) kelimesinde. Model her istek için bu parametrelerin tamamını kullanmıyor.
Toplam uzman (expert) sayisi : 896 Her cikarim icin etkin uzman : 16 Toplam parametre : 2.8 trilyon Etkin parametre : ~%2 civari (yayinlanmadi)
Basitçe: model içinde 896 ayrı "uzman" alt ağ var. Gelen her token için bir yönlendirici (router) hangi 16 uzmanın devreye gireceğine karar veriyor. Böylece devasa bir bilgi kapasitesini, çok daha küçük bir hesaplama maliyetiyle kullanabiliyorsunuz. Matematik dersi soruyorsanız matematik uzmanları, Python kodu yazıyorsanız kod uzmanları çalışıyor — kabaca böyle düşünebilirsiniz.
Modelin ikinci yeniliği dikkat mekanizmasında. Klasik dikkat (attention) mekanizmasında maliyet, dizi uzunluğunun karesiyle artar. 1 milyon token bağlamda bu, pratikte imkânsız bir hesaplama yükü demek. Kimi Delta Attention, uzun dizilerde bu maliyeti düşürmek için tasarlanmış bir yaklaşım.
Buna ek olarak "attention residuals" adı verilen bir teknik, çok derin ağlarda eğitim kararlılığını artırıyor. Bu tür modellerde eğitim sırasında sinyalin kaybolması (ya da patlaması) klasik bir problemdir; artık bağlantılar bunu yumuşatıyor.
Rakamlara bakalım. Aşağıdaki sonuçlar Moonshot'ın kendi yayınladığı ve bağımsız kıyaslama platformlarının ölçtüğü değerlerin karışımı — kaynağını belirterek veriyoruz.
| Kıyaslama / Benchmark | Skor | Ne ölçüyor |
|---|---|---|
| Terminal-Bench 2.1 | 88,3 | Terminal/ajan görevleri |
| FrontierSWE | 81,2 | Yazılım mühendisliği görevleri |
| ProgramBench (ham başarı) | 77,8 | Program yazma |
| Vals Index | %74,70 (2. sıra) | Bağımsız genel değerlendirme |
| DeepSWE | 67,5 | Derin yazılım görevleri |
| Artificial Analysis Index | 57 (4. sıra) | Bağımsız zekâ endeksi |
| SWE Marathon | 42,0 | Uzun soluklu görevler |
Yayınlandığı gün Arena ön yüz kod üretimi sıralamasında birinci sıraya çıkması, özellikle arayüz kodu üretiminde güçlü olduğunu gösteriyor. Genel zekâ endekslerinde ise dördüncü sırada — yani en iyi değil, ama en iyilerin arasında. Alesta Web olarak yaptığımız denemelerde de en belirgin fark, uzun bağlamlı görevlerde ortaya çıktı: küçük ve izole bir fonksiyon yazdırırken aradaki fark hissedilmiyor, ama binlerce satırlık bir modülü analiz ettirdiğinizde açılıyor.
Kıyaslama skorlarını mutlak gerçek olarak okumayın. Model geliştiricileri kendi ölçümlerini yayınlarken en iyi yapılandırmayı kullanır. Ayrıca üretim hızı da önemli: ölçümlerde çıktı hızı saniyede ~62 token, ilk token'a kadar geçen süre ~2 saniye. İnteraktif bir sohbet arayüzü için bu iyi; saniyeler mertebesinde yanıt bekleyen bir üretim servisi için değerlendirme yapmanız gerekir.
İyi haber: API, OpenAI uyumlu bir arayüz sunuyor. Mevcut kodunuzda yalnızca base_url ve model adını değiştirmeniz yeterli.
pip install openai export MOONSHOT_API_KEY="anahtariniz"
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
yanit = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "system", "content": "Sen deneyimli bir Python gelistiricisisin."},
{"role": "user", "content": "Bir CSV dosyasini okuyup eksik degerleri "
"sutun ortalamasiyla dolduran fonksiyon yaz."}
],
reasoning_effort="medium",
)
print(yanit.choices[0].message.content)
# 1 milyon token'lik pencereyi kullanma ornegi
def kod_tabani_yukle(dizin):
parcalar = []
for kok, _, dosyalar in os.walk(dizin):
for d in dosyalar:
if d.endswith((".py", ".js", ".ts")):
yol = os.path.join(kok, d)
with open(yol, encoding="utf-8", errors="ignore") as f:
parcalar.append(f"# DOSYA: {yol}\n" + f.read())
return "\n\n".join(parcalar)
kod = kod_tabani_yukle("./src")
yanit = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "user", "content": f"{kod}\n\nBu kod tabaninda guvenlik "
f"acigi olabilecek yerleri listele."}
],
reasoning_effort="high",
)
akis = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Redis onbellek stratejilerini anlat."}],
stream=True,
)
for parca in akis:
icerik = parca.choices[0].delta.content
if icerik:
print(icerik, end="", flush=True)
reasoning_effort parametresi modelin ne kadar "düşüneceğini" ayarlıyor. Basit görevlerde low, karmaşık hata ayıklamada high ya da max kullanın. Bu doğrudan maliyetinizi etkiler — daha fazla düşünme, daha fazla çıktı token'ı demektir.
| Token Türü | Milyon token başına |
|---|---|
| Girdi — önbellek isabeti (cache hit) | 0,30 $ |
| Girdi — önbellek ıskası (cache miss) | 3,00 $ |
| Çıktı (output) | 15,00 $ |
Buradaki en kritik satır ilk ikisi arasındaki fark: 10 kat. Önbellek isabeti, aynı girdi ön ekini tekrar gönderdiğinizde devreye giriyor. Uzun bağlamlı senaryolarda bu fark, faturanızı belirleyen tek unsur haline gelebilir.
Senaryo: 500.000 token'lik kod tabani, gunde 20 soru Onbelleksiz (her seferinde tam gonderim): 500.000 x 20 = 10.000.000 girdi token 10 x 3,00 $ = 30,00 $ / gun Onbellekli (kod tabani sabit, sadece soru degisiyor): Ilk istek : 0,5 x 3,00 $ = 1,50 $ 19 istek : 9,5 x 0,30 $ = 2,85 $ Toplam : 4,35 $ / gun Kazanc: yaklasik 7 kat
Önbelleği kullanabilmek için değişmeyen içeriği (sistem talimatı, doküman, kod tabanı) mesaj dizisinin başına, değişen kısmı (kullanıcı sorusu) sonuna koyun. Sırayı karıştırırsanız önbellek ön eki tutmaz ve tam ücret ödersiniz. Müşteri projelerinde en sık gördüğümüz maliyet hatası budur.
"Açık ağırlık, o zaman kendi sunucuma kurarım" cümlesi kulağa hoş geliyor. Rakamlara bakalım.
Model agirliklari (MXFP4) : ~1,4 TB Onerilen yapilandirma : 64+ hizlandiriciya sahip supernode Tek H100 / H200 / B200 : YETERSIZ Tuketici donanimi : Soz konusu degil
1,4 terabaytlık model ağırlığından bahsediyoruz. Bu, tek bir sunucuya sığmaz; birden fazla düğüme dağıtılmış, yüksek hızlı ara bağlantıya sahip bir küme gerekir. Böyle bir donanımın satın alma maliyeti milyonlarca dolar, bulut üzerinden kiralama maliyeti ise saatlik yüzlerce dolar seviyesindedir.
# vLLM kurulumu pip install vllm # Cok dugumlu sunum (ornek iskelet) vllm serve moonshotai/Kimi-K3 \ --tensor-parallel-size 8 \ --pipeline-parallel-size 8 \ --max-model-len 1048576 \ --trust-remote-code # OpenAI uyumlu uc nokta: http://localhost:8000/v1
Kimi K3'ü kendi altyapınızda çalıştırmak, veri egemenliği zorunluluğu olan büyük kuruluşlar dışında ekonomik değil. Küçük ve orta ölçekli ekipler için doğru yol API kullanmaktır. Açık ağırlık olmasının asıl değeri "herkes kurabilir" değil, tek bir sağlayıcıya kilitlenmemeniz — istediğiniz zaman başka bir barındırma sağlayıcısına taşıyabilirsiniz.
Yerel çalıştırma isteğiniz varsa gerçekçi alternatif, daha küçük açık modelleri kullanmaktır. 7B-70B aralığındaki modeller tüketici ya da tek sunucu donanımında çalışır ve birçok görev için fazlasıyla yeterlidir.
Burada dürüst olmak gerekiyor: kaynaklar arasında tutarsızlık var. Bazı analizler ağırlıkların 27 Temmuz 2026'da yayınlandığını belirtirken, bazıları yayın tarihinde lisans metninin henüz kamuya açılmadığını not düşüyor.
Pratik tavsiyemiz şu:
Alesta Web olarak müşteri projelerinde model seçerken teknik performans kadar lisans netliğine de bakıyoruz. Kıyaslamada birinci olan bir model, kullanım koşulları belirsizse kurumsal bir projede risk demektir.
* Buyuk kod tabanlarinda analiz ve refactor gorevleri * Uzun dokuman isleme (sozlesme, teknik dokumantasyon) * Ajan tabanli otomasyon (terminal gorevleri) * On yuz kod uretimi * Saglayici bagimliligini azaltmak isteyen ekipler
* Milisaniye seviyesinde yanit gereken uygulamalar * Cok basit siniflandirma/etiketleme isleri (pahali kalir) * Tuketici donaniminda yerel calistirma hedefi * Lisans netligi zorunlu, katii regulasyonlu sektorler
Bu rehberdeki teknik veriler aşağıdaki kaynaklardan derlenmiş, çelişkili noktalar makale içinde ayrıca belirtilmiştir:
Kimi K3, açık ağırlıklı modellerin artık ikinci lig olmadığını gösteren bir örnek. Özellikle uzun bağlam gerektiren kodlama görevlerinde güçlü. Alesta Web olarak önerimiz: API üzerinden başlayın, önbelleği doğru kurgulayın, self-hosting fikrini ancak gerçek bir zorunluluk varsa masaya koyun.
Hızlı Özet / Quick Summary:
base_url değişiyorFaydalı Bağlantılar / Useful Links:
Kendi uygulamanıza yapay zekâ entegrasyonu planlıyor ve hangi modelin işinize uygun olduğuna karar veremiyorsanız, Alesta Web ekibi alestaweb.com üzerinden maliyet ve performans analizi yapabilir.
© 2026 Alesta Web — Tüm hakları saklıdır.