İçeriğe geç

DeepSeek-R1 ve V3 Devrimi: Açık Kaynak Akıl Yürütme Modelleri Neden Piyasayı Sarstı?

Karanlık laboratuvarda iki mavi yapay zekâ çekirdeği ve GPU sunucu rafları

Özet

DeepSeek R1 nedir? DeepSeek-R1, Çin merkezli DeepSeek’in Ocak 2025’te yayımladığı, DeepSeek-V3-Base üzerine pekiştirmeli öğrenme (reinforcement learning) ile eğitilmiş açık ağırlıklı bir akıl yürütme (reasoning) modelidir. Amaç, matematik, kod ve çok adımlı mantık görevlerinde ara çözüm adımlarını üretip doğrulanabilir sonuca ulaşmaktır.

DeepSeek Neden Bir Gecede Yapay Zekâ Dünyasının Merkezine Oturdu?

2024 sonundaki DeepSeek-V3 ve 2025 başındaki R1, sektörü üç nedenle sarstı. Birincisi mimari verimlilikti: V3, 671 milyar toplam parametreli bir Mixture-of-Experts (MoE) modelidir ama token başına yaklaşık 37 milyar parametre aktiftir. İkincisi eğitim ve erişim stratejisiydi: ağırlıklar indirilebilir hâle geldi, API fiyatları aynı dönemin kapalı reasoning modellerine göre çok daha düşüktü. Üçüncüsü, R1’in üretici ölçümlerinde OpenAI o1 ile aynı bantta sonuçlar göstermesiydi. Tartışma “Çinli bir şirket ABD’yi yendi” cümlesine indirgenmemelidir. Asıl soru şudur: sınır seviye performans, daha az aktif hesap, açık ağırlık ve agresif API fiyatıyla birleşince model geliştirme ve inference ekonomisi nasıl değişir?

DeepSeek nedir ve kim tarafından geliştirildi?

DeepSeek (Hangzhou DeepSeek Artificial Intelligence Basic Technology Research), Temmuz 2023’te Hangzhou’da kuruldu. Kurucu ve CEO Liang Wenfeng’dir. Şirket, Liang’ın 2015’te ortak kurduğu nicel hedge fon High-Flyer (Hangzhou Huanfang) ekosisteminden doğdu. Reuters’in Ocak 2025 raporuna göre High-Flyer, 2023’te AGI odaklı bir araştırma hattını DeepSeek olarak bağımsızlaştırdı; High-Flyer ana yatırımcı ve destekçi konumundadır.

Model hattı, Dense ve MoE deneylerinden V2, ardından Aralık 2024’te V3 ve Ocak 2025’te R1 / R1-Zero’ya uzanır. Yaklaşımın ayırt edici yanı, sınır performans iddiasını yalnızca kapalı bir API’nin arkasına kilitlememesidir. Ağırlıklar Hugging Face ve GitHub üzerinden paylaşılır; eğitim verisi ve tam eğitim kodu aynı şekilde “açık kaynak” sayılmaz. Bu ayrım, sitedeki DeepSeek ve Qwen 2026 karşılaştırmasında da vurgulanır: indirilebilir ağırlık, OSI anlamında açık kaynak değildir.

2025’te DeepSeek neden dünya gündemine girdi?

Üç dönemi ayırmak gerekir.

Dönem 1 — 2024 sonu: DeepSeek-V3 teknik raporu (arXiv:2412.19437) modeli 671B toplam / 37B aktif MoE olarak tanımlar. 14,8 trilyon token ile ön eğitim, MLA, DeepSeekMoE, yardımcı kayıpsız yük dengeleme ve çok tokenlı tahmin (MTP) öne çıkar. Bağlam uzunluğu 128K olarak kartlanır.

Dönem 2 — Ocak 2025: DeepSeek-R1 ve R1-Zero (arXiv:2501.12948) duyurulur. Uygulama mağazalarında sohbet istemcisinin yükselmesi, o1 ile kıyaslanan üretici skorları ve düşük API fiyatı aynı haftada birikir. 27 Ocak 2025’te Reuters’e göre NVIDIA hissesi yaklaşık yüzde 17 düşer; şirket bir günde yaklaşık 593 milyar dolar piyasa değeri kaybeder. Bu, tek nedene bağlanamaz; yatırımcıların “daha ucuz model = daha az GPU talebi” varsayımını fiyatlamasıdır.

Dönem 3 — 2025–2026 sonrası: DeepSeek API’si V3.1, V4 Flash / Pro gibi yeni kimliklere evrilir. 11 Ekim 2026 itibarıyla resmi fiyat sayfasında deepseek-flash (DeepSeek-V4.1-Flash) ve deepseek-v4-pro listelenir; orijinal deepseek-chat / deepseek-reasoner (V3 / R1) ürün hattı tarihseldir. R1/V3’ün uzun vadeli etkisi, fiyat rekabeti, açık ağırlıklı reasoning ve “test-time compute” tartışmasını kalıcılaştırmasıdır.

DeepSeek’in düşük maliyet yaklaşımı neyi değiştirdi?

V3 raporunda resmi eğitim hesabı şöyledir: tam eğitim 2,788 milyon H800 GPU-saat; H800 saati 2 dolar varsayımıyla yaklaşık 5,576 milyon dolar. Metin açıkça belirtir: bu tutar önceki mimari deneyleri, ablations ve veri Ar-Ge’sini kapsamaz. Eylül 2025’te Nature’da yayımlanan R1 makalesinin eklerinde geçen yaklaşık 294 bin dolarlık rakam, R1 sonrası RL aşamasının GPU hesabına aittir; V3 ön eğitimini içermez. The Register’ın özetlediği gibi, “R1 294 bin dolara eğitildi” başlığı sıkça yanlış kategoriyi ölçer.

NVIDIA ve yapay zekâ piyasası neden etkilendi?

Piyasa, eğitim maliyetinin düşmesinin altyapı talebini azaltacağını fiyatladı. Teknik olarak iki karşı kuvvet vardır. Verimli eğitim, birim model başına GPU ihtiyacını azaltabilir. Ama ucuz ve iyi reasoning, kullanım hacmini artırabilir (Jevons paradoksu tartışması). NVIDIA’nın 27 Ocak 2025 açıklamasında R1 “test-time scaling” örneği olarak anılır; çıkarımın hâlâ çok sayıda GPU ve yüksek performanslı ağ gerektirdiği vurgulanır. Borsa hareketi gözlemdir; “GPU talebi kalıcı çöktü” sonucu değildir.

Eğitim ve çıkarım altyapısında CPU–GPU dengesi ayrı bir konudur. NVIDIA Vera CPU yazısında da işlendiği gibi, ajan ve RL iş yüklerinde GPU’yu besleyen orkestrasyon, KV önbelleği ve araç çağrıları CPU tarafını büyütür. DeepSeek’in verimli MoE’si bu denklemi silmez; hangi katmanda ne kadar silikon gerektiğini yeniden tartışmaya açar.


DeepSeek-V3 ve DeepSeek-R1 Arasındaki Yapısal Farklar

DeepSeek-V3 nedir?

DeepSeek-V3, Genel amaçlı güçlü bir MoE dil modelidir. Teknik rapora göre:

  • Toplam parametre: 671 milyar
  • Token başına aktif parametre: yaklaşık 37 milyar
  • Ön eğitim: 14,8 trilyon token
  • Dikkat: Multi-head Latent Attention (MLA)
  • Uzman yönlendirme: DeepSeekMoE + yardımcı kayıpsız yük dengeleme
  • Ek hedef: Multi-Token Prediction (MTP)
  • Eğitim: FP8 karışık hassasiyet çerçevesi
  • Bağlam: 128K
  • Dağıtım: DeepSeek-V3-Base ve sohbet/ince ayarlı DeepSeek-V3 ağırlıkları açık

V3’ün “devrimi”, parametre sayısını şişirmek değil; bellek ve iletişim maliyetini yönetirken aktif FLOP’u sınırlı tutmaktır.

Mixture-of-Experts mimarisi nasıl çalışır?

Yoğun (dense) Transformer’da her token, neredeyse tüm parametreleri çalıştırır. MoE’de besleme-ileri (FFN) katmanları uzmanlara bölünür. Bir yönlendirici (router), token’ı birkaç uzmana yollar; diğer uzmanlar o adımda hesaplamaya girmez.

Somut örnek: V3’te bilgi kapasitesi 671B parametrede durur. Ama tek bir token için yaklaşık 37B parametre yanar. Bu, “671B’lik model her seferinde 671B hesap yapar” anlamına gelmez. Avantaj: token başına FLOP düşer, uzmanlaşma artabilir. Sınırlama: tüm ağırlıkları yine saklamanız gerekir; aktif parametre düşük diye VRAM ihtiyacı aynı oranda düşmez. Dağıtık çıkarımda uzmanlar arası iletişim ve yük dengesizliği ek maliyet üretir. V3’ün auxiliary-loss-free dengelemesi, uzmanların aşırı dolmasını klasik yardımcı kayıp yerine bias güncellemesiyle yönetmeyi hedefler.

671 milyar parametre ve 37 milyar aktif parametre ne anlama gelir?

KavramAnlamıPratik sonuç
Toplam parametre (671B)Modelde saklanan ağırlık hacmiDisk, bellek ve dağıtım maliyeti
Aktif parametre (~37B)Token başına hesaplanan ağırlıkGecikme ve token başına FLOP
MTP modülüRapor/README’de ek ~14BHugging Face toplam boyutu ~685B diye geçer

Aktif parametreyi “küçük model” sanmak yanlıştır. Küçük dense bir 37B model ile 671B MoE’nin 37B aktifi aynı şey değildir; ikincisi çok daha büyük bir uzman havuzundan seçim yapar.

MLA ve KV Cache optimizasyonu

Standart çok kafalı dikkatte her katman için anahtar/değer (KV) önbelleği hızla büyür; uzun bağlamda bellek duvarı oluşur. MLA, dikkat için düşük boyutlu gizli (latent) temsiller kullanır; KV’yi sıkıştırılmış biçimde tutmayı amaçlar. Sonuç: uzun bağlamlı çıkarımda bellek baskısı azalabilir. Bu, “sınırsız bağlam bedava” demek değildir. Context window kartta 128K’dır; pratik maliyet hâlâ dizi uzunluğuna bağlıdır.

DeepSeek-R1 ve R1-Zero arasındaki fark

Kritik ayrım eğitim boru hattındadır.

DeepSeek-R1-Zero: DeepSeek-V3-Base üzerine, supervised fine-tuning (SFT) olmadan doğrudan Group Relative Policy Optimization (GRPO) ile RL uygulanır. Amaç, insan yazımı reasoning örnekleri olmadan modelin ödül sinyaliyle akıl yürütme davranışı geliştirip geliştiremeyeceğini araştırmaktır. Rapor, AIME 2024 pass@1’in yüzde 15,6’dan yüzde 71,0’e çıktığını; majority voting ile yüzde 86,7’ye çıktığını yazar. Emergent davranışlar (öz-doğrulama, yansıma, uzayan çözüm) gözlenir. Aynı zamanda okunabilirlik sorunları, dil karışması ve tekrar üretme gibi yan etkiler raporlanır. “İnsan verisi hiç yok” iddiası yanlıştır: ön eğitim verisi vardır; eksik olan, RL öncesi reasoning SFT’sidir.

DeepSeek-R1: Cold-start verisi ile Base’e SFT, ardından reasoning odaklı RL, rejection sampling ile SFT verisi toplama, yazma/FA gibi alanlarda V3 tarzı verilerle yeniden eğitim ve ek RL aşamaları içeren çok aşamalı boru hattıdır. Nihai ürün, R1-Zero’nun ham RL deneyinden daha okunabilir ve genel kullanım için dengelenmiş bir reasoning modelidir.

Her iki model de mimari olarak V3 ailesinin 671B / 37B MoE omurgasını paylaşır. Fark, post-training’dedir.

V3, R1 ve R1-Zero karşılaştırma tablosu

ModelTemel amaçMimari temelEğitim yaklaşımıReasoningAvantajlarSınırlamalar
DeepSeek-V3Genel amaçlı güçlü LLM671B MoE, ~37B aktif, MLA, MTP14,8T ön eğitim + SFT + RLGüçlü ama reasoning-özel değilGeniş görev spektrumu, açık ağırlıkUzun çok adımlı sınavlarda R1 kadar optimize değil
DeepSeek-R1-ZeroSaf RL ile reasoning araştırmasıV3-BaseSFT’siz GRPOÇok yüksek (ölçümlerde)Emergent CoT, araştırma değeriOkunabilirlik, dil karışması; ürün deneyimi ham
DeepSeek-R1Ürünleşmiş reasoning modeliV3-Base + çok aşamalı post-trainingCold-start SFT + RL + rejection sampling + ek RLo1 bandı (üretici ölçüm)Kullanılabilirlik + skor dengesi, distill serisiUzun CoT maliyeti; mühendislik RL verisi sınırlı (rapor notu)

“Düşünme” Süreci: Akıl Yürütme (Chain of Thought) Nasıl Çalışır?

Chain of Thought nedir?

Chain of Thought (CoT), modelin nihai cevaptan önce ara adımlar üretmesidir. Standart sohbet modeli çoğu zaman doğrudan cevap token’larına geçer. Reasoning modeli, test anında daha fazla token (ve dolayısıyla daha fazla hesap) harcayarak alternatif yolları, kontrolleri ve ara sonuçları yazabilir.

Görünür CoT, modelin iç matris çarpımlarının birebir kaydı değildir. Metinsel bir ara çıktıdır. “İnsan gibi bilinçli düşünüyor” anlamına gelmez. Daha uzun iz her zaman daha doğru sonuç da üretmez; bazen maliyeti şişirir, bazen hatayı uzatır.

R1-Zero pekiştirmeli öğrenmeyle nasıl geliştirildi?

Pekiştirmeli öğrenmede bir politika (policy) eylem üretir; ödül (reward) sinyali bu eylemi puanlar; optimizasyon politikayı yüksek ödüle kaydırır. Klasik LLM SFT’sinde doğru cevap metni taklit edilir. RL’de ise doğrulanabilir görevlerde (ör. matematik cevabının doğruluğu, kod testinin geçmesi) kural tabanlı ödüller kullanılabilir.

R1-Zero’da DeepSeek, insan yazımı adım adım çözümleri SFT olarak vermeden GRPO uygular. Model, doğru sonuca giden uzun izleri ödüllendirildikçe uzatır; kendi kendini kontrol etme benzeri davranışlar ortaya çıkar. Raporun “aha moment” anlatısı, modelin çözüm içinde strateji değiştirme kalıplarının RL sırasında belirmesidir; mistik bir bilinç iddiası değildir.

GRPO algoritmasının rolü

Group Relative Policy Optimization (GRPO), DeepSeek’in Math-V2 hattından gelen bir RL yöntemidir. Klasik PPO’da genelde politika kadar büyük bir eleştirmen (critic) modeli baseline üretir. GRPO, aynı soruya bir grup cevap örnekler; grubun göreli skorlarından baseline tahmin eder. Böylece ayrı critic maliyeti düşer. Problem: kararlı ve ucuz policy güncellemesi. GRPO sihir değildir; ödül tasarımı kötüyse model ödülü “hack” edebilir.

Cold-start ve supervised fine-tuning neden önemli?

R1-Zero güçlü skor üretebilir ama ürün dilinde zayıf kalabilir. Cold-start, az miktarda yüksek kaliteli reasoning örneğiyle modeli okunabilir bir biçime çeker. Ardından RL devam eder. Rejection sampling, RL kontrol noktasından iyi izleri süzüp yeni SFT karışımına ekler. Bu, “saf RL” ile “ürün R1” arasındaki köprüdür.

Reasoning token ve test-time compute

Test-time compute, çıkarım anında daha fazla hesap harcayarak performansı artırmaktır. R1’de bu, uzun CoT token’ları olarak faturalanır. Ocak 2025 API’sinde deepseek-reasoner için CoT token’ları çıktı fiyatından sayılır (arşivlenmiş fiyat sayfası notu). Yani “ucuz input” yetmez; düşünme izi çıktıyı şişirir.

Örnek (kavramsal): çok adımlı bir denklemde model önce olası yolları yazar, ara sonucu kontrol eder, yanlış yolu eler, sonra nihai sayıyı verir. Bu metin insan düşüncesinin kopyası değil, ödüllendirilmiş bir çözüm biçimidir.

Akıl yürütmenin sınırları

  • Halüsinasyon: uzun iz, yanlış güveni artırabilir.
  • Kod: yarışma skorları yüksek olsa da kurumsal depoda araçsız model yetersiz kalabilir.
  • Dil: R1-Zero’da dil karışması raporlanır; Türkçe üretimde ayrı değerlendirme gerekir.
  • Maliyet: her soruya maksimum reasoning budget vermek faturayı büyütür.
  • Prompt engineering hâlâ geçerlidir; kötü istem, pahalı CoT üretir.

Fiyat/Performans Kıyaslaması: OpenAI o1 Karşısında DeepSeek R1

DeepSeek R1 vs OpenAI o1 benchmark sonuçları

Aşağıdaki skorlar DeepSeek-R1 teknik raporundaki üretici değerlendirmesidir (Ocak 2025 dönemi). Bağımsız tekrar ölçüm değildir. Karşılaştırma modeli OpenAI o1-1217’dir; 2026’daki GPT-5.x / o-serisi güncel ürünleriyle karıştırılmamalıdır.

ModelBenchmarkSkorÖlçüm tarihi / koşulKaynak
DeepSeek-R1AIME 2024 (Pass@1)%79,8Üretici; max 32.768 çıktı tokenR1 raporu
OpenAI o1-1217AIME 2024 (Pass@1)%79,2Üreticinin tablosuR1 raporu
DeepSeek-R1MATH-500 (Pass@1)%97,3ÜreticiR1 raporu
OpenAI o1-1217MATH-500 (Pass@1)%96,4Üreticinin tablosuR1 raporu
DeepSeek-R1GPQA Diamond (Pass@1)%71,5ÜreticiR1 raporu
OpenAI o1-1217GPQA Diamond (Pass@1)%75,7Üreticinin tablosuR1 raporu
DeepSeek-R1LiveCodeBench (Pass@1-CoT)%65,92024-08–2025-01 veriR1 raporu
OpenAI o1-1217LiveCodeBench (Pass@1-CoT)%63,4Aynı tabloR1 raporu
DeepSeek-R1Codeforces rating202910 Div.2 + uzman testR1 raporu
OpenAI o1-1217Codeforces rating2061Aynı tabloR1 raporu
DeepSeek-R1SWE-bench Verified%50,8agentless çerçeveR1 raporu
OpenAI o1-1217SWE-bench Verified%49,2Aynı tabloR1 raporu

Benchmark neyi ölçer?
AIME / MATH-500: yarışma matematiği. GPQA Diamond: zor uzman soruları. LiveCodeBench: güncel kod yarışması/problemleri. Codeforces: yarışma rating tahmini. SWE-bench Verified: gerçek GitHub issue tamiri (agentless). Tek skorda “her alanda üstün” sonucu çıkmaz: R1 matematikte o1-1217 ile başa baş/üstün; GPQA’da geride; LiveCodeBench’te önde; Codeforces rating’de geride.

Matematik ve kodlama performansı

Matematikte R1’in gücü, RL ile doğrulanabilir ödüle oturmasından gelir. Kodda algoritmik benchmark’lar güçlüdür; mühendislik tarafında rapor, ilgili RL verisinin sınırlı olduğunu ve bir sonraki sürümde iyileşme beklendiğini yazar. Gerçek ASP.NET / PostgreSQL depolarında skor, araç (test runner, diff, linter) olmadan düşer. Bu ayrım Terminal-Bench ve GPT-6 Astra / Opus 5.5 yazılarındaki model–ajan ayrımıyla aynıdır.

DeepSeek’in eğitim maliyeti ne kadar?

KalemRaporlanan değerKapsam
V3 tam eğitim GPU-saat2,788M H800Ön eğitim + context uzatma + post-training
V3 varsayılan dolar hesabı~5,576M USD2 USD/GPU-saat varsayımı
V3’te hariç tutulanlar—Önceki araştırma, ablation, veri toplama, personel, donanım yatırımı
R1 RL (Nature ekleri / haber özeti)~294K USD; 512×H800Post-training RL; V3 ön eğitimini kapsamaz

Sonuç: DeepSeek “her şeyi onda birine indirdi” iddiası, farklı maliyet sepetlerini karşılaştırmaya dayanıyorsa çöker. Kanıtlanan şey, V3’ün resmi eğitim koşusunun GPU-saat cinsinden görece düşük raporlanması ve R1’in ek RL’sinin V3’e göre küçük bir dilim olmasıdır. OpenAI/Anthropic’in eşdeğer toplam Ar-Ge rakamları kamuya aynı formatta açıklanmadığı için kesin “X kat ucuz şirket” cümlesi kurulmaz.

DeepSeek API maliyeti (tarihsel — Ocak 2025)

Arşivlenmiş resmi fiyat sayfasına göre (milyon token, USD; deepseek-chat = V3, deepseek-reasoner = R1):

ModelCache hit inputCache miss inputOutputNot
deepseek-chat (V3)0,07 (indirimli 0,014)0,27 (indirimli 0,14)1,10 (indirimli 0,28)İndirim ~8 Şubat 2025’e kadar
deepseek-reasoner (R1)0,140,552,19İndirim dışı; CoT+cevap çıktıda

Aynı dönemde OpenAI o1 API listesi yaygın olarak milyon token başına 15 USD giriş / 60 USD çıkış (cache okuma 7,5 USD) olarak bilinir. Token başına oran büyüktür; görev başına fark, R1’in daha uzun çıktı üretmesiyle daralabilir.

2026’da DeepSeek API (11 Ekim 2026)

Resmi sayfa artık V3/R1 kimliklerini değil şunları listeler:

Model kimliğiSürümContextPeak input (miss)Off-peak input (miss)Peak outputOff-peak output
deepseek-flashV4.1-Flash1M0,300,151,200,60
deepseek-v4-proV4-Pro-08131M1,320,663,961,98

Cache hit satırları çok daha düşüktür (Flash off-peak 0,003). Peak saatler: hafta içi 01:00–04:00 ve 06:00–10:00 UTC. Bu tablo, tarihsel R1 fiyatı değildir; 2026 ürün hattıdır. Güncel Çin açık ağırlık ekosistemi için DeepSeek / Qwen / Kimi yazısına bakın.

Temsili maliyet: 10M input + 2M output / ay

Varsayım: önbellek isabetsiz; R1’de ekstra reasoning şişmesi yok (gerçekte vardır).

SenaryoHesapToplam
V3 chat tam fiyat (2025)10×0,27 + 2×1,104,90 USD
R1 reasoner (2025)10×0,55 + 2×2,199,88 USD
OpenAI o1 (2025 liste)10×15 + 2×60270 USD
Flash off-peak (2026)10×0,15 + 2×0,602,70 USD
Flash peak (2026)10×0,30 + 2×1,205,40 USD

Token başına en ucuz satır, tamamlanan iş başına en ucuz olmayabilir. Başarısız deneme, tekrar üretim, gecikme ve kalite kaybı toplam maliyete eklenir. Reasoning açıkken 2M “nihai cevap” token’ı, fiilen birkaç kat CoT üretebilir.


Açık Kaynak Ağırlıkların (Open-Weights) Ekosistem İçin Anlamı

Açık kaynak ve açık ağırlıklı model farkı

  • Proprietary / API-only: Ağırlık yok; yalnızca uç nokta.
  • Open weights: Çalıştırma için parametreler indirilebilir.
  • Open source (sıkı anlam): Veri + kod + model + değiştirme hakları birlikte açık.

DeepSeek-V3 ve R1 open-weight’tir. Eğitim karışımı ve tam pipeline kamuya aynı şekilde açılmaz. GitHub depolarında model lisansları MIT olarak işaretlenir (ağırlık/kod paketini depoya göre doğrulayın). Yazılım kodu ile ağırlık lisansı farklı dosyalarda olabilir. Ticari kullanım öncesi lisans metnini okumak zorunludur; bu yazı hukuki görüş değildir.

R1-Distill modelleri

DeepSeek, R1’in ürettiği reasoning verisiyle Qwen2.5 ve Llama3 tabanlı 1,5B–70B dense distill’ler yayımladı. R1-Distill-Qwen-32B, üretici tabloda AIME 2024’te %72,6; LiveCodeBench’te %57,2 alır ve o1-mini ile kıyaslanır. Distill ≠ tam 671B R1. Donanım ihtiyacı ve tavan performans ayrıdır.

DeepSeek yerel bilgisayarda çalışır mı?

ProfilDonanımMakul hedefGerçekçi olmayan beklenti
A — Dizüstü16 GB RAM, iGPU / giriş GPUÇok küçük quantize distill (1,5B–7B), düşük contextTam R1/V3
B — Oyuncu PCRTX 5080 sınıfı + 32 GB RAM14B–32B quantize (4-bit vb.), Ollama / llama.cpp671B FP8 tek kart
C — KurumsalÇoklu yüksek VRAM veri merkezi GPUvLLM ile MoE shard, FP8/BF16“Tek kutu, sıfır ops”

Quantization (INT8, 4-bit) VRAM’i düşürür; kalite ve hız değişir. KV cache ve context window ek bellek yer. Tokens/saniye uydurulmaz; ölçüm sizin yığına bağlıdır. Self-hosting, Shadow AI riskini azaltabilir ama yama, erişim kontrolü ve sızıntı sorumluluğunu size bırakır.

Geliştiriciler ve işletmeler nasıl yararlanabilir?

  • Sağlayıcı kilidini azaltma, ince ayar ve araştırma
  • Veriyi kendi VPC / on-prem’inde tutma
  • Distill ile kenar veya ekip içi yardımcı
  • API ile hızlı deneme, self-host ile üretim kontrolü

Sınırlar: enerji, bakım, güvenlik sertleştirme, lisans uyumu, güncelleme borcu.


Gerçek Yazılım ve E-Ticaret Senaryoları

Temsili bir teknoloji mağazası: Next.js vitrin, ASP.NET Core API, PostgreSQL, ERP/CRM, Microsoft 365, pazaryeri API’leri, GitHub/Azure DevOps. Mimari bağlam için Next.js e-ticaret yazısı ile uyumludur.

1) Ürün açıklaması (V3 / chat sınıfı)

Teknik özelliklerden SEO metni. Reasoning şart değil. Halüsinasyon riski: watt, soket, uyumluluk uydurma. Çözüm: yapılandırılmış özellik JSON’u + şablon; model out-of-domain iddia etmesin.

2) Yazılım geliştirme (R1 sınıfı)

Kilitlenen stok güncellemesi, yarış durumu, EF Core sorgusu. Reasoning avantajlıdır. Güvenilirlik: birim test + insan review. Token: uzun CoT pahalıdır; dar dosya bağlamı verin.

3) Müşteri destek otomasyonu

Garanti, kargo, uyumluluk. Model tek başına yetmez; RAG şart. Yanlış garanti süresi pahalıdır. Veri bölgesi ve saklama politikası okunmalı.

4) Rapor analizi

Satış/stok özeti. Yapılandırılmış tablo + kısıtlı araç. Ham ERP dökümünü dış API’ye yollamak Shadow AI riskidir; self-host veya sözleşmeli uç.

5) AI coding agent

Issue → kod → yama → test. Model reasoning sağlar; dosya gezme, terminal ve PR Agentic AI çerçevesidir. Başarı puanı uydurulmaz; kendi regression setinizle ölçülür.

SenaryoModel türüReasoning?API / self-host
Ürün metniChat / V3 sınıfıGenelde hayırAPI veya küçük distill
Derin hata ayıklamaR1 sınıfıEvetHassas kodda self-host tercih
DestekChat + RAGKısmenSözleşmeli API veya iç
RaporChat + araçKısmenİç ağ
AgentR1 + araç katmanıEvetİzole koşu ortamı

DeepSeek’in Yapay Zekâ Sektöründeki Uzun Vadeli Etkisi

2025 şoku, “sınır model yalnızca birkaç laboratuvarın trilyon dolarlık ayrıcalığıdır” varsayımını sarstı. 2026’da DeepSeek hattı Flash/Pro’ya evrildi; Qwen ve Kimi benzer baskıyı sürdürdü. Gemini 4 gibi kapalı sınır modeller Fairwind tarzı kademeli açılışla ilerlerken, open-weight reasoning başka bir rekabet ekseni oluşturdu.

Kalıcı etkiler:

  1. Fiyat çapası: Ucuz API, kapalı oyuncuları indirime veya katmanlı ürüne zorlar.
  2. Test-time compute normu: o1/R1 sonrası “daha uzun düşün” ürünleşti.
  3. Distill ekonomisi: Büyük teacher → küçük öğrenci, yerel çıkarımı büyüttü.
  4. Şeffaflık talebi: Eğitim doları başlıkları, hangi sepetin ölçüldüğünü sormayı öğretti.

Sınırlamalar, Güvenlik ve Gerçek Dünya Performansı

  • Halüsinasyon ve yanlış CoT
  • Uzun cevap = yüksek çıktı faturası
  • Türkçe ve çok dilli kalite ayrı ölçülmeli
  • Benchmark ≠ üretim
  • API veri saklama ve bölge politikası okunmalı (modelin geliştirildiği ülke ≠ verinin işlendiği yer otomatik eşitliği değildir)
  • Self-host kontrol artırır, güvenliği garanti etmez
  • KVKK ve kaynak kod gizliliği: tüketicı sohbet ≠ kurumsal sözleşme

DeepSeek-R1 ve V3 Hakkında Sıkça Sorulan Sorular

DeepSeek R1 nedir?

DeepSeek-R1, Ocak 2025’te yayımlanan açık ağırlıklı bir reasoning modelidir. DeepSeek-V3-Base üzerine cold-start, SFT ve GRPO tabanlı pekiştirmeli öğrenme ile eğitilir. Matematik, kod ve çok adımlı mantık için ara çözüm adımları üretir; genel sohbet modeli değildir.

DeepSeek V3 nedir?

DeepSeek-V3, Aralık 2024 teknik raporuyla duyurulan 671 milyar parametreli MoE dil modelidir. Token başına yaklaşık 37 milyar parametre aktiftir. MLA, DeepSeekMoE ve çok tokenlı tahmin kullanır; 14,8 trilyon token ile ön eğitilir. R1’in mimari temelidir.

DeepSeek R1 ve V3 arasındaki fark nedir?

V3 genel amaçlı güçlü bir temel/sohbet modelidir. R1 aynı omurga üzerinde reasoning odaklı post-training ile üretilir. R1 daha uzun CoT ve sınav tipi görevlerde öne çıkar; V3 geniş günlük görevlerde daha dengeli bir genel modeldir.

DeepSeek R1 neden bu kadar önemli?

Üretici ölçümlerde o1 bandına yaklaşan performansı, açık ağırlık dağıtımı ve düşük API fiyatını aynı anda sundu. Ocak 2025’te maliyet ve erişim varsayımlarını piyasada tartışmaya açtı. Tek başına “kazanan model” ilanı değildir; ekonomik ve teknik bir kırılma noktasıdır.

DeepSeek R1 tamamen açık kaynak mı?

Hayır. Ağırlıklar indirilebilir (open-weight); lisans depoda MIT olarak geçer. Eğitim verisi ve tam eğitim süreci aynı anlamda açık kaynak değildir. Ticari kullanım öncesi lisans dosyasını okuyun.

DeepSeek R1-Zero nedir?

R1-Zero, V3-Base üzerine SFT olmadan doğrudan RL (GRPO) uygulanarak üretilen araştırma modelidir. Güçlü reasoning davranışları ortaya çıkar; okunabilirlik ve dil karışması sorunları raporlanır. Nihai R1, cold-start ve çok aşamalı eğitimle farklı bir üründür.

DeepSeek R1 nasıl akıl yürütüyor?

Doğrulanabilir ödüllerle pekiştirmeli öğrenme, modelin uzun çözüm izleri üretmesini teşvik eder. Çıktıdaki CoT, iç hesaplamanın birebir dökümü değildir; test-time compute ile daha fazla token harcayarak ara adımlar yazmasıdır. Bu, bilinç kanıtı değildir.

DeepSeek R1, OpenAI o1’den daha mı iyi?

Hayır / evet tek cevap değildir. Üretici tabloda R1 AIME ve MATH-500’de o1-1217 ile başa baş veya biraz önde; GPQA’da geride; LiveCodeBench’te önde; Codeforces rating’de geridedir. Görev, bütçe ve araç katmanı kararı belirler.

DeepSeek’in eğitim maliyeti gerçekten 5,6 milyon dolar mı?

V3 raporunda 2,788M H800 GPU-saat × 2 USD varsayımı ≈ 5,576M USD’tir. Bu, resmi eğitim koşusudur; önceki araştırma ve tüm şirket Ar-Ge’si değildir. R1 için haberleşen ~294K USD, RL dilimine aittir.

DeepSeek API ücretsiz mi?

Hayır. Kullanım token ile ücretlendirilir. Dönemsel indirimler ve 2026’da peak/off-peak tarifeler vardır. Güncel fiyat için api-docs.deepseek.com/pricing sayfasına bakın.

DeepSeek R1 bilgisayara kurulabilir mi?

Tam 671B model tüketici bilgisayarında pratik değildir. R1-Distill ve quantize küçük modeller Ollama, llama.cpp, vLLM ile çalışabilir. VRAM, quant seviyesi ve context penceresi sınırı belirler.

DeepSeek modelleri ticari projelerde kullanılabilir mi?

MIT işaretli ağırlıklar genelde ticari kullanıma açıktır; yine de güncel lisans metni ve API şartları bağlayıcıdır. Kurumsal veriyi dış API’ye göndermeden önce saklama, bölge ve KVKK gereklerini ayrı değerlendirin.


Sonuç

DeepSeek-R1 ve V3, yapay zekâyı yalnızca “daha büyük kapalı model” yarışına indirgemez. V3, MoE + MLA ile aktif hesabı sınırlı tutan bir verimlilik tezidir. R1, GRPO ve çok aşamalı post-training ile bu omurgaya reasoning kazandırır. R1-Zero, SFT’siz RL’nin neyi doğurabileceğini gösterir; nihai R1 ise ürünleştirme katmanıdır. Yaklaşık 5,6 milyon dolarlık V3 eğitim hesabı ve agresif API fiyatı, maliyet sepetleri doğru okunduğunda bile sektörün fiyat ve erişim varsayımlarını sarstı. 2026’da API kimlikleri değişti; tarihsel R1/V3’ün mirası kaldı: açık ağırlıklı reasoning, distill ekonomisi ve test-time compute artık kalıcı tartışma başlıklarıdır.

Sınır model seçerken skor tablosundan önce sorulacak soru şudur: Görev doğrulanabilir mi, CoT faturası ödenir mi, veri nerede işlenir, model mi yoksa ajan mı lazım?


Kaynakça

  1. DeepSeek-V3 Technical Report — https://arxiv.org/abs/2412.19437
  2. DeepSeek-R1 Technical Report — https://arxiv.org/abs/2501.12948
  3. DeepSeek-V3 GitHub — https://github.com/deepseek-ai/DeepSeek-V3
  4. DeepSeek-R1 GitHub — https://github.com/deepseek-ai/DeepSeek-R1
  5. DeepSeek API Pricing (güncel) — https://api-docs.deepseek.com/quick_start/pricing
  6. Hugging Face DeepSeek-R1 — https://huggingface.co/deepseek-ai/DeepSeek-R1
  7. Reuters, 27 Ocak 2025 — DeepSeek kaynaklı AI hisse satışları / NVIDIA
  8. Reuters, 18 Eylül 2025 — R1 eğitim maliyeti / Nature
  9. The Register, 19 Eylül 2025 — 294K USD rakamının kapsamı
  10. BBC / CNBC, Ocak 2025 — piyasa tepkisi özetleri
  11. OpenAI o1 fiyat dokümantasyonu (tarihsel liste) — platform.openai.com / developers.openai.com

Araştırma ve doğrulama: 11 Ekim 2026.