3 Ekim 2026 · Yapay zeka
Metin üretmeyen yapay zeka: Cloudflare ve AWS'den açık kaynak "karar modelleri"
Cloudflare'in Clef'i ve AWS'nin Strands Decider 2B'si 1 Ekim'de aynı gün yayımlandı. İkisi de metin üretmiyor; önceden tanımlı seçenekler arasından seçim yapıp olasılık döndürüyor. Ajan geliştiren herkes için hız, maliyet ve güvenilirlik açısından neden önemli olduğunu anlatıyoruz.
Bir LLM'e "Bu destek talebi acil mi?" diye sorduğunuzu düşünün. Model size birkaç paragraf açıklama yazabilir, cevabı JSON'a sarmayı unutabilir ya da bazen "evet" yerine "büyük olasılıkla evet" diyebilir. Siz de bu metni ayrıştırıp kodunuzda bir if koşuluna dönüştürmeye uğraşırsınız. Oysa aslında istediğiniz şey tek bir değerdi: acil ya da normal.
1 Ekim'de iki büyük altyapı şirketi tam bu soruna odaklanan modeller yayımladı. Cloudflare, Clef ve Clef-flash adlı iki açık kaynak "karar modeli" duyurdu. Aynı gün AWS de Strands Decider 2B adlı küçük bir karar modelini açık kaynak olarak paylaştı. İki şirketin aynı gün aynı kategoriye girmesi, bunun gelip geçici bir deney olmadığını gösteriyor.
Karar modeli ne demek?
Karar modelleri metin üretmiyor. Onlara bir "durum" (bir metin ya da JSON) ve tipli sorular veriyorsunuz; model de her soru için yalnızca izin verilen cevaplardan birini seçiyor ve bu seçime bir olasılık atıyor. Üç temel soru tipi öne çıkıyor:
- Seçim (choice): N seçenekten birini seç (örneğin
ödendi,gecikmiş,taslak). - Evet/hayır olasılığı: Bir ifadenin doğru olma olasılığını 0 ile 1 arasında ver.
- Puan (score): Sıralı bir ölçek üzerinde derecelendir.
Kategoriyi Eylül ortasında başlatan şirket, San Francisco merkezli TypeSafe AI oldu. Şirketin Jev adlı modeli "System One" modeli olarak tanıtıldı; ancak ağırlıkları kapalı ve şimdilik bekleme listesiyle erişilen barındırılan bir API olarak sunuluyor. Cloudflare ve AWS'nin hamlesi bu yüzden önemli: aynı fikri açık ağırlıklarla, Apache 2.0 lisansıyla herkesin eline veriyorlar.
Neden bu kadar hızlı?
Klasik LLM'ler cevabı token token üretir; her token için modelin yeniden çalışması gerekir. Karar modelleri ise bu döngüyü tamamen atlıyor. Girdi tek bir ileri geçişte işleniyor ve geçerli seçeneklerin tümü paralel olarak puanlanıyor.
AWS'nin yaklaşımı bunu çok net gösteriyor: Strands Decider 2B, Qwen3.5-2B-Base modelinin dil modelleme katmanını (metni üreten çıkış katmanını) söküp yerine yaklaşık 1 milyon parametrelik küçük bir "pointer head" koyuyor. Bu kafa, cevap konumundaki gizli durumu her seçeneğin temsiliyle karşılaştırıp skor üretiyor. Cloudflare tarafında da Qwen tabanlı modeller dondurulmuş, üzerine bir yönlendirme kafası ve LoRA adaptörleri eğitilmiş.
Sonuç olarak çıkış hiçbir zaman serbest metin olmuyor. Model, tanımladığınız şemanın dışında bir değer döndüremiyor; bu da ayrıştırma hatalarını ve "modelin uydurduğu yeni kategori" gibi sorunları yapısal olarak ortadan kaldırıyor.
Rakamlar ne söylüyor?
Şirketlerin kendi paylaştığı verilere göre:
- Clef: Qwen3.8-27B tabanlı, 27 milyar parametreli ve görüntü sınıflandırması için bir vision encoder'a sahip. 43 benchmark genelinde medyan gecikmesi yaklaşık 209 ms.
- Clef-flash: Qwen3.5-9B tabanlı ve gecikmeye duyarlı işler için tasarlanmış. Medyan gecikmesi yaklaşık 39 ms.
- Bağlam penceresi: Cloudflare, Clef için 64K bağlam penceresi bildiriyor ve bunu Jev'in 32K'sı ile karşılaştırıyor.
- Strands Decider 2B: Tek bir RTX 3090 üzerinde medyan 115 ms gecikmeyle çalışıyor ve JevBench'in 231 herkese açık görevinin yaklaşık %72'sini doğru cevaplıyor.
Cloudflare, bir müşteri destek sınıflandırma benchmark'ında (BANKING77) Clef'in Jev'in belirgin şekilde önüne geçtiğini de iddia ediyor. Yine de bu rakamların büyük kısmının şirketlerin kendi ölçümleri olduğunu akılda tutmak gerekiyor. Bağımsız karşılaştırmalar henüz çok yeni.
Pratikte nerede işe yarar?
Bir ajan sisteminde yapılan işlerin önemli bir kısmı aslında "yazmak" değil, "karar vermek". Hangi aracı çağırayım, bu isteği hangi modele yönlendireyim, bu çıktı politikaya uygun mu, bu bilet kime gitsin? Bugün bu kararların çoğu, pahalı ve yavaş büyük modellerin metin üretmesiyle veriliyor. Karar modelleri bu adımları ucuz ve hızlı bir katmana taşıma imkânı sunuyor:
- Model yönlendirme: Basit soruları küçük modele, zor olanları büyük modele gönderme.
- Araç seçimi ve argüman kontrolü: Bir araç çağrısının bağlamla gerçekten uyumlu olup olmadığını önceden sorgulama.
- Guardrail'ler: Bir girdinin veya çıktının politika ihlali içerip içermediğini olasılıkla ölçme.
- Triage: Destek taleplerini, güvenlik uyarılarını veya içerik bildirimlerini sınıflandırma.
- Değerlendirme (eval): LLM çıktılarını sabit bir rubriğe göre puanlama.
Cloudflare, Clef'i şirket içinde tehdit istihbaratında alan adı sınıflandırma, destek talebi triage'ı ve bot tespiti gibi işlerde kullandığını söylüyor. Bir istek şeması kabaca şöyle görünüyor:
{
"state": "Son bir saattir tüm müşterilerde ödeme adımı başarısız oluyor.",
"questions": {
"oncelik": {
"type": "choice",
"instructions": "Bu olayın önceliği nedir?",
"criteria": { "kritik": "...", "yuksek": "...", "normal": "..." }
}
}
}Cevap olarak gelen şey bir paragraf değil; her seçenek için bir olasılık. Kodunuz doğrudan buna göre dallanabilir.
Olasılık neden bu kadar değerli?
Bence bu modellerin en az konuşulan ama en önemli özelliği kalibrasyon. Bir LLM'e "ne kadar eminsin?" diye sorduğunuzda aldığınız cevap çoğu zaman bir tahminden ibaret. Karar modelleri ise doğrudan olasılık döndürecek şekilde eğitiliyor. AWS, modelinin beklenen kalibrasyon hatasını (ECE) yaklaşık 0,05 olarak raporluyor; Cloudflare da eğitimde kalibrasyonu iyileştirmeye yönelik Brier kaybı kullandığını belirtiyor.
Bu pratikte şu anlama geliyor: "Güven %90'ın üzerindeyse otomatik işle, %60–90 arasındaysa büyük modele danış, altındaysa bir insana bırak" gibi eşikleri gönül rahatlığıyla kurabilirsiniz. Üretim ortamında güvenilir otomasyonun anahtarı tam da bu.
Sınırları da var
Bu modeller LLM'lerin yerini almıyor. AWS ekibi, Decider 2B'nin karmaşık problemlerde akıl yürütme modellerinin gerisinde kaldığını ve kod yazma, sohbet ya da özetleme için uygun olmadığını açıkça belirtiyor. Ayrıca paketle gelen HTTP sunucusunda yerleşik kimlik doğrulama yok; doğrudan internete açmamak gerekiyor. Seçenekleri önceden tanımlamanız gerektiği için açık uçlu görevlerde de işe yaramıyorlar.
Geliştiriciler için anlamı
Benim okumam şu: ajan mimarileri iki katmanlı bir yapıya doğru evriliyor. Bir tarafta yazan, planlayan ve akıl yürüten büyük modeller; diğer tarafta milisaniyeler içinde "evet/hayır/hangisi" diyen küçük, ucuz ve kalibre edilmiş karar modelleri. Bugün tüm kararları tek bir büyük modele yaptıran sistemler hem gereksiz para harcıyor hem de gereksiz gecikme yaşıyor.
İyi haber, denemenin çok kolay olması. Strands Decider 2B pip install strands-decider ile kurulup yerel olarak çalıştırılabiliyor; ağırlıkları, eğitim tarifi ve veri listesi de açık. Clef ise hem Workers AI üzerinden barındırılan bir servis olarak hem de Hugging Face'ten indirilebilir ağırlıklarla sunuluyor. Cloudflare ayrıca kendi verinizle bu modelleri pekiştirmeli öğrenme (RL) ile ince ayarlayabileceğiniz bir platform üzerinde çalıştığını duyurdu.
Kendi projenizde metin üreten bir LLM'den sadece bir etiket ya da evet/hayır cevabı bekleyen bir adım varsa, orası karar modellerini denemek için ideal bir başlangıç noktası olabilir.
Kaynaklar
- Introducing Clef: our open-source decision models, and new RL fine-tuning platform
- Cloudflare/clef · Hugging Face
- AWS Strands Labs Releases Strands Decider 2B: An Open Source Decision Model That Picks Options in About 115 ms - MarkTechPost
- AWS debuts Strands Decider 2B, a first lightweight decision model for accelerate agentic workflows - SiliconANGLE
- TypeSafe AI Releases Jev: A System One Model That Returns Typed, Calibrated Decisions Instead of Text - MarkTechPost