| Rank | Model | Genel Skor |
|---|---|---|
| 1 | gemma4-gemma-4-E2B-it_1780572325819 | 28.2956483823 |
1 phaseActive
Excel'den oluşturulan soru-cevap kıyaslaması. Bu kıyaslama, yapay zeka modellerinin metin anlama ve soru yanıtlama yeteneklerini ölçer.
TBB Türkiye Bankalar Birliği Benchmark, yapay zeka modellerinin Türkçe finansal düzenleme metinlerini anlama, kaynak metne bağlı kalma ve kısa/somut soru-cevap üretme yeteneklerini değerlendirmek için hazırlanmış alan-özel bir kıyaslamadır.
Bu benchmark, özellikle Türkiye Bankalar Birliği Bireysel Müşteri Hakem Heyeti, bireysel müşteri başvuruları, bankaların cevap süreleri, başvuru yöntemleri, heyet kararları ve ilgili düzenleme hükümleri gibi bankacılık mevzuatı odaklı metinler üzerinde çalışır.
Modelden beklenen görev şudur:
Verilen bir bağlam/paragraf içindeki bilgiyi kullanarak soruya doğru, kısa ve kaynakla uyumlu cevap üretmek.
Bu kıyaslama genel bilgi yarışması değildir. Model, cevap verirken dış dünya bilgisini, güncel mevzuat yorumunu veya kendi varsayımlarını kullanmamalıdır. Doğru cevap, yalnızca verilen bağlamda açıkça desteklenen bilgiye dayanmalıdır.
Benchmark’ın amacı, modellerin aşağıdaki becerilerini ölçmektir:
| Beceri | Açıklama |
|---|---|
| Türkçe anlama | Türkçe düzenleyici/kurumsal metinleri doğru yorumlama |
| Kaynak metne bağlılık | Cevabı yalnızca verilen bağlamdan üretme |
| Kısa cevap çıkarımı | Gereksiz açıklama eklemeden doğrudan cevabı verme |
| Bankacılık terminolojisi | TBB, BDDK, Hakem Heyeti, bireysel müşteri, başvuru süresi gibi kavramları ayırt etme |
| Sayısal/süre bilgisi yakalama | 30 gün, 60 gün, 90 gün, 10.000 TL, 5 yıl gibi kritik bilgileri doğru çıkarma |
| Halüsinasyon kontrolü | Paragrafta bulunmayan bilgiyi üretmeme |
Bağlam:
Heyet, Birlik bünyesinde görev yapmak üzere kurulur. Heyetin sekretarya hizmetleri Birlik tarafından yerine getirilir. Heyet beş temsilciden oluşur.
Soru:
Bireysel Müşteri Hakem Heyeti kaç temsilciden oluşur?
Beklenen Cevap:
Beş temsilciden oluşur.
Modelin cevabı bağlama uygun, doğrudan ve gereksiz yorumdan arındırılmış olmalıdır.
Benchmark, klasik soru-cevap metrikleri ile anlamsal değerlendirme metriklerini birlikte kullanır. Ana sıralama skoru, platformda tanımlanan ağırlıklarla hesaplanan genel skordur.
| Metrik | Açıklama | Yöntem |
|---|---|---|
| Genel Skor | Ana metriklerin ağırlıklı birleşimi | F1, EM, ROUGE, BLEU, METEOR, BERTScore |
| F1 Skoru | Tahmin ile referans cevaptaki kelime örtüşmesi | 2 × Precision × Recall / (Precision + Recall) |
| Tam Eşleşme (EM) | Tahminin referans cevapla birebir eşleşmesi | 0 veya 100 |
| ROUGE-L | En uzun ortak alt dizi benzerliği | LCS tabanlı |
| ROUGE-1 / ROUGE-2 | Tekil kelime ve ikili kelime örtüşmesi | Unigram / bigram eşleşmesi |
| BLEU | N-gram kesinliği | Makine çevirisi standardı |
| METEOR | Eşanlamlılık ve kelime varyasyonlarına daha duyarlı ölçüm | Kelime eşleşmesi + anlam yakınlığı |
| BERTScore | Tahmin ve referans cevabın anlamsal yakınlığı | Embedding benzerliği |
Bu metrikler model davranışını analiz etmek için kullanılır. Sıralama skoruna doğrudan dahil edilmeyebilir; bilgilendirme ve kalite analizi amacı taşır.
| Metrik | Açıklama | Aralık | İdeal |
|---|---|---|---|
| Olgusal Tutarlılık | Cevabın verilen bağlamla uyumu | 0–100 | Yüksek |
| Halüsinasyon | Bağlamda olmayan bilgi üretme oranı | 0–100 | Düşük |
| Kapsam | Sorunun gerektirdiği temel bilginin karşılanması | 0–100 | Yüksek |
| İzlenebilirlik | Cevabın bağlamdaki ifadeye ne kadar izlenebilir olduğu | 0–100 | Yüksek |