Benchgen

TBB - Soru Cevap Benchmark — Sonuçlar

RankModelGenel Skor
1gemma4-gemma-4-E2B-it_178057232581928.2956483823

TBB - Soru Cevap Benchmark

1 phaseActive

Excel'den oluşturulan soru-cevap kıyaslaması. Bu kıyaslama, yapay zeka modellerinin metin anlama ve soru yanıtlama yeteneklerini ölçer.

Genel Bakış

TBB Türkiye Bankalar Birliği Benchmark

Genel Bakış

TBB Türkiye Bankalar Birliği Benchmark, yapay zeka modellerinin Türkçe finansal düzenleme metinlerini anlama, kaynak metne bağlı kalma ve kısa/somut soru-cevap üretme yeteneklerini değerlendirmek için hazırlanmış alan-özel bir kıyaslamadır.

Bu benchmark, özellikle Türkiye Bankalar Birliği Bireysel Müşteri Hakem Heyeti, bireysel müşteri başvuruları, bankaların cevap süreleri, başvuru yöntemleri, heyet kararları ve ilgili düzenleme hükümleri gibi bankacılık mevzuatı odaklı metinler üzerinde çalışır.

Modelden beklenen görev şudur:

Verilen bir bağlam/paragraf içindeki bilgiyi kullanarak soruya doğru, kısa ve kaynakla uyumlu cevap üretmek.

Bu kıyaslama genel bilgi yarışması değildir. Model, cevap verirken dış dünya bilgisini, güncel mevzuat yorumunu veya kendi varsayımlarını kullanmamalıdır. Doğru cevap, yalnızca verilen bağlamda açıkça desteklenen bilgiye dayanmalıdır.

Amaç

Benchmark’ın amacı, modellerin aşağıdaki becerilerini ölçmektir:

BeceriAçıklama
Türkçe anlamaTürkçe düzenleyici/kurumsal metinleri doğru yorumlama
Kaynak metne bağlılıkCevabı yalnızca verilen bağlamdan üretme
Kısa cevap çıkarımıGereksiz açıklama eklemeden doğrudan cevabı verme
Bankacılık terminolojisiTBB, BDDK, Hakem Heyeti, bireysel müşteri, başvuru süresi gibi kavramları ayırt etme
Sayısal/süre bilgisi yakalama30 gün, 60 gün, 90 gün, 10.000 TL, 5 yıl gibi kritik bilgileri doğru çıkarma
Halüsinasyon kontrolüParagrafta bulunmayan bilgiyi üretmeme

Örnek Görev

Bağlam:

Heyet, Birlik bünyesinde görev yapmak üzere kurulur. Heyetin sekretarya hizmetleri Birlik tarafından yerine getirilir. Heyet beş temsilciden oluşur.

Soru:

Bireysel Müşteri Hakem Heyeti kaç temsilciden oluşur?

Beklenen Cevap:

Beş temsilciden oluşur.

Modelin cevabı bağlama uygun, doğrudan ve gereksiz yorumdan arındırılmış olmalıdır.

Değerlendirme Metrikleri

Benchmark, klasik soru-cevap metrikleri ile anlamsal değerlendirme metriklerini birlikte kullanır. Ana sıralama skoru, platformda tanımlanan ağırlıklarla hesaplanan genel skordur.

Ana Metrikler
MetrikAçıklamaYöntem
Genel SkorAna metriklerin ağırlıklı birleşimiF1, EM, ROUGE, BLEU, METEOR, BERTScore
F1 SkoruTahmin ile referans cevaptaki kelime örtüşmesi2 × Precision × Recall / (Precision + Recall)
Tam Eşleşme (EM)Tahminin referans cevapla birebir eşleşmesi0 veya 100
ROUGE-LEn uzun ortak alt dizi benzerliğiLCS tabanlı
ROUGE-1 / ROUGE-2Tekil kelime ve ikili kelime örtüşmesiUnigram / bigram eşleşmesi
BLEUN-gram kesinliğiMakine çevirisi standardı
METEOREşanlamlılık ve kelime varyasyonlarına daha duyarlı ölçümKelime eşleşmesi + anlam yakınlığı
BERTScoreTahmin ve referans cevabın anlamsal yakınlığıEmbedding benzerliği
LLM-as-Judge Metrikleri

Bu metrikler model davranışını analiz etmek için kullanılır. Sıralama skoruna doğrudan dahil edilmeyebilir; bilgilendirme ve kalite analizi amacı taşır.

MetrikAçıklamaAralıkİdeal
Olgusal TutarlılıkCevabın verilen bağlamla uyumu0–100Yüksek
HalüsinasyonBağlamda olmayan bilgi üretme oranı0–100Düşük
KapsamSorunun gerektirdiği temel bilginin karşılanması0–100Yüksek
İzlenebilirlikCevabın bağlamdaki ifadeye ne kadar izlenebilir olduğu0–100Yüksek