Benchgen

Horse Knowledge Benchmark

1 phaseActive

Multiple-choice questions testing general knowledge about horses: anatomy, behavior, breeds, care and history.

Genel Bakış

Türkçe Çoktan Seçmeli Kıyaslama

Bu kıyaslama, yapay zeka modellerinin Türkçe dil anlama ve çoktan seçmeli soru yanıtlama yeteneklerini değerlendirmek için tasarlanmıştır.


Kıyaslama Hakkında

Amaç: Modeliniz, çeşitli kategorilerde Türkçe çoktan seçmeli sorulara cevap verecektir. Her soru için A, B, C veya D şeklinde tek bir doğru cevap beklenmektedir.

Örnek Soru:

Kategori: Dilbilgisi

Soru: "Kitabı okudum" cümlesinde özne hangisidir?

   A) Kitabı
   B) Okudum
   C) Ben (gizli özne)
   D) Hiçbiri

Doğru Cevap: C

Değerlendirme Metrikleri

Ana Metrikler

MetrikAçıklamaFormül
Genel SkorDoğruluk ve LLM Judge ortalaması(Doğruluk × 0.5) + (LLM Skoru × 0.5)
DoğrulukDoğru cevaplanan soruların oranı(Doğru / Toplam) × 100
Kategori SkoruHer kategori için ayrı başarı oranıDinamik hesaplama

Puanlama Sistemi

DurumPuan
Doğru cevap+1
Yanlış cevap0
Boş bırakma0

LLM-as-Judge Metrikleri

Not: Bu metrikler yalnızca reasoning alanı sağlandığında hesaplanır.

MetrikAçıklamaAralıkİdeal
Anlamsal TutarlılıkGerekçenin mantıksal tutarlılığı0-100Yüksek
AkıcılıkDilin doğallığı ve okunabilirliği0-100Yüksek
Cevap GerekçesiCevabın ne kadar iyi desteklendiği0-100Yüksek
Düşünce ZinciriAdım adım mantık tutarlılığı0-100Yüksek
Olgusal TutarlılıkBilgilerin doğruluğu0-100Yüksek
HalüsinasyonUydurma bilgi oranı0-100Düşük
LLM SkoruAğırlıklı ortalama0-100Yüksek

Nasıl Katılırsınız?

Adım 1: Başlangıç Kiti

Sol menüden "Dosyalar" sekmesine gidin ve Başlangıç Kiti'ni indirin.

Adım 2: Model Yapılandırması

model.py dosyasındaki LLM API ayarlarını yapılandırın:

self.llm_config = {
    "api_url": "YOUR_API_URL/v1/chat/completions",
    "headers": {
        "Authorization": "Bearer YOUR_API_KEY",
        "Content-Type": "application/json"
    },
    "model_name": "your-model-name",  # örn: gpt-4, gemini-pro
    "enabled": True
}

Desteklenen API Formatları:

  • OpenAI uyumlu API'ler
  • LiteLLM proxy
  • Özel LLM sunucuları (OpenAI formatında)
  • Azure OpenAI
  • Google Gemini (OpenAI uyumlu)

Adım 3: Gönderim Paketi

Dosyalarınızı ZIP formatında hazırlayın:

gonderim.zip
├── model.py          # Ana model dosyası (ZORUNLU)
├── metadata          # Çalıştırma komutu
└── (ek dosyalar)     # Gerekirse

Adım 4: Gönderim

"Katıl" sekmesinden ZIP dosyanızı yükleyin.


Gönderim Formatı

{
    "predictions": [
        {
            "id": 1,
            "predicted_answer": "A",
            "category": "dilbilgisi",
            "confidence": 0.95,
            "reasoning": "Cümlede gizli özne 'ben' olduğu için C şıkkı doğrudur."
        },
        {
            "id": 2,
            "predicted_answer": "B",
            "category": "kelime_bilgisi",
            "confidence": 0.87,
            "reasoning": "'Sıla' kelimesi hasret anlamına gelir."
        }
    ]
}

Alan Açıklamaları

AlanZorunluTipAçıklama
idEvetIntegerSoru numarası
predicted_answerEvetStringA, B, C veya D
categoryEvetStringSoru kategorisi
confidenceHayırFloatGüven skoru (0.0 - 1.0)
reasoningHayırStringCevap gerekçesi (LLM-Judge için)

Önemli Kurallar

Yapılması Gerekenler:

  • Cevaplar BÜYÜK HARF olmalı (A, B, C, D)
  • UTF-8 encoding kullanın
  • Tüm soruları cevaplayın
  • JSON formatına uyun

Yapılmaması Gerekenler:

  • Küçük harf cevap vermeyin
  • 60 saniyeyi aşmayın
  • Geçersiz şık seçmeyin
  • ID'leri karıştırmayın

Başarılar dileriz! Sorularınız için iletişim sekmesini kullanabilirsiniz.