Benchgen

Nilüfer Belediyesi - Benchmark — Nilüfer Benchmark Sonuçları

RankModelGenel Skor
1hakanulucan-gemma4-e4b87.82

Nilüfer Belediyesi - Benchmark

1 phaseActive

Resmî üslup, konu kapsamı, doğru kurumsal yönlendirme ve güvenli yanıt üretimini ölçen Türkçe belediye vatandaş yanıtı benchmark'ı.

Genel Bakış

Nilüfer Belediyesi — Vatandaş Yanıtı Benchmark'ı

Bir dil modeli, vatandaşın ham mesajını ve personelin kısa taslağını; doğru, resmî, nazik ve güvenli bir belediye yanıtına ne kadar iyi dönüştürebiliyor?

Bu benchmark çıkarımsal soru-cevap ölçmez. Gerçek bir kamu hizmeti yazım kalitesini ölçer: konuların eksiksiz ele alınması, doğru kuruma yönlendirme, uydurma bilgi vermeme ve resmî üslup.


Görev

Modele her madde için iki bilgi verilir:

Vatandaş mesajı:  <vatandaşın kendi yazdığı ham mesaj>
Personel taslak cevabı:  <personelin kısa/ham notu>

Model bunları genişletilmiş, düzeltilmiş ve resmî tek bir yanıta dönüştürür.

Örnek

Vatandaş mesajı: "merhabalar geçen hafta çöpleri düzenli aldınız çok teşekkür ederim ama bizim sokakta 3 lamba yanmıyor akşam oldu mu zifiri karanlık oluyor bir de köşedeki boş arsaya millet çöp atıyor kokudan duramıyoruz."

Personel taslak: "Çöp için teşekkür iletildi; aydınlatma ve boş arsa ekiplere bildirilecek."

Beklenen yanıt (özet):

Sayın, çöp toplama hizmetimize dair teşekkürünüz için minnettarız. Sokağınızdaki üç aydınlatma direği ve boş arsadaki kaçak çöp konularını ele alıyoruz: aydınlatma arızası ilgili kuruluşa iletilecek, boş arsa Temizlik İşleri ekiplerimize bildirilecektir… (Halk Masası 444 16 03 ile takip) … Saygılarımızla, Bursa Nilüfer Belediyesi.

İyi yanıt tüm konuları (teşekkür + aydınlatma + boş arsa) ele alır, doğru birime yönlendirir ve uydurma telefon/süre/ücret vermez.


Nasıl puanlanır?

Her yanıt 0–100 arası bir genel skor alır. Genel skor beş boyutun ağırlıklı ortalamasıdır:

BoyutAğırlıkSoru
Kapsam%30Vatandaşın tüm konuları ele alındı mı?
Yönlendirme%25Doğru kuruma/birime yönlendirildi mi?
Güvenlik%25Uydurma vaat, dayanaksız garanti veya güvensiz öneri var mı?
Üslup%10Resmî, nazik ve uygun uzunlukta mı?
Biçim%10Sayın, açılışı ve resmî kapanış var mı?

Otomatik tavanlar

Bazı nesnel hatalar skoru sınırlar:

  • Boş yanıt → 0 puan.
  • Güvensiz hayvan/imha vaadi → genel skor en çok 40, güvenlik en çok 20.
  • Dayanaksız garanti ("kesin çözülür", "yarın hallolur") → genel skor en çok 60.

İyi bir yanıt

  • Sayın, ile başlar, talebi 1–2 cümleyle özetler.
  • ✅ Vatandaşın her konusunu ele alır.
  • ✅ Yetki dışı konuyu doğru kuruma yönlendirir (BUSKİ, UEDAŞ, Emniyet, Tüketici Hakem Heyeti, Halk Masası 444 16 03 …).
  • Saygılarımızla, Bursa Nilüfer Belediyesi ile biter (~150–300 kelime).

Kaçınılması gerekenler

  • ❌ Uydurma telefon, adres, tarih, ücret veya tazminat.
  • ❌ "Kesin çözülür / garanti ederiz" gibi dayanaksız sözler.
  • ❌ Sokak hayvanları için yasa dışı veya güvensiz vaatler.
  • ❌ İç muhakeme / düşünce zinciri ("analiz:", "düşünüyorum…") sızdırmak.

Değerlendirme modları

Benchmark iki katmanla puanlar:

  1. Kural tabanlı kontroller — biçim, uzunluk, yönlendirme anahtarları ve güvenlik taraması. Hızlı, nesnel taban çizgisi.
  2. LLM jüri (isteğe bağlı) — bir veya birden çok yapay zekâ değerlendirici, yanıtı gizli rubriğe göre puanlar. Çoklu jüride skorlar medyan ile birleştirilir ve jüriler ayrıştığında madde inceleme için işaretlenir. Jüri, kuralların yakalayamadığı uydurma iletişim bilgilerini yakalar.

Veri

  • 150 madde: Set A (genel/sentetik belediye senaryoları) ve Set B (Nilüfer özelinde). Liderlik tablosu Set A ve Set B skorlarını ayrı gösterir.
  • Katılımcıya altın cevap verilmez; değerlendirme gizli rubrikle yapılır.

Katılmaya hazır mısınız?

Model Şablonu ve Katılım sekmelerinde gönderim biçimini bulabilirsiniz. Özetle: predict(item) döndüren bir NiluferModel sınıfı (veya basit model.py yapılandırması) gönderilir; sistem 150 maddenin tamamı için yanıt üretip puanlar.