OpenAssistant Conversations
LAION🇺🇸🇹🇷🇩🇪🇫🇷
Instruction TuningApache 2.0680 MB🇹🇷 Türkçe
İnsan tarafından annotated konuşma veri seti. RLHF ve instruction tuning için 161K konuşma ağacı.
#rlhf#konuşma#instruction
BellaTurca Türkçe Derlem
turkish-nlp-suite🇹🇷
Metin Üretimi / Dil Modeli EğitimiCC BY-SA 4.0245 GB / 30B kelime🇹🇷 Türkçe
Türkçe dil modelleri eğitimi için hazırlanan büyük ölçekli BellaTurca derlemi. Hugging Face kartı yaklaşık 245 GB ve 30 milyar kelimelik Türkçe metin koleksiyonu olarak tanımlar.
#nlp#türkçe#metin#dil modeli#derlem
Common Voice Turkish
Mozilla Foundation🇹🇷
Konuşma TanımaCC0 1.018 GB🇹🇷 Türkçe
Mozilla Common Voice projesinin Türkçe bölümü. Farklı aksanlar ve demografilerden gönüllü ses kayıtları.
#ses#konuşma#asr
Turkish Sentiment Dataset
winvoker🇹🇷
Duygu AnaliziCC BY-SA 4.0492K+ labeled sentences🇹🇷 Türkçe
Türkçe duygu analizi için pozitif, negatif ve nötr etiketli metin sınıflandırma veri seti. Hugging Face kartında Türkçe dil, sentiment-classification görevi ve CC BY-SA 4.0 lisansı doğrulanmıştır.
#duygu analizi#sentiment#türkçe#text-classification
Treebank Benchmarking (BOUN / IMST)
turkish-nlp-suite🇹🇷
Sözdizimi AnaliziCC BY-SA 4.0BOUN + IMST configs🇹🇷 Türkçe
Türkçe BOUN ve IMST bağımlılık ağaç bankası yapılandırmalarını içeren doğrulanmış Hugging Face veri seti. Morfolojik ve sözdizimsel değerlendirme için kullanılır.
#treebank#sözdizimi#morfoloji#türkçe
Turkish Wikipedia QA 4M
hcsolakoglu🇹🇷
Soru CevaplamaCC BY-NC-SA 4.01M-10M examples🇹🇷 Türkçe
Türkçe Wikipedia içeriğinden türetilmiş geniş ölçekli soru-cevap veri seti. Hugging Face kartında soru-cevap görevi, Türkçe dili ve CC BY-NC-SA 4.0 lisansı belirtilir.
#qa#türkçe#wikipedia#soru-cevap
BilCat Haber Sınıflandırma
Bilkent Bilgi Erişim Grubu🇹🇷
Metin sınıflandırmaCC7.540 satır🇹🇷 Türkçe
BilCat, Milliyet ve TRT kaynaklı Türkçe haber metinlerini kategori etiketleriyle sunan, haber sınıflandırma ve metin kategorileştirme çalışmalarında kullanılabilen veri kümesidir.
#Türkçe#haber#sınıflandırma#NLP