VERİ SETLERİ / PRETRAINING / V0

Türkçe Pretraining Corpusu

Web, akademik yayınlar ve seçili açık kaynaklardan oluşturulan Türkçe pretraining corpusu.

Sürüm kaydı

Bu sayfa, katalog kaydıyla eşleşen analiz manifestindeki sonuçları gösterir. Hesaplanmamış alanlar tahminle doldurulmaz; “Bekleniyor” olarak işaretlenir.

Mevcut ölçümler

DOĞRULANMIŞ MANİFEST
195,2 MnBelgeToplam kayıt sayısı
BekleniyorTokenHenüz hesaplanmadı
351,2 GBBoyutSıkıştırılmış yayın
BekleniyorTürkçe oranıDil tespitinden sonra
BekleniyorTam tekrarBelge özeti temelli
BekleniyorPII göstergesiİçerik değil örüntü taraması
Gösterge kaynağı

Değerler release-manifest-v1 tarafından üretilen yayın manifestinden alınır. Token sayımı, tekilleştirme, dil doğrulaması ve PII taraması tamamlanmadığı için ilgili alanlar “Bekleniyor” durumundadır.

Kaynak dağılımı

HPLT v3 Türkçe159.466.598 belge · koşullu
%81,7
Turkish FineWeb Filtered30.959.237 belge · koşullu
%15,9
DergiPark ham çıkarım773.610 belge · koşullu
%0,4
DergiPark temizlenmiş407.368 belge · koşullu
%0,2
Türkçe Wikipedia1.017.940 belge · onaylı
%0,5
TBMM tutanakları936 belge · koşullu
<%0,1
BOUN Web Corpus975.848 belge · koşullu
%0,5
OPUS OpenSubtitles276.520 belge · koşullu
%0,1
Türkçe YouTube Altyazıları1.337.036 belge · kısıtlı
%0,7

Belge sayısına göre dağılım. Hak durumu kaynak sicilinden, sayılar doğrulanmış 08/09/2026 sürüm manifestinden alınmıştır.

İşlem durumu

Toplama

Kaynak sicilinde tanımlı girdiler sürüm kaydına alınır.

Dil ve kalite

Dil, uzunluk, bozuk içerik ve biçim kontrolleri uygulanır.

Tekilleştirme

Tam kopya ve yakın tekrar ölçümleri sürüm bazında kaydedilir.

Güvenlik

PII göstergeleri ve güvenlik sınıfları yayın öncesinde incelenir.

Sürümleme

Yayın, sağlama toplamı ve analiz manifestiyle eşleştirilir.

Erişim ve koşullar

Derlem yeniden kimliklendirme, kişisel veri çıkarımı veya zararlı gözetim amacıyla kullanılamaz. Lisans, atıf ve kullanım koşulları ilgili sürüm kaydıyla birlikte yayımlanır.

Araştırma erişimi iste