Yöntem ve düzeltmeler
1. Yer bilgisinin yeniden ayrıştırılması ve köy düzeyinde konumlandırma
Derleme Sözlüğü'nde tanık yerleri Köy *İlçe, Köy -İl; … biçimindedir: * ilçe, - il işaretidir; bir ilçeden önce virgülle sayılan köyler o ilçeye aittir. İlk aktarımda bu kural uygulanmadığı ve satır sonu tirelemesi (Boz-doğan, Merzi-fon) ayıklanmadığı için “Sürez Bozdoğan” gibi yapay köy adları oluşmuştu. Dizgiler yeniden ayrıştırıldı; OCR karışıklıkları (E1malı, IIgın, * yerine ?, B. = Büyük …) ayıklandı.
Konumlandırma hiyerarşi kısıtlıdır: ilçe, kaydın ili ve derleme döneminde o ile bağlı olan bugünkü iller içinde GeoNames idari merkezleriyle eşleştirilir; köy, ilçe merkezine en yakın adaş yerleşim olarak seçilir ve 45 km'den uzaksa reddedilir. Tam eşleşme yoksa OCR karışıklık kümesiyle (h~lı, nı~m, rn~m …) ve tek düzeltme uzaklığıyla aranır. Her tanık bir kesinlik düzeyi taşır: köy 147.947, ilçe merkezi 168.620, yalnız il 98.570 tanık. Köy adları derleme dönemindeki adlardır; GeoNames'in eski ad kayıtları sayesinde bugün adı değişmiş köylerin çoğu da (ör. Erkinis → Yaylalar, Namrun → Çamlıyayla) bulunur.
2. Olasılık yüzeyi ve sıcak noktalar (madde sayfaları)
Tanık sayısını haritaya dökmek yanıltır: Niğde, Isparta, Denizli gibi yoğun derlenmiş iller her sözcükte öne çıkar. Bu yüzden Kelsall ve Diggle'ın (1995) çekirdek göreli risk yaklaşımı kullanılır: sözcüğün çekirdek yoğunluğu (σ = 15/25/40 km), bütün tanıkların aynı çekirdekle hesaplanmış yoğunluğuna bölünür. Oran, Poisson–Gama modeliyle genel ortalamaya doğru büzülür (az derlenmiş yörelerde uç değer oluşmaz); kesikli çizgi, oranın genelden büyük olma ardıl olasılığının %95'i aştığı çekirdek alanı sınırlar. Sıcak noktalar ise ≈26 km'lik altıgenlerde ampirik Bayes (Marshall 1991) oranlarıyla Getis–Ord Gi* istatistiğidir.
3. Kavram paftaları (onomasiyolojik atlas)
Tanımı kısa bir ad olan anlamlar (“Kertenkele.”, “Pancar: Kızıldip gibi tatlı.”) aynı kavram altında toplanır; hedefi o kavram olan “[-> X]” yönlendirmeli değişkeler eklenir. Biçimler, ağızlarda sık görülen denklikleri (k~g~ğ~h, t~d, ünlü değişimi, n~ŋ …) ucuz sayan ağırlıklı bir uzaklıkla, ortak yardımcı eylem ve baş adlar (etmek, kuşu, otu) atılarak ortalama bağlantılı kümelemeyle ad türlerine ayrılır. 6.110 kavramın 3.114'i haritalanacak kadar tanıklıdır. Egemen ad bölgeleri, her ad türünün çekirdek yoğunlukları karşılaştırılarak çizilir; iki adın eşit kullanıldığı eşdeğer çizgiler yürüyen kareler algoritmasıyla izoglos olarak çıkarılır. Coğrafi yapılanma = [I(tür; il) − EkarıştırmaI] / H(tür).
4. Ses denkliklerinin keşfi
Ağız biçimi ölçünlü karşılığına benzeyen tanımlar (“gapı: Kapı.”) çift olarak alınır ve Wieling, Prokić ve Nerbonne'un (2009) PMI tabanlı Levenshtein hizalamasıyla yinelemeli olarak hizalanır: hizalanan ses çiftlerinin noktasal karşılıklı bilgisi maliyete dönüştürülür, hizalama değişmeyene dek yinelenir. Denklikler ölçünlü sesin konumuna (baş, iç, son) göre ayrılır; her yerde “fırsat” (ölçünlü ses o konumda) ve “gerçekleşme” sayılarak oran yüzeyi çizilir. 150 denklik bulundu.
5. Diyalektometri
Altıgen birimlerin kavram-ad türü dağılımları ve ses denkliği oranları σ = 40 km çekirdekle yumuşatılır. Kavram başına uzaklık 1 − histogram kesişimidir (Goebl'ün göreli özdeşlik değerinin olasılık dağılımlarına genellemesi); ses bileşeni standartlaştırılmış oran farkıdır. Bu matristen klasik ÇBÖ renk haritası, bal peteği sınırları, Séguy eğrisi (d = a + b·ln km), Ward öbekleri ve kavram öbekleriyle yapılan bootstrap kararlılığı hesaplanır.
6. OCR ve bağ düzeltmeleri
Çalışma sırasında yalnız kanıtla doğrulanabilen düzeltmeler yapıldı; hepsi ocr_fix_logtablosunda eski ve yeni değeriyle, geri alınabilir biçimde saklanır:
- 16.474 kopuk yönlendirme onarıldı: “X I) -2” (eşsesli + anlam numarası) biçimleri ilk aktarımda çözülememişti.
- 867 yönlendirme hedefindeki OCR hatası düzeltildi (unarnıak → unarmak, çobansahk → çobansalık); düzeltilen biçim sözlükte madde olarak bulunmak ve yönlendiren maddeye ses bakımından benzemek zorundadır.
- 59 tanımda OCR bozulması düzeltildi (bayvan → hayvan, çoeuk → çocuk, kafah → kafalı). Ölçüt: bozuk biçim tanımlarda seyrek, sözlükte madde/değişke/tanık olarak geçmiyor; OCR karışıklığıyla tek bir yaygın sözcüğe dönüşüyor ve 5,6 milyon cümlelik GTS derleminde düzeltilmiş biçimin binde beşinden seyrek. Ağız örneklerine (iki noktadan sonrası) dokunulmadı.
- 291 tanımda satır sonu tirelemesi kaldırıldı (kala-balığı → kalabalığı, biçim-siz → biçimsiz); gerçek bileşikler korundu.
- 90 yönlendirmede OCR'de bozulan ok işareti ([_> acımık I -1]) onarıldı.
- OCR ile bozulup ayrı ilçe sayılmış 35 ilçe kaydı doğru ilçeyle birleştirildi (Ananıur → Anamur, Çeşnıe → Çeşme, Bartm → Bartın); tarihî adlar (Akçaşehir, Eğin, Hasankale) kaynağa sadık kalsın diye birleştirilmedi.
Toplam çözülmüş yönlendirme: 35.492 / 36.869.
| Madde / kayıt | Eski | Yeni |
|---|
Kaynaklar
- Getis, A. ve Ord, J. K. (1992). The analysis of spatial association by use of distance statistics. Geographical Analysis 24(3).
- Goebl, H. (1984). Dialektometrische Studien. Tübingen: Niemeyer.
- Kelsall, J. E. ve Diggle, P. J. (1995). Non-parametric estimation of spatial variation in relative risk. Statistics in Medicine 14.
- Marshall, R. J. (1991). Mapping disease and mortality rates using empirical Bayes estimators. Applied Statistics 40(2).
- Nerbonne, J. (2009). Data-driven dialectology. Language and Linguistics Compass 3(1).
- Séguy, J. (1971). La relation entre la distance spatiale et la distance lexicale. Revue de Linguistique Romane 35.
- Wieling, M., Prokić, J. ve Nerbonne, J. (2009). Evaluating the pairwise string alignment of pronunciations. LaTeCH–SHELT&R Workshop.
- Veri: GeoNames (CC BY 4.0); il/ilçe sınırları geoBoundaries (ODbL, © OpenStreetMap katkıcıları); kara ve göller Natural Earth (kamu malı).