Bir sözcüğün sık olduğunu söylemek ilk bakışta yalın bir sayma işlemi gibi görünür. Oysa sayılacak şeyin ne olduğu belirlenmeden elde edilen sayı, dil hakkında güvenilir bir yargı kurmaya yetmez. Yazıda karşılaşılan her çekimli biçim ayrı mı tutulacaktır, yoksa bunlar bir sözlükbirimin altında mı birleştirilecektir? Büyük harfle başlayan kullanımlar, yazım farklılıkları, birleşik yapılar ve çok sözcüklü birimler nasıl ele alınacaktır? Aynı toplam sıklığa sahip iki birimden biri yüzlerce kaynakta düzenli biçimde görülürken öteki tek bir kitapta yoğunlaşmışsa bu iki sayı aynı dilsel durumu anlatmaz. Bu nedenle sözcük sıklığı, yalnızca kaç kez sorusunun değil, nerede, ne zaman, hangi biçimde, hangi anlamda ve ne ölçüde yaygın sorularının birlikte yanıtlandığı bir araştırma konusudur. Türkçe söz konusu olduğunda eklemeli yapı, türetme gücü ve söz dizimsel seçenekler bu soruları daha da önemli kılar. Sıklık çalışması, doğru tasarlandığında sözlük hazırlamadan dil öğretimine, tarihsel değişimi izlemekten doğal dil işlemeye kadar uzanan alanlarda güçlü bir kanıt sunar; yanlış tasarlandığında ise büyük sayıların verdiği güven duygusunun ardında tür, kaynak ve anlam yanlılıklarını gizleyebilir.
Bir sıklık değerinin dilsel kanıta dönüşme yolu
- Birim Biçim, sözlükbirim, anlam, öbek ya da yapı seçimi
- Sayım Doğrulanmış metinlerde yinelenebilir karşılaşma hesabı
- Ölçek Derlem büyüklüğüne göre karşılaştırılabilir oran
- Dağılım Belge, tür, alan ve kaynaklar arasındaki yaygınlık
- Bağlam Birimin komşuları, görevi ve anlam ayrımları
- Zaman İlk görünüm, süreklilik, sıçrama ve gerileme
- Yorum Sınırları açıklanmış sözlüksel ve dilbilimsel sonuç
Sıklık kavramı ve sınırları
Sözcük sıklığı en dar anlamıyla, önceden tanımlanmış bir dil biriminin sınırları belli bir metin kümesindeki karşılaşma sayısıdır. Bu tanımda üç koşul özellikle önemlidir. Dil biriminin ne olduğu, metin kümesinin hangi ölçütlerle kurulduğu ve karşılaşmaların hangi işlemlerden sonra sayıldığı açıkça belirtilmelidir. Dolayısıyla sıklık, sözcüğün üzerinde değişmeden duran doğal bir nicelik değildir. Bir gazete derleminde yüksek görünen birim, şiir ya da gündelik konuşma derleminde daha alt sıralarda kalabilir. Aynı birimin bugünkü sıklığıyla elli yıl önceki sıklığı da farklı olabilir. Sıklık değeri ancak üretildiği veri kesitinin tarihi, kapsamı ve yöntemiyle birlikte anlam kazanır.
Sıklığı yalnızca yaygınlık ya da önem ile özdeşleştirmek yanıltıcıdır. Bir metinde çok yinelenen özel ad, o metnin konusu bakımından merkezî olabilir; fakat genel dilin ortak söz varlığında aynı konuma sahip olmayabilir. Buna karşılık seyrek görülen bir sözcük, belirli bir kavramı başka bir birimin karşılayamadığı kesinlikle taşıdığı için sözlük açısından değerli olabilir. Nicel sonuç, dilsel değerlendirmeyi ortadan kaldırmaz; değerlendirmenin nereden başlaması gerektiğini gösterir. Sağlam bir sıklık çalışması bu nedenle sayıyı son söz olarak değil, açıklanması gereken bir iz olarak görür.
Neyi sayıyoruz?
Metindeki boşluklarla ayrılmış her dizi yüzey biçimi olarak sayıldığında gördüm, görmüş, görecek ve görüyordu ayrı satırlara dağılır. Bunlar gör- eyleminin sözlükte temsil edilen biçimi altında birleştirildiğinde sözlükbirim sıklığı elde edilir. İki yaklaşımın yanıtladığı soru aynı değildir. Yüzey biçimi sayımı belirli ek dizilerinin ve yazılışların kullanımını gösterirken sözlükbirim sayımı çekim çeşitliliğinin arkasındaki ortak söz varlığını görünür kılar. Anlam sıklığı ise bir adım daha ileri gider ve aynı maddebaşının farklı anlamlarını bağlama göre ayırmayı gerektirir. Bu ayrım otomatik değil, dilbilimsel çözümleme ve belirsizlik denetimi isteyen bir işlemdir.
Sayım birimi yalnızca tek sözcük olmak zorunda değildir. Karar vermek, göz önünde bulundurmak ya da veri tabanı gibi çok sözcüklü yapılar, bileşenlerinin tek tek sıklığından farklı bir kullanım düzeni gösterebilir. Noktalama, kesme işareti, kısa çizgi, sayılar, kısaltmalar ve büyük harf kullanımı da sayım sonucunu değiştirir. Örneğin ada ile özel ad olan Ada aynı karakterlerden oluşsa bile bağlamsal görevleri farklıdır. Bu yüzden araştırma, sayımdan önce bir birim sözleşmesi kurar. Sonuçların yeniden üretilebilmesi için hangi biçimlerin birleştirildiği, hangilerinin ayrı bırakıldığı ve hangi belirsizliklerin çözülemediği bu sözleşmede görünür olmalıdır.
Derlem tasarımı sayıyı nasıl biçimlendirir?
Bir sıklık listesinin niteliği, çoğu zaman sayma yazılımından önce derlemin bileşimine bağlıdır. Milyarlarca sözcükten oluşan bir veri kümesi yalnızca tek bir yayın türünün tekrarlarından kurulmuşsa büyük fakat dar bir kullanım alanını temsil eder. Haber, köşe yazısı, kitap, bilimsel makale, tez, forum ve konuşma gibi kaynaklar farklı söz varlığı düzenlerine sahiptir. Dengeli bir tasarım her türü zorunlu olarak eşit miktarda toplamak anlamına gelmez. Amaçlanan evren için oranların gerekçelendirilmesi ve baskın kaynakların sonucu tek başına belirlemesinin önlenmesi gerekir. Temsil gücü, salt hacimden değil, çeşitlilik ile denetlenmiş hacimden doğar.
Aynı metnin farklı adreslerden, baskılardan ya da dosya biçimlerinden yeniden alınması sıklığı yapay biçimde büyütür. Yinelenen içerik denetimi bu nedenle bir temizlik ayrıntısı değil, ölçümün temel koşuludur. OCR bozulmaları da gerçekte bulunmayan biçimler üreterek seyrek sözcük kuyruğunu şişirebilir. Kaynak tarihi, belge türü, yazar bilgisi ve işleme tarihi saklanmadığında sonuçların zaman ve alan bakımından yorumlanması güçleşir. Güvenilir sıklık mimarisi, metni yalnızca depolamaz; her sayının hangi belgelere dayandığını geriye doğru izlenebilir kılar. Böylece kuşkulu bir yükseliş, kaynaklarına dönülerek denetlenebilir.
Mutlak, göreli ve normalleştirilmiş sıklık
Mutlak sıklık birimin toplam karşılaşma sayısını verir. Aynı büyüklükteki iki veri kesiti karşılaştırılıyorsa bu sayı yeterli olabilir; ancak derlem parçaları farklı büyüklükte olduğunda ham sayılar yanıltır. On milyon sözcüklük bir alanda bin kez geçen birim ile yüz milyon sözcüklük alanda iki bin kez geçen birimden hangisinin daha yoğun kullanıldığı ham toplama bakılarak anlaşılamaz. Göreli sıklık, karşılaşma sayısını bölümün toplam sözcük sayısına oranlar. Sonuç genellikle milyon sözcük başına kullanım gibi okunabilir bir ölçeğe taşınır. Böylece büyüklük farkı denetlenir ve alanlar karşılaştırılabilir hâle gelir.
Normalleştirme karşılaştırmayı mümkün kılar, fakat her sorunu çözmez. Kısa belgelerde tek bir karşılaşma yüksek bir oran doğurabilir; metin türlerinin iç dağılımı da oranı etkileyebilir. Ayrıca çok seyrek olaylarda küçük sayısal değişimler büyük yüzdelik oynamalar yaratır. Bu nedenle göreli sıklık, mutlak sayı ve belge sayısıyla birlikte verilmelidir. İyi bir gösterim, kullanıcıya tek bir parlak değer sunmak yerine değerin dayandığı ölçeği ve belirsizliği açık eder. Bu yaklaşım özellikle büyümeye devam eden canlı derlemlerde önemlidir; yeni metinler eklendikçe pay ve payda birlikte değişir, sıralamalar yeniden kurulabilir.
Sıra-sıklık dağılımı ve Zipf yaklaşımı
Sözcükler en sık kullanılandan en seyreğe doğru dizildiğinde birkaç birimin çok yüksek, büyük çoğunluğun ise düşük sıklığa sahip olduğu eğri ortaya çıkar. Zipf yaklaşımı, sıralamadaki konum ile sıklık arasında yaklaşık ters yönlü bir ilişki bulunduğunu söyler. İkinci sıradaki birimin birinciye, yüzüncü sıradakinin onuncuya göre beklenen sıklığı düzenli biçimde azalır; fakat gerçek metinler kusursuz bir matematik çizgisine oturmaz. Metin türü, yazar, konu, dil bilgisel sınıf ve örneklem büyüklüğü eğrinin farklı bölgelerinde sapmalar üretir. Yaklaşımın gücü tek tek sözcükleri önceden bildirmesinde değil, söz varlığının eşitsiz dağılımını özetlemesindedir.
Dağılımın baş bölgesinde bağlaçlar, adıllar, yardımcı unsurlar ve çok genel anlamlı sözcükler yoğunlaşır. Orta bölgede geniş kullanım alanına sahip içerik sözcükleri, uzun kuyrukta ise alan terimleri, yeni türetmeler, özel kullanımlar ve bir kez görülen biçimler yer alır. Bu bölgeler kesin sınırlara sahip değildir; derlem büyüdükçe sözcükler arasında geçiş olur. Sıra değişimini anlam değişimi sanmamak gerekir. Bir birimin aşağı düşmesi, kendi kullanımı azalmadan başka birimlerin daha hızlı artmasından da kaynaklanabilir. Bu nedenle sıra, sıklığın kolay okunur özeti olmakla birlikte zaman dizisinden ve gerçek oranlardan bağımsız yorumlanmamalıdır.
Uzun kuyruk ve seyrek olaylar
Büyük bir derlemde sözcük türlerinin önemli bir bölümü yalnızca bir kez ya da birkaç kez görülür. Bir kez karşılaşılan türe hapaks denir. Bu bölge ilk bakışta ölçülemeyecek kadar gürültülü görünebilir; oysa dilin türetme gücü, yeni adlandırmalar, uzmanlık söz varlığı ve yazara özgü seçimler çoğunlukla burada belirir. Seyreklik tek başına değersizlik işareti değildir. Bununla birlikte OCR hataları, yanlış sözcük bölmeleri, yabancı diziler ve özel adlar da aynı bölgede birikir. Uzun kuyruk bu yüzden hem dilsel yeniliğin hem veri kirliliğinin buluştuğu, otomatik seçimin insan denetimine en çok gereksinim duyduğu alandır.
Derlem büyüdüğünde yalnızca bilinen sözcüklerin sayısı artmaz; daha önce görülmemiş türler de sürekli eklenir. Bu olgu, söz varlığının kapalı bir kutu gibi ele alınamayacağını gösterir. Yeni türlerin geliş hızı yavaşlayabilir, fakat özellikle türetken ekleri ve birleşme imkânları güçlü dillerde bütünüyle sona ermez. Bir birimin ilk kez görülmesi onun o anda doğduğu anlamına da gelmez. Elde edilen tarih, derlemin gözlem sınırındaki ilk kanıttır. Seyrek biçimleri incelerken sıklık, kaynak çeşitliliği, bağlamsal tutarlılık ve tarihsel süreklilik birlikte değerlendirilirse gerçek oluşumlarla işleme hataları daha güvenilir biçimde ayrılabilir.
Dağılım, yaygınlık ve yoğunlaşma
Aynı toplam sıklığa sahip birimler derlem içinde bütünüyle farklı dağılımlar gösterebilir. Birincisi yüz ayrı belgede yaklaşık dengeli biçimde, ikincisi tek bir uzun belgede yüz kez geçmiş olabilir. Genel dil kullanımı araştırılıyorsa birinci birim daha yaygındır; belirli bir yazarın ya da konunun ayırt edici söz varlığı araştırılıyorsa ikinci birim daha açıklayıcı olabilir. Belge sıklığı, birimin görüldüğü farklı belge sayısını; dağılım ölçüleri ise bu karşılaşmaların bölümler arasında ne kadar dengeli yayıldığını gösterir. Ham sıklık ile yaygınlık böylece birbirini tamamlayan iki ayrı kanıt hâline gelir.
Dağılımı tek sayıya indiren ölçüler farklı varsayımlar taşır. Bazıları metin bölümleri arasındaki eşitsizliği cezalandırır, bazıları karşılaşmalar arasındaki mesafeyi hesaba katar, bazıları da kaynağa göre ağırlıklandırılmış sıklık üretir. ARF olarak bilinen ortalama indirgenmiş sıklık yaklaşımı, birim tek bir yerde kümelendiğinde değeri düşürerek daha düzenli yayılmış kullanımları öne çıkarır. Hangi ölçünün seçileceği araştırma sorusuna bağlıdır. En sağlıklı sunum, kullanılan yaygınlık ölçüsünü adlandırır ve ham veriyi erişilebilir tutar; çünkü farklı dağılımlar aynı özet puana yaklaşabilir.
Zaman, alan ve kullanım yaşam çevrimi
Sıklık zamana göre dilimlendiğinde bir sözcüğün kullanım yaşam çevrimi görünür olur. Bazı birimler uzun süre düşük fakat kararlı bir düzeyde kalır, bazıları belirli bir olayla birlikte hızla yükselip kısa sürede geriler, bazıları ise farklı alanlara yayılarak kalıcılaşır. İlk ve son görülme tarihleri, tek başlarına doğuş ve ölüm tarihi değildir; derlemdeki kanıt aralığını gösterir. Dönem başına göreli sıklık, belge yaygınlığı ve kaynak türü çeşitliliğiyle birleştirildiğinde geçici sıçrama ile yerleşik kullanım arasındaki fark daha açık okunur.
Alan karşılaştırması da benzer bir dikkat gerektirir. Bilimsel metinde yüksek olan birim gündelik dilde seyrek olabilir; bir terim başka alana geçtiğinde yeni bir anlam ya da mecaz kazanabilir. Bu değişim yalnızca toplam sayıya bakılarak yakalanamaz. Zaman-alan matrisi, her dönemde hangi belge türlerinin artışı taşıdığını gösterir. Ani yükselişin onlarca bağımsız kaynakta mı, aynı haberin çoğaltılmış kopyalarında mı gerçekleştiği ayrıca denetlenmelidir. Böylece sıklık eğrisi, yüzeydeki hareketin yanında hareketi oluşturan dolaşım düzenini de açıklayan tarihsel bir göstergeye dönüşür.
Türkçenin biçimbilgisel yapısı ve sıklık
Türkçede bir kök ya da gövde, çekim ve yapım ekleriyle çok sayıda yüzey biçimine girebilir. Ev, evler, evimiz, evlerimizden gibi diziler ortak bir sözlüksel çekirdeğe bağlanırken görev ve anlam bakımından farklı bilgiler taşır. Yalnız yüzey biçimlerine dayalı sıralama, sözlükbirimin toplam kullanımını parçalara ayırır; yalnız sözlükbirime dayalı sıralama ise eklerin ve biçimbilgisel seçeneklerin dağılımını örter. Türkçe için güçlü çözüm, iki görünümü birbirinin yerine koymak değil, yan yana sunmaktır. Kök ya da gövde sıklığı söz varlığını, ek dizisi sıklığı ise dil bilgisel seçimleri görünür kılar.
Lemalaştırma işlemi de bütünüyle mekanik değildir. Yüz sözcüğü sayı adı, organ adı ya da yüzmek eyleminin köküyle ilişkili biçim olarak farklı bağlamlarda çözümlenebilir. Yaz sözcüğü mevsim adı veya yazmak eyleminin emir biçimi olabilir. Yanlış çözümleme farklı sözlükbirimlerin sıklıklarını birbirine aktarır. Yapım ekleri ayrıca yeni sözlükbirimler kurduğu için çekim ekleriyle aynı biçimde silinemez. Sıklık sistemi, biçimbirim sınırlarını, ses değişmelerini, kaynaştırma unsurlarını ve bağlamdan doğan belirsizlikleri Türkçenin kendi yapısına göre ele almalıdır. İngilizce için tasarlanmış yalın kök bulma işlemi bu ayrımları güvenilir biçimde koruyamaz.
Çok sözcüklü birimlerin sıklığı
Söz varlığı yalnızca boşluklar arasındaki tek sözcüklerden oluşmaz. Deyimler, birleşik fiiller, terimler, kalıplaşmış sözler ve ad tamlamaları birden çok sözcükle kuruldukları hâlde kullanımda bütünlüklü bir görev üstlenebilir. Bu yapıların sıklığı, bileşen sıklıklarının basit toplamıyla açıklanamaz. Karar ve vermek ayrı ayrı çok sık olabilir; ancak karar vermek yapısının kendi bağlamı, çekim örüntüsü ve anlam bütünlüğü vardır. Çok sözcüklü birim sayımı, araya girebilen sözcükleri ve çekimli değişkeleri tanıyan esnek sorgular gerektirir.
Yan yana gelme sayısı yüksek olan her sözcük dizisi sözlükbirim değildir. Serbest tamlamalar, belirli bir metin konusunun zorunlu komşulukları ve yinelenen başlıklar da yüksek n-gram sıklığı üretebilir. Bir yapının sözlüksel değerini değerlendirirken beklenenden fazla birliktelik, farklı kaynaklara yayılma, bileşenlerin anlamından bütünüyle kestirilemeyen bir bütün anlamı, biçimsel sınırlılık ve bağlamsal kararlılık birlikte incelenir. Sıklık burada eleme ve önceliklendirme sağlar; sözlükbirim kararını tek başına vermez. Bu ayrım, yeni öbekler aranırken rastlantısal komşulukların maddebaşı yapılmasını önler.
Anlam sıklığı ve çok anlamlılık
Bir maddebaşının toplam sıklığı, onun bütün anlamlarının eşit ölçüde kullanıldığını göstermez. Ağ sözcüğü balık tutma aracı, örgü sistemi ve bilgisayar bağlantılarıyla ilgili anlamlarda geçebilir. Zaman içinde bu anlamlardan birinin payı artarken toplam sıklık yaklaşık aynı kalabilir. Sözlükçülük açısından gerekli olan, yalnızca maddebaşının kaç kez geçtiğini değil, örneklerin hangi anlam kümelerine dağıldığını bilmektir. Bağlamsal sözcükler, söz dizimsel görevler ve konu alanları bu ayrım için kanıt sağlar; kesin olmayan örnekler ise zorla tek bir kümeye yerleştirilmemelidir.
Anlam sıklığı, anlamların sözlükteki sırasını ve örnek seçimlerini destekleyebilir. Bununla birlikte en sık anlamın her kullanıcı grubu için en temel anlam olduğu varsayılmamalıdır. Çocuk dili, uzmanlık iletişimi ve bölgesel kullanım farklı dağılımlar gösterebilir. Ayrıca mecazlaşma çoğu zaman bir anda ayrı bir anlam gibi belirmez; bağlamlar arasında dereceli bir yayılma izler. Kümeleme yöntemleri yeni bir kullanım bölgesi gösterebilir, fakat bu bölgenin ayrı anlam mı, bağlamsal çeşitlenme mi olduğuna örnekler üzerinden karar verilir. Sıklık, çok anlamlılığın haritasını çıkarır; haritadaki sınırları editoryal yorum belirler.
Dil bilgisel yapı, türetkenlik ve sıklık
Sıklık çalışmaları yalnız sözcüklere değil, ekler ve yapılar arasındaki seçimlere de uygulanır. Bir yapım ekinin toplam karşılaşma sayısı onun belirli birkaç gövdede çok yinelendiğini gösterebilir. Türetkenlik için daha açıklayıcı olan, ekin kaç farklı tabana bağlandığı ve yeni tabanlarla görülmeye devam edip etmediğidir. Bu nedenle örnek sıklığı ile tür sıklığı ayrılır. Yüksek örnek sıklığı yerleşmiş birkaç türetmeyi, yüksek tür sıklığı ise daha geniş bir kurma imkânını işaret edebilir. İki ölçü birlikte okunduğunda ekin hem bellekteki yerleşik örüntüsü hem yeni sözcük kurma açıklığı görülebilir.
Kullanım sıklığı dil bilgisel yapının biçimini de etkileyebilir. Çok sık yinelenen diziler konuşur için bütünleşmiş bir kalıp hâline gelebilir, sesçe aşınabilir ya da yeni görevlere açılabilir. Ancak derlemdeki birliktelik, tek başına tarihsel neden-sonuç ilişkisini kanıtlamaz. Yapıların yaşı, tür dağılımı ve konuşur verisi gibi ek kanıtlar gerekir. Sıklık ile dil bilgisi arasındaki ilişki çift yönlüdür. Dilin kuralları hangi biçimlerin kurulabileceğini sınırlar; kullanım tercihleri de bu imkânlar arasından bazılarını öne çıkarıp daha erişilebilir ve yerleşik hâle getirir.
Sıklık, biliş ve dil işleme
Sık karşılaşılan sözcüklerin tanınma ve üretim süreçlerinde daha kolay erişilebilir olabildiği, psikodilbilimsel araştırmaların temel gözlemlerinden biridir. Bunun nedeni yalnızca çıplak karşılaşma sayısı değildir. Sözcüğün yaşı, uzunluğu, biçimsel ailesi, anlam sayısı, bağlamda öngörülebilirliği ve konuşurun deneyimi de işlemeyi etkiler. Aynı derlem sıklığına sahip iki birim bu değişkenler yüzünden farklı sürelerde tanınabilir. Derlem sayısı, toplumsal kullanıma ilişkin güçlü bir yaklaştırma sunar; bireyin zihinsel sözlüğündeki ağırlığın doğrudan ölçümü olarak ele alınamaz.
Bağlamsal öngörülebilirlik sıklık etkisini kimi zaman güçlendirir, kimi zaman azaltır. Seyrek bir terim kendi uzmanlık bağlamında güçlü biçimde beklendiğinde kolayca işlenebilir; çok sık bir sözcük alışılmadık bir görevde kullanıldığında daha fazla yorum çabası isteyebilir. Bu nedenle dil modellerinde ve insan işlemleme deneylerinde koşullu sıklık önem kazanır. Soru, birimin bütün derlemde kaç kez geçtiğinden, belirli bir bağlamdan sonra ne ölçüde beklendiğine doğru genişler. Böyle bir yaklaşım sıklığı durağan bir liste değeri olmaktan çıkarıp ardışık seçimlerin olasılık düzeni içinde yorumlar.
Sözlükçülükte sıklığın kullanımı
Sıklık, sözlüğe alınacak maddebaşlarının belirlenmesi, anlamların sıralanması, örneklerin seçilmesi ve kullanım etiketlerinin denetlenmesi için önemli bir kanıttır. Yüksek sıklık, birimin kullanıcı tarafından aranma ihtimalini artırabilir; düşük sıklık ise özellikle yeni, teknik ya da tarihsel bir birimin dışlanması için tek başına gerekçe oluşturmaz. Editoryal karar, sıklığı yaygınlık, sözlüksel bütünlük, anlam ayırt ediciliği ve kaynak güvenilirliğiyle birleştirir. Böylece sözlük hem dilin merkezindeki kullanımları hem de açıklanmaya gereksinim duyulan çevre birimleri kapsayabilir.
Tanık seçerken de en sık cümleyi almak yerine anlamı açık, doğal ve gereksiz kişisel ya da tartışmalı içerikten uzak örnekler aranır. Bir sözcüğün binlerce kez geçmesi, bütün karşılaşmaların sözlük tanımı için eşit değer taşıdığı anlamına gelmez. Anlam kümelerinin merkezine yakın örnekler tanımı besler; sınır örnekleri ise mecazlaşma ve yeni anlam ihtimalini gösterir. Sıklık tablosuyla bağlam ekranı arasındaki bağ bu yüzden korunmalıdır. Sözlükçü sayıyı gördükten sonra tanıklara döner, tanıkların açıklayamadığı nicel sıçramayı doğrulanmış bir bulgu gibi yayımlamaz.
Dil öğretimi ve temel söz varlığı
Sıklık listeleri, öğrenenin erken aşamada çok sayıda metni anlamasına yardımcı olacak söz varlığını belirlemek için kullanılır. Fakat en üst sıradaki işlev sözcüklerini art arda öğretmek, iletişim gereksinimlerini tek başına karşılamaz. Kapsam, yaygınlık, konu çeşitliliği ve öğrenme amacı birlikte değerlendirilmelidir. Genel hizmet listeleri farklı derlemlerde kararlı biçimde görülen çekirdek birimleri arar; alan öğretimi ise bu çekirdeğe mesleki ya da akademik söz varlığını ekler. Böylece liste, tek bir kaynağın gündemini değil, farklı iletişim durumlarının ortak kesişimini yansıtmaya çalışır.
Türkçe öğretiminde çekimli biçimler ile sözlük biçimi arasındaki uzaklık ayrıca gözetilmelidir. Öğrenen, yalnız gelmek maddesini bilerek geldiğimizde biçimini kendiliğinden çözümleyemeyebilir. Bu nedenle öğretim sıklığı, sözlükbirimlerin yanı sıra yüksek sıklıklı ek dizilerini ve kalıpları da kapsamalıdır. Kapsama oranı, seçilen listenin bir metindeki karşılaşmaların ne kadarını açıkladığını gösterir; ancak anlaşılabilirlik hakkında kesin eşik vermez. Az sayıdaki anahtar içerik sözcüğünün bilinmemesi, yüksek genel kapsama rağmen metnin ana fikrini kapalı bırakabilir.
Hesaplama düzeni ve ölçeklenebilirlik
Büyük derlemlerde sıklık hesabının doğruluğu kadar yeniden çalıştırılabilir olması da önemlidir. Metin alma, kodlama düzeltme, cümleleme, birimlere ayırma, özel ad ve sayı işleme, lemalaştırma, belirsizlik çözme ve toplulaştırma aşamaları sürümlenmelidir. Aynı sorgunun farklı günlerde farklı sonuç vermesi derlem büyümesinden mi, yazılım değişikliğinden mi kaynaklanmıştır sorusu ancak bu kayıtlarla yanıtlanabilir. Sayım tablosu, özgün belge kimliğini ve işleme sürümünü koruduğunda hatalı bir kaynağın etkisi bütün derlemi yeniden kurmadan geri alınabilir.
Hızlandırma için önceden toplulaştırılmış tablolar, başlangıç harfi ve tarih gibi sorgu yollarına uygun veri atlama indeksleri, bölümleme ve sonuç önbelleği kullanılabilir. Bu teknikler kaliteyi düşürmek zorunda değildir; aynı dilsel sözleşmenin daha az veri taranarak uygulanmasını sağlar. Yaklaşık sayım çok büyük keşif sorgularında yararlı olsa da sözlük kararında gösterilen değerlerin kesin hesapla doğrulanması gerekir. Performans kazanımı, farklı normalizasyonların yanlışlıkla birleştirilmesi veya bağlamın kaybedilmesi pahasına sağlanmamalıdır. Hızlı sistem, sonucu nasıl ürettiğini açıklayabildiği ölçüde bilimsel araçtır.
Bitigçi derleminde sıklığın okunması
Bitigçi gibi büyümeyi sürdüren bir derlemde sıklık değeri canlı bir kesiti temsil eder. Yeni kitaplar, süreli yayınlar, bilimsel metinler ve web belgeleri eklendikçe özellikle orta ve seyrek bölgelerdeki sıralar değişir. Bu yüzden sonuç ekranında toplam karşılaşma, göreli sıklık, farklı belge sayısı, belge türlerine dağılım ve ölçüm zamanı birlikte okunmalıdır. İlk ve son görülme tarihleri, birimin derlem içindeki gözlenebilir yaşam aralığını gösterir. Bu tarihler belgeye ait özgün yayın bilgisinden alınmalı, veritabanına eklenme tarihiyle karıştırılmamalıdır.
Yeni sözcük araştırmasında düşük sıklık otomatik kabul, yüksek sıklık da otomatik ret nedeni değildir. Adayın mevcut sözlükte bulunup bulunmadığı, doğru biçimde lemalaştırılıp lemalaştırılmadığı, özel ad veya OCR bozulması olup olmadığı, bağımsız kaynaklara yayılıp yayılmadığı ve bağlamlarının ortak bir anlam çekirdeği taşıyıp taşımadığı denetlenir. Daha önce zayıf kalan adaylar derlem büyüdüğünde yeniden incelenebilir. Böylece sıklık, tek seferlik bir eşik olarak değil, kanıtın zaman içinde güçlenmesini izleyen editoryal bir gösterge olarak kullanılır.
Karşılaştırma, etki büyüklüğü ve belirsizlik
İki dönem veya metin türü arasındaki sıklık farkı, yalnızca değerlerin birbirinden çıkarılmasıyla yorumlanmamalıdır. Karşılaştırılan bölümlerin büyüklüğü, belge sayısı ve iç çeşitliliği sonucun ne kadar kararlı olduğunu belirler. Çok büyük bir derlemde küçük bir oran farkı istatistiksel olarak ayırt edilebilir görünse bile dilsel bakımdan önemsiz kalabilir; küçük bir veri kesitindeki büyük fark ise birkaç belgenin etkisinden doğabilir. Bu yüzden anlamlılık sınamasının yanında farkın büyüklüğü, güven aralığı ve kaynaklara göre tutarlılığı da gösterilmelidir. Nicel kesinlik, yorumun dilsel önemini kendiliğinden sağlamaz.
Kararlılığı sınamanın yollarından biri, belgeleri yeniden örnekleyerek aynı hesabı çok sayıda alt kümede yinelemektir. Bir sözcük bu örneklerin çoğunda benzer sırayı ve oranı koruyorsa sonuç tek tek belgelerin seçimine daha az bağımlıdır. Sıralaması geniş aralıkta değişen seyrek birimlerde ise kesin sıra vermek yerine bir sıklık bandı sunmak daha dürüsttür. Alanlar arası karşılaştırmada ortak normalizasyon ve aynı birim sözleşmesi kullanılmalı, bir bölüm lemalaştırılmışken öteki yüzey biçimleriyle sayılmamalıdır. Karşılaştırılabilirlik, hesap sonrasında eklenen bir özellik değil, veri hazırlama aşamasında kurulan yöntemsel bir eşitliktir.
Yaygın yorumlama hataları
En yaygın hata, en sık birimi en önemli, en temel veya en doğru birim saymaktır. Sıklık kullanım miktarını ölçer; kültürel değer, kavramsal gereklilik ve anlatıdaki işlev başka kanıtlar ister. İkinci hata, büyük derlemin kendiliğinden dengeli olduğunu varsaymaktır. Tekrarlı ve tek türden oluşan büyük veri, küçük fakat özenle örneklenmiş bir derlemden daha yanlı olabilir. Üçüncü hata, sıfır karşılaşmayı yokluk olarak yorumlamaktır. Birim veri kesitinde görülmemiş olabilir; bu durum dilde hiç kullanılmadığını kanıtlamaz.
Başka bir hata, biçim, sözlükbirim ve anlam sıklığını birbirinin yerine kullanmaktır. Bu karışıklık özellikle Türkçede çekimli biçimleri gereksiz yere seyrek, ortak gövdeyi ise bağlamından fazla genel gösterebilir. Kaynak yoğunlaşmasını yok saymak, kopya metinleri temizlememek ve zaman aralıklarını eşitmiş gibi karşılaştırmak da sonucu bozar. Son olarak, küçük farklara kesin sıralama anlamı yüklenmemelidir. Yakın sıklıktaki iki birimin yeri yeni veriyle kolayca değişebilir. Bilimsel anlatım, sayının kesinliğini değil, ölçümün duyarlılığını ve sınırlarını da açıkça bildirir.
Sonuç ve bütüncül değerlendirme
Sözcük sıklığı, dilin çok küçük bir merkez ile geniş bir çevre arasında örgütlendiğini gösterir. Merkezde farklı metinleri birbirine bağlayan yüksek sıklıklı birimler, çevrede ise konuyu, üslubu, uzmanlığı ve yeniliği taşıyan daha seyrek seçimler bulunur. Bu yapı durağan değildir. Yeni belgeler, yeni alanlar ve yeni kullanım biçimleri hem çevreyi genişletir hem merkezin iç sırasını değiştirir. Sıklık çalışmasının asıl değeri, bu hareketi yalnızca listelemekten değil, hareketin kaynak, bağlam, anlam ve zaman içindeki nedenlerini araştırmaya açmasından gelir.
Güvenilir sonuç için biçim ile sözlükbirim, toplam ile oran, yoğunluk ile yaygınlık, eşzamanlı görünüm ile tarihsel değişim ayrı tutulmalı ve sonra ilişkilendirilmelidir. Türkçenin eklemeli yapısı, bu çok katmanlı okumayı bir tercih olmaktan çıkarıp zorunluluk hâline getirir. Sıklık, sözlük maddesini tek başına yazmaz, bir anlamı tek başına ayırmaz ve bir dil bilgisi kuralını tek başına kanıtlamaz. Buna karşılık doğru bağlamla birleştiğinde hangi sorunun önce sorulacağını, hangi örneklerin incelenmesi gerektiğini ve hangi genellemenin veriyle sınanabileceğini olağanüstü açıklıkla gösterir.
Sorular ve yanıtlar
Sık karşılaşılan teknik sorular, maddenin doğrulanmış kavramsal dayanaklarıyla ve bölüm açıklamalarıyla birlikte yanıtlanır.
En sık sözcük, dildeki en önemli sözcük müdür?
Hayır. Sıklık, belirli bir veri kümesindeki kullanım miktarını gösterir. Kavramsal önem, kültürel değer, metindeki kilit rol ya da öğrenme güçlüğü farklı özelliklerdir. Bağlaç ve adıl gibi işlev sözcükleri çok sık olabilir; seyrek bir bilim terimi ise belirli bir bilgiyi aktarmak için vazgeçilmez olabilir. Bu nedenle önem yargısı, sıklıkla birlikte anlam, işlev, alan ve kullanıcı gereksinimine dayanmalıdır.
Çok büyük bir derlem güvenilir sıklık için tek başına yeterli midir?
Yeterli değildir. Büyük hacim seyrek olayları görmeye yardımcı olur, fakat kaynak çeşitliliğini ve temsil gücünü kendiliğinden sağlamaz. Aynı haberin çok sayıda kopyası, tek bir yayın türünün baskınlığı veya belirli yılların aşırı temsili sonucu yönlendirebilir. Hacim; yinelenen içerik denetimi, belge türü dengesi, tarih bilgisi ve kaynak yaygınlığıyla birlikte değerlendirilirse güvenilir kanıta dönüşür.
Yüzey biçimi ile sözlükbirim sıklığı neden ayrı tutulur?
Yüzey biçimi, metinde görülen gerçek yazılışı; sözlükbirim ise çekimli değişkelerin bağlandığı sözlük temsilini gösterir. Türkçede tek gövde çok sayıda ek dizisiyle kullanıldığı için yüzey sayımı dil bilgisel çeşitliliği, sözlükbirim sayımı ortak söz varlığını açıklar. Biri ötekinin düzeltilmiş biçimi değildir. Araştırma sorusuna göre ikisi de gerekli olabilir ve en güvenilir sistem her ikisini bağlantılı olarak sunar.
Toplam sıklığın yanında dağılımı neden bilmek gerekir?
Çünkü aynı toplam, farklı kullanım gerçekliklerinden doğabilir. Yüz karşılaşmanın yüz bağımsız belgede görülmesi ile tek kitapta art arda görülmesi genel yaygınlık açısından aynı değildir. Belge sıklığı ve dağılım ölçüleri, birimin farklı konuşma ve yazı çevrelerine ne ölçüde yayıldığını gösterir. Böylece konuya özgü yoğunlaşma, genel dildeki yerleşiklikle karıştırılmaz.
Bir kez görülen her biçim hata mıdır?
Hayır. Tek karşılaşmalı biçimler arasında gerçek türetmeler, yeni adlandırmalar, uzmanlık terimleri ve üsluba özgü seçimler bulunabilir. OCR bozulmaları ve yanlış bölmeler de aynı bölgede yer aldığı için tek karşılaşma yalnızca denetim gereksinimini artırır. Kaynağın görüntüsü, cümlenin anlamı, biçimbilgisel kuruluş, başka kaynaklardaki yakın örnekler ve zamanla gelen yeni kanıtlar birlikte incelenmelidir.
Zipf yaklaşımı her sözcüğün sıklığını kesin olarak öngörür mü?
Öngörmez. Yaklaşım, sıra yükseldikçe sıklığın genel olarak azaldığı eşitsiz dağılımı yaklaşık biçimde açıklar. Gerçek derlemlerde baş ve kuyruk bölgeleri, metin türü, konu ve örneklem büyüklüğü nedeniyle kuramsal çizgiden sapar. Zipf düzeni, belirli bir sözcüğün kaç kez geçeceğini söyleyen değişmez bir cetvel değil, bütün söz varlığının nicel biçimini karşılaştırmaya yarayan bir modeldir.
Yüksek sıklık bir öbeği sözlükbirim saymak için yeterli midir?
Yeterli değildir. Sık yinelenen bir dizi, konu gereği kurulmuş serbest bir tamlama veya çoğaltılmış başlık olabilir. Sözlükbirim değerlendirmesinde dağılım, bağlamsal kararlılık, biçimsel sınırlılık ve bütün anlamının bileşenlerden ne ölçüde kestirilebildiği incelenir. Sıklık adayları sıralar ve kanıt toplama işini yönlendirir; sözlüksel niteliği tek başına ilan etmez.
Derlem sıklığı, sözcüğün zihindeki gücünü doğrudan gösterir mi?
Doğrudan göstermez. Derlem, toplumsal kullanımdan örneklenmiş metinleri ölçer; bireysel deneyimler ve konuşur toplulukları farklı olabilir. Tanıma süresini ayrıca sözcük uzunluğu, edinim yaşı, anlam sayısı, biçimsel aile ve bağlamsal beklenti etkiler. Derlem sıklığı bilişsel araştırma için güçlü bir açıklayıcı değişkendir, fakat zihinsel temsilin tek ve eksiksiz ölçüsü olarak yorumlanmamalıdır.
Canlı derlem büyürken sıklık sonuçları nasıl güncel tutulur?
Her belge özgün yayın tarihi, türü, kaynağı ve işleme sürümüyle kaydedilir; yeni veri geldikçe kesin toplamlara eklenir ve göreli oranlar yeniden hesaplanır. Yinelenen içerik denetimi yeni eklemeden önce yapılır. Sonuç ekranı ölçüm zamanını, derlem büyüklüğünü ve dağılımı gösterir. Böylece kullanıcının gördüğü değişimin yeni dil kanıtından mı, temizleme işleminden mi, yoksa yöntem sürümünden mi doğduğu izlenebilir.
Madde terminolojisi
Metinde kullanılan terimler ve açıklamaları
25 terimAçıklamalar, her terimin bu maddede hangi teknik anlamda kullanıldığını gösterir; başka bir kaynaktan alınmış tanımlar veya ilgili bölümün yerine geçen kısa özetler değildir.
- anlam sıklığı
-
Bir maddebaşının bütün karşılaşmalarını tek toplamda vermek yerine, bağlamdan ayırt edilen anlamların her biri için ayrı kullanım miktarı hesaplanmasıdır.
İlgili bölümü oku - ARF
-
Bir dil biriminin metin boyunca kümelenmesini cezalandırarak düzenli yayılmış kullanımlara daha yüksek değer veren, ortalama indirgenmiş sıklık adıyla bilinen yaygınlık ölçüsüdür.
İlgili bölümü oku - belge sıklığı
-
Bir dil biriminin kaç kez geçtiğini değil, en az bir kez görüldüğü farklı belge sayısını gösteren ve kaynak yaygınlığını ölçmeye yardım eden değerdir.
İlgili bölümü oku - biçim ailesi
-
Ortak bir kök ya da gövde çevresinde türetme ve çekim ilişkileriyle kurulan, sıklıkları hem ayrı ayrı hem ortak çekirdek bakımından incelenebilen biçimler topluluğudur.
İlgili bölümü oku - dağılım
-
Toplam karşılaşmaların belgeler, metin türleri, alanlar, dönemler veya derlem bölümleri arasında hangi ölçüde dengeli ya da yoğunlaşmış olduğunu gösteren kullanım görünümüdür.
İlgili bölümü oku - göreli sıklık
-
Farklı büyüklükteki veri kesitlerini karşılaştırabilmek için karşılaşma sayısının bölümdeki toplam sözcük sayısına oranlanmasıyla elde edilen ölçüdür.
İlgili bölümü oku - hapaks
-
İncelenen veri kümesinde yalnızca bir kez karşılaşılan türdür; gerçek bir seyrek kullanım olabileceği gibi yazım veya OCR hatası da olabileceğinden bağlam içinde denetlenir.
İlgili bölümü oku - kapsama oranı
-
Seçilmiş bir sözcük listesinin hedef metinlerdeki toplam sözcük karşılaşmalarının ne kadarını tanınabilir hâle getirdiğini gösteren, özellikle dil öğretiminde kullanılan orandır.
İlgili bölümü oku - koşullu sıklık
-
Bir dil biriminin bütün veri içindeki genel sayısı yerine belirli bir önceki bağlam, yapı veya konu gerçekleştiğinde görülme miktarını ve beklentisini anlatan ölçüdür.
İlgili bölümü oku - lemalaştırma
-
Çekimli yüzey biçimlerini bağlam ve biçimbilgisel yapı bakımından çözümleyerek uygun sözlük biçimine bağlama işlemidir; eş yazımlı biçimler nedeniyle belirsizlik denetimi gerektirir.
İlgili bölümü oku - mutlak sıklık
-
Tanımlanmış bir dil biriminin sınırları belirli veri kümesinde görüldüğü toplam karşılaşma sayısıdır; farklı büyüklükteki derlemleri tek başına karşılaştırmaya uygun değildir.
İlgili bölümü oku - normalleştirilmiş sıklık
-
Ham karşılaşma sayısının milyon sözcük başına kullanım gibi ortak bir ölçeğe taşınmasıyla elde edilen ve farklı büyüklükteki veri kesitlerini karşılaştırmayı sağlayan değerdir.
İlgili bölümü oku - örnek sıklığı
-
Bir ekin, sözcüğün veya yapının bütün yinelenmelerinin toplamıdır; birkaç çok sık örnek değeri yükseltebildiği için tür sıklığıyla birlikte yorumlanır.
İlgili bölümü oku - sıklık bandı
-
Kesin sıra numaraları yerine benzer kullanım yoğunluğundaki birimleri yüksek, orta, düşük veya seyrek gibi karşılaştırılabilir aralıklarda toplayan sınıflama düzeyidir.
İlgili bölümü oku - sıklık sözlüğü
-
Bir dilin ya da belirli bir kullanım alanının birimlerini derlemdeki karşılaşma sayılarına ve çoğu zaman sıralarına göre düzenleyerek nicel kullanım görünümü sunan başvuru kaynağıdır.
İlgili bölümü oku - sıra
-
Dil birimlerinin sıklıklarına göre çoktan aza dizilmesinde aldıkları konumdur; yakın değerlerde yeni veriyle kolayca değişebildiğinden gerçek oranla birlikte okunur.
İlgili bölümü oku - sıra-sıklık dağılımı
-
Dil birimlerinin sıralamadaki konumları ile karşılaşma miktarları arasındaki ilişkiyi gösteren ve söz varlığının baş, orta ve uzun kuyruk bölgelerini görünür kılan dağılımdır.
İlgili bölümü oku - sözcük karşılaşması
-
Bir metin akışında görülen her ayrı sözcük kullanımıdır; aynı biçim yüz kez yinelenirse tür sayısı bir, karşılaşma sayısı yüz olur.
İlgili bölümü oku - sözcük türü
-
Derlemde en az bir kez görülen birbirinden ayrı sözcük biçimlerinden her biridir; burada tür dil bilgisel ad, eylem veya sıfat sınıfından farklı bir sayım anlamı taşır.
İlgili bölümü oku - sözlükbirim
-
Çekimli değişkeleri ve bağlama göre ayrılan anlamları sözlükte ortak bir madde altında temsil edilebilen soyut söz varlığı birimidir.
İlgili bölümü oku - tür sıklığı
-
Bir ekin veya yapının kaç farklı taban ya da örüntüyle gerçekleştiğini gösteren ve özellikle biçimbilgisel türetkenliğin genişliğini değerlendirmede kullanılan sayıdır.
İlgili bölümü oku - uzun kuyruk
-
Sıklık dağılımında her biri az karşılaşmaya sahip olduğu hâlde birlikte söz varlığının büyük bölümünü oluşturan seyrek türlerin geniş bölgesidir.
İlgili bölümü oku - yaygınlık
-
Bir dil biriminin toplam sayısından bağımsız olarak farklı belge, kaynak, tür ve dönemlere ne ölçüde yayıldığını anlatan çok boyutlu kullanım özelliğidir.
İlgili bölümü oku - yüzey biçimi
-
Bir sözcüğün metinde ekleri, ses değişmeleri ve yazım özellikleriyle birlikte gerçekten görülen biçimidir; aynı sözlükbirimin çok sayıda yüzey biçimi olabilir.
İlgili bölümü oku - Zipf yaklaşımı
-
Sözcük sırası yükseldikçe sıklığın yaklaşık olarak ters yönde azaldığını ve az sayıda çok sık birime karşılık çok sayıda seyrek birim bulunduğunu açıklayan nicel modeldir.
İlgili bölümü oku
Doğrulanmış kaynakça
- Aksu, Belgin Tezcan ve Eşref Adalı (2018). Çağdaş Türkçenin Sıklık Sözlüğü. İstanbul: Ötüken Neşriyat. Kaynağı aç
- Popescu, Ioan-Iovitz (2009). Word Frequency Studies. Quantitative Linguistics 64. Berlin ve New York: De Gruyter Mouton. doi:10.1515/9783110218534. Kaynağı aç
- Baayen, R. Harald (2001). Word Frequency Distributions. Text, Speech and Language Technology 18. Dordrecht: Kluwer Academic Publishers. doi:10.1007/978-94-010-0844-0. Kaynağı aç
- Bybee, Joan L. ve Paul J. Hopper, haz. (2001). Frequency and the Emergence of Linguistic Structure. Typological Studies in Language 45. Amsterdam ve Philadelphia: John Benjamins. doi:10.1075/tsl.45. Kaynağı aç
- Divjak, Dagmar ve Stefan Th. Gries, haz. (2012). Frequency Effects in Language Representation. Trends in Linguistics 244.2. Berlin ve Boston: De Gruyter Mouton. doi:10.1515/9783110274073. Kaynağı aç
- Brezina, Vaclav ve Dana Gablasova (2015). “Is There a Core General Vocabulary? Introducing the New General Service List”. Applied Linguistics, 36(1), 1-22. doi:10.1093/applin/amt018. Kaynağı aç