Straturile unui cuvânt

Metodă

Cum au fost clasificate cuvintele, ce texte au fost numărate și ce limite are analiza.

Atribuirea straturilor

Stratul unui cuvânt este limba din care româna l-a preluat direct. Dragoste e slavon, deși slavona îl luase din protoslavă; bulevard e francez, deși franceza îl luase din olandeză.

Clasificarea celor 47.654 de lexeme folosește categoriile etimologice și articolele din Wiktionary. Scriptul citește prima propoziție care indică o limbă-sursă. Ipotezele alternative sunt păstrate separat; unirea lor ar produce un lanț etimologic care nu este susținut de sursă.

Pentru 13.635 dintre cuvintele publicate, rezultatul a fost comparat cu notele etimologice din dicționarele agregate de dexonline. Sursele indică același strat în 86,7 la sută din cazuri și aceeași limbă-sursă în 91,1 la sută. Diferențele apar mai ales la împrumuturile din secolul al XIX-lea, unde specialiștii pot indica fie latina, fie franceza drept sursă directă. Fiecare fișă semnalează explicit aceste cazuri.

Cele mai frecvente 200 de leme reprezintă aproape jumătate din text, deci clasificarea greșită a uneia dintre ele poate schimba vizibil procentele. Wiktionary folosește un singur articol pentru omonime cu istorii diferite, iar automatizarea citește prima secțiune etimologică. Cele 14 de cazuri în care sensul frecvent nu era cel din prima secțiune au fost corectate manual și sunt listate mai jos.

Corpusul istoric: proză datată, 1825–1949

6.626 de texte românești de pe Wikisource, cu 10.998.608 de cuvinte, grupate în cinci intervale de câte 25 de ani. Fiecare text primește data indicată în pagină. Dacă data lipsește, este folosită o estimare din perioada activă a autorului: anul nașterii plus 35 de ani, fără a depăși anul morții.

Au fost luate trei măsuri de precauție. Traducerile sunt excluse, fiindcă anul autorului străin nu indică anul textului românesc. Un autor nu poate contribui mai mult de 2.000.000 de caractere într-un interval, ca să nu domine rezultatul vocabularul unui singur autor. Paragrafele repetate se numără o singură dată, deoarece Wikisource păstrează atât pagina principală, cât și capitolele ei.

Primul interval, 1825–1849, are cele mai puține date: 369.815 de cuvinte de la 18 de autori, iar cel mai prolific dintre ei furnizează 30,8 la sută din text. Proza tipărită în românește înainte de 1850 este puțină, ceea ce limitează comparația.

Corpusurile contemporane: două registre, citite separat

Vorbit: 306.494.203 de cuvinte din lista de frecvențe OpenSubtitles pentru română, adică replici de film. Scris: 15.566.007 de cuvinte din 41.357 de articole de Wikipedia în română, luate în ordinea dumpului.

Cele două corpusuri sunt analizate separat, deoarece reprezintă registre diferite.

Lematizarea

În texte, aceeași lemă apare sub mai multe forme: casă, casa, casei, case, casele, caselor. Lematizarea le grupează înainte de calculul frecvențelor.

Formele se leagă de leme cu cele 2.273.343 de forme flexionare din baza dexonline. Normalizarea unește variantele ortografice: sedila în locul virgulei, î din a în locul lui â, diacriticele secolului al XIX-lea și textele tastate fără diacritice, printre ele constituțiile din 1952 și 1965.

Când aceeași formă poate aparține mai multor leme, frecvența se împarte proporțional cu frecvențele formelor neambigue. Astfel, si scris fără diacritice este atribuit aproape în întregime lui și, nu notei muzicale.

Licența datelor dexonline

Formele flexionare și lemele folosite la lematizare provin din setul oficial de export dexonline. Datele procesate derivate din acest set respectă termenii GNU GPL v2 sau orice versiune ulterioară. Copyright © 2004–2026 dexonline, https://dexonline.ro.

Dumpul original și textele definițiilor nu sunt redistribuite. Arhiva publică include numai legăturile procesate dintre forme și leme, statistici agregate și semnalarea dezacordurilor etimologice. Poți consulta atribuirea, legăturile către licență și inventarul exact în fișierul public DEXONLINE-NOTICE.md.

Ce nu spune pagina

Prima apariție în corpus nu este prima atestare a cuvântului. Atestările filologice se află în Dicționarul limbii române și nu pot fi extrase automat. Pagina indică doar că termenul era deja folosit în primul interval în care apare; putea exista mai devreme.

Curba proprie se desenează numai pentru cele 9.382 de cuvinte cu cel puțin douăsprezece ocurențe în proza datată, împrăștiate în cel puțin trei intervale. Pentru restul se arată curba stratului.

Între 1949 și corpusurile contemporane există un gol de aproximativ 50 de ani. Textele oficiale acoperă doar registrul administrativ, iar graficele nu trasează o linie continuă peste această perioadă.

Wikipedia reprezintă scrisul enciclopedic, nu limba scrisă în general. Replicile de film sunt dialog scris de scenariști și traducători, nu conversații înregistrate. Etichetele din pagină numesc explicit aceste două registre.

Procentele sunt calculate numai pentru partea de text care a putut fi clasificată: 87,2 la sută din corpusul vorbit și 78,8 la sută din cel scris. Cuvintele rămase nu aveau o categorie etimologică utilizabilă în Wiktionary.

Corecțiile făcute de mână

Lista cuprinde cuvintele frecvente pentru care automatizarea a ales sensul rar al unui omonim. Motivul fiecărei corecții este notat.

CuvântStratMotiv
maiLatina moștenitălat. magis; Wiktionary listează mai întâi sensurile «ciocan» și «lună», dar forma frecventă este adverbul comparativ
capLatina moștenitălat. caput, moștenit; prima secțiune descrie sensul nautic, împrumutat din franceză
duceLatina moștenitălat. ducere; substantivul italian duce e omonimul rar
prinLatina moștenităper + in, amândouă latine
primLatina savantălat. primus, împrumut savant de secol XIX, nu maghiar
secolLatina savantălat. saeculum
ultimLatina savantălat. ultimus
modLatina savantălat. modus
persoanăLatina savantălat. persona
darNecunoscutconjuncția nu are o origine stabilită; slavonul darŭ explică substantivul dar, nu legătura dintre propoziții
parteLatina moștenitălat. partem, moștenit
jocLatina moștenitălat. jocus, moștenit
trimiteLatina moștenitălat. tramittere, moștenit
politicFrancezafr. politique; nota rusească se referă la un derivat de secol XX

Reproducere

Arhiva publică conține codul, datele procesate, notele de cercetare și fișierele necesare pentru a reconstrui pagina și a-i verifica cifrele.

Descarcă arhiva de reproducere SHA-256

Pentru refacerea integrală trebuie descărcate separat dumpurile dexonline, Wikisource, Wikipedia și OpenSubtitles. Ele nu sunt redistribuite în arhivă. Fișierul REPRODUCERE.md indică sursele, numele așteptate și ordinea de rulare. După descărcare, comenzile de mai jos pot fi rulate în ordinea indicată.

python3 tools/fetch_categories.py
python3 tools/dex_extract.py
python3 tools/ws_index.py
python3 tools/corpus_hist.py
python3 tools/corpus_now.py
python3 tools/official.py
python3 tools/shortlist.py
python3 tools/fetch_entries.py
python3 tools/dex_check.py
python3 tools/audit_top.py
python3 tools/analyse.py
node build.mjs
node qa_assertions.mjs