Straturile unui cuvânt

Metodă

Cum am clasificat cuvintele, ce texte am numărat și unde se oprește analiza.

Atribuirea straturilor

Aici, «stratul» înseamnă, de regulă, limba din care româna a împrumutat direct un cuvânt. Bulevard este trecut la franceză, chiar dacă franceza îl împrumutase mai devreme din neerlandeză.

Cuvintele provenite din forme vechi slave cer mai multă prudență. Wiktionary separă protoslava de slavona bisericească, dar forma veche a cuvântului nu arată singură dacă româna l-a preluat din vorbire sau din texte. Le-am pus împreună la «Slava veche», păstrând în lanț forma indicată de sursă.

Am clasificat 47.657 de cuvinte de dicționar (leme) folosind categoriile de origine și articolele din Wiktionary. Programul citește prima propoziție care indică o limbă-sursă. Ipotezele alternative rămân separate: dacă le-am uni, am crea un traseu etimologic pe care sursa nu îl susține.

Când articolul-sursă oferă o glosă explicită pentru o verigă, fișa o afișează lângă etimon. Este o glosă furnizată de Wiktionary, nu o traducere automată; dacă lipsește, pagina nu inventează un sens.

Pentru 14.550 dintre cuvintele publicate, am verificat rezultatul în notele despre originea cuvintelor din dicționarele adunate de dexonline. Cele două surse indică același strat în 88,0 la sută dintre cazuri și aceeași limbă de origine în 92,0 la sută. Diferențele apar mai ales la împrumuturile din secolul al XIX-lea, unde specialiștii pot indica fie latina, fie franceza ca sursă directă. Fiecare fișă semnalează aceste cazuri.

Cele mai frecvente 200 de cuvinte de dicționar reprezintă aproape jumătate din text, deci o clasificare greșită poate schimba vizibil procentele. Wiktionary folosește un singur articol pentru cuvinte scrise la fel, dar cu istorii diferite, iar programul citește prima secțiune despre origine. Cele 36 de cazuri în care sensul frecvent nu era cel din acea secțiune au fost corectate manual și sunt listate mai jos.

Texte istorice: proză datată, 1825–1949

Am numărat 6.626 texte românești de pe Wikisource, cu 10.998.608 de cuvinte, grupate în cinci intervale de câte 25 de ani. Fiecare text primește data indicată pe pagină. Dacă data lipsește, folosim o estimare din perioada activă a autorului: anul nașterii plus 35 de ani, fără a depăși anul morții.

Am luat trei măsuri de precauție. Am exclus traducerile, fiindcă anul autorului străin nu spune când a fost scris textul românesc. Un autor nu poate contribui cu mai mult de 2.000.000 de caractere într-un interval, ca un singur autor să nu domine rezultatul. Paragrafele repetate se numără o singură dată, deoarece Wikisource păstrează atât pagina principală, cât și capitolele ei.

Primul interval, 1825–1849, are cele mai puține date: 369.815 de cuvinte de la 18 de autori, iar cel mai prolific dintre ei furnizează 30,8 la sută din text. Proza tipărită în românește înainte de 1850 este puțină, ceea ce limitează comparația.

Texte contemporane: două tipuri de limbaj

OpenSubtitles 2018: 306.494.203 de cuvinte din replici de film subtitrate în română. Wikipedia: 15.566.007 de cuvinte din 41.357 de articole în română, luate în ordinea în care apar în fișierul sursă.

Le-am analizat separat, fiindcă reprezintă două tipuri diferite de limbaj.

Cum unim formele aceluiași cuvânt

Într-un text, același cuvânt apare sub mai multe forme: casă, casa, casei, case, casele, caselor. Le-am adus la forma de dicționar înainte de a calcula frecvențele. Procesul se numește lematizare.

Am legat formele de dicționar folosind cele 2.273.343 de forme flexionare din baza dexonline. Am adus la aceeași formă și variantele ortografice: sedila în locul virgulei, î în locul lui â, diacriticele secolului al XIX-lea și textele scrise fără diacritice, printre ele constituțiile din 1952 și 1965.

Dacă aceeași formă putea aparține mai multor cuvinte de dicționar, am împărțit aparițiile între ele după frecvența formelor neambigue. Astfel, si, scris fără diacritice, ajunge aproape în întregime la și, nu la nota muzicală.

Cuvintele gramaticale foarte frecvente

Analiza principală numără toate aparițiile, inclusiv prepoziții, articole, pronume, conjuncții și alte cuvinte gramaticale foarte frecvente. Am făcut și o variantă care le scoate pentru a vedea cât schimbă rezultatul.

Am luat decizia pentru forma de dicționar, nu pentru fiecare apariție. Unele forme au și rol gramatical, și rol de cuvânt cu sens propriu; în lipsa unei separări sigure, le păstrăm sau le scoatem peste tot. Aceasta este o verificare a sensibilității rezultatului, nu o analiză gramaticală completă.

Am scos 242 de forme de dicționar. Ele reprezintă 50,9 la sută dintre aparițiile analizate în OpenSubtitles și 42,1 la sută în Wikipedia. După filtrare, 83,1 la sută din aparițiile rămase în OpenSubtitles și 73,0 la sută în Wikipedia pot fi legate de un strat.

Am verificat primele 200 de forme, împreună cu excluderile și formele ambigue păstrate, în ordinea frecvenței lor cumulate în cele două surse.

Varianta prudentă păstrează formele care au mai multe roluri atunci când rolurile nu pot fi separate. În această variantă, latina moștenită are 57,7 la sută în OpenSubtitles și 28,9 la sută în Wikipedia, iar franceza 21,5 la sută și 48,6 la sută.

Varianta extinsă scoate și putea, tot, mult, doar, chiar și cât. Cu 248 de forme scoase, latina moștenită ajunge la 55,1 la sută în OpenSubtitles și 27,6 la sută în Wikipedia, iar franceza la 22,8 la sută și 49,5 la sută.

Inventarul complet este publicat în data/function_lemmas.csv, iar ordinea frecvenței, marcajul reviziei și ambele variante apar în raportul de audit.

Pentru fiecare set de texte, procentele se calculează din aparițiile rămase care pot fi legate de un strat. Filtrul nu este aplicat statisticilor istorice sau textelor constituționale.

Ce măsoară paralela albaneză și ce nu poate măsura

Numărul de leme legate de albaneză este calculat numai în dicționarul public al paginii. Programul caută codurile de limbă sq și aln în fiecare lanț etimologic și însumează frecvențele acelor leme în OpenSubtitles și Wikipedia.

Ponderile de 24,3 la sută și 28,4 la sută folosesc drept numitor masa tuturor lemelor căutabile clasificate la substrat în corpusul respectiv. Ele nu sunt procente din întregul corpus și nu includ lemele nepublicate în căutare.

Un lanț care conține o formă albaneză nu stabilește singur dacă româna a împrumutat din albaneză, albaneza din română sau ambele dintr-o sursă mai veche. În același fel, baza nu codifică isoglosele dialectale italiene invocate de Dan Ungureanu: acestea sunt comparații între forme înrudite, nu limbi donatoare.

Licența datelor dexonline

Formele flexionare și formele de dicționar folosite pentru a grupa cuvintele provin din exportul oficial dexonline. Datele procesate și publicate din acest set respectă termenii GNU GPL v2 sau orice versiune ulterioară. Copyright © 2004–2026 dexonline, https://dexonline.ro.

Fișierele originale ale bazei de date și textele definițiilor nu sunt redistribuite. Arhiva publică include doar legăturile prelucrate dintre forme și formele de dicționar, statistici agregate și marcarea diferențelor privind originea cuvintelor. Poți vedea atribuirea, legăturile către licență și inventarul exact în fișierul public DEXONLINE-NOTICE.md.

Ce nu poate spune pagina

Prima apariție în textele numărate nu este și prima apariție documentată a cuvântului. Primele atestări din istoria limbii se află în Dicționarul limbii române și nu pot fi extrase automat din sursele folosite aici. Pagina arată doar că termenul era deja folosit în primul interval în care apare; putea exista mai devreme.

Un grafic separat apare numai pentru cele 9.385 de cuvinte cu cel puțin douăsprezece apariții în proza datată, răspândite în cel puțin trei intervale. Pentru restul se arată graficul stratului din care fac parte.

Între 1949 și corpusurile contemporane există un gol de aproximativ 50 de ani. Textele oficiale acoperă doar registrul administrativ, iar graficele nu trasează o linie continuă peste această perioadă.

Wikipedia arată un tip de scris enciclopedic, nu limba scrisă în general. Replicile de film sunt dialog scris de scenariști și traducători, nu conversații înregistrate. Etichetele din pagină spun explicit ce reprezintă fiecare sursă.

Procentele sunt calculate numai pentru partea de text care a putut fi clasificată: 87,4 la sută din lista OpenSubtitles și 78,9 la sută din articolele Wikipedia analizate. Pentru restul nu am găsit în categoriile Wiktionary o origine suficient de clară.

Varianta prudentă nu verifică rolul gramatical al fiecărei apariții. O formă cu mai multe roluri rămâne inclusă sau exclusă peste tot, conform inventarului public.

Unde dicționarele se despart

Pentru 14.550 de cuvinte publicate există și o notă etimologică în dicționarele agregate de dexonline. Clasificarea coincide la nivel de strat în 88,0 la sută dintre cazuri; în 1.748 de cazuri, sursele aleg alt donator direct.

Diferențele nu sunt distribuite aleatoriu. Cele mai multe apar la cuvintele moderne care pot fi explicate fie ca împrumut direct din latină, fie ca intrate prin franceză, italiană sau germană, și la delimitarea dintre slava veche și limbile slave vecine.

Mai există o nealiniere în interiorul sursei Wiktionary: pentru 803 dintre cele 17.694 de fișe verificabile automat, stratul atribuit din categorii nu corespunde primei etape recognoscibile a lanțului publicat. Cauza tipică este că același articol reunește omonime sau etimologii concurente. Interfața marchează aceste fișe cu semnul ?. Ele nu sunt corectate automat fără dezambiguizare pe sensuri.

Clasificarea paginiidexonline
Latina savantăLatină 403 cazuri

Exemple abecedar abrevia acvilin ad-hoc admirabil alias ambiguu audient aulă aură auspiciu baptisteriu

FrancezaLatină 238 cazuri

Exemple abroga absolut act acvatic adjudeca afabil alega altitudine audio august aulic benign

Slava vecheVecinii slavi de mai târziu 180 cazuri

Exemple babă baniță baștină bivoliță bleg bolovan borș boz bragă braniște breaz bujor

GermanaFranceza 94 cazuri

Exemple adresă africată automobil bandă bloc boxer cadavru clasă hinduism idiș infarct mașină

ItalianaLatină 64 cazuri

Exemple acut acvariu acvilă amic amiciție genera glorie incipient infern insuficient invada investiga

FrancezaItaliana 61 cazuri

Exemple acont adio bancar bariton bas basorelief capitul caramel carmin cicerone ciment guelf

Latina savantăFranceza 51 cazuri

Exemple abdomen administrator admira apex canicular cedru chimie dativ genitiv gratis gravitate imaginație

Latina moștenităNecunoscut 50 cazuri

Exemple acolea adică adulmeca borî brâncă buf buiestru butuc funigel gaie genune ghioc

GermanaLatină 39 cazuri

Exemple abstract chirurg ie insurgent matroană personal reumatic tabelă tort pacient paralel parazit

FrancezaGreaca 37 cazuri

Exemple acrostih aed caligrafie canapea gradat granitic granular gregorian icter pelican manie analog

EnglezaFranceza 32 cazuri

Exemple barman bebe bridge cameraman canabis cart empatie hamburger hindi hormon joker șerpaș

Slava vecheNecunoscut 25 cazuri

Exemple ban bălărie bâtă beci brusture glie gologan îndelete jupân uimi prăjină prăvălie

Barele arată cele mai frecvente perechi de dezacord. Un dezacord nu înseamnă automat că una dintre surse greșește: poate reflecta trasee multiple, împrumuturi paralele sau o altă alegere a donatorului proxim.

Corecții verificate manual

Lista cuprinde cuvinte frecvente la care programul a ales sensul rar al unui cuvânt scris la fel. Motivul fiecărei corecții este notat.

CuvântStratMotiv
maiLatina moștenitălat. magis; Wiktionary listează mai întâi sensurile «ciocan» și «lună», dar forma frecventă este adverbul comparativ
capLatina moștenitălat. caput, moștenit; prima secțiune descrie sensul nautic, împrumutat din franceză
duceLatina moștenitălat. ducere; substantivul italian duce e omonimul rar
prinLatina moștenităper + in, amândouă latine
primLatina savantălat. primus, împrumut savant de secol XIX, nu maghiar
secolLatina savantălat. saeculum
ultimLatina savantălat. ultimus
modLatina savantălat. modus
persoanăLatina savantălat. persona
darNecunoscutconjuncția nu are o origine stabilită; slavonul darŭ explică substantivul dar, nu legătura dintre propoziții
parteLatina moștenitălat. partem, moștenit
jocLatina moștenitălat. jocus, moștenit
trimiteLatina moștenitălat. tramittere, moștenit
politicFrancezafr. politique; nota rusească se referă la un derivat de secol XX
fiecareFormarea internăformat în română din fie + care
întreceFormarea internăformat în română din în- + trece
scarăLatina moștenitălat. scala; mențiunea franceză din dexonline explică unele sensuri după fr. échelle, nu originea cuvântului
vorbiFormarea internăderivat în română din vorbă + -i; forma «vorbit» este participiul acestui verb
păiLatina moștenităinterjecție moștenită din lat. post; articolul o lasă în afara categoriilor etimologice folosite la inventar
filmFrancezafr. film; clasificarea automată a păstrat și categoria germană, dar lanțul și DEX indică donatorul francez
mașinăFrancezafr. machine; germ. Maschine este etimon concurent, nu clasificarea proximă folosită aici
motivFrancezafr. motif; italiana și germana apar ca surse concurente în notele etimologice
telefonFrancezafr. téléphone; germana apare ca etimon concurent în datele automate
corpFrancezafr. corps pentru sensul modern; lat. corpus și germana apar ca trasee concurente
camerăItalianait. camera; clasificarea automată o trimitea greșit la engleză
scuzăItalianait. scusa; franceza este menționată ca paralelă pentru excuse
profesorFrancezafr. professeur; germ. Professor este etimon concurent
rezultatFrancezafr. résultat; germ. Resultat este etimon concurent
birouFrancezafr. bureau; rusa apare ca variantă concurentă, dar lanțul și DEX indică franceza
doctorLatina savantălat. doctor; franceza și germana sunt forme concurente, iar clasificarea germană era o alegere automată greșită
spitalGermanagerm. Spital pentru forma română standard; greaca și latina apar în trasee alternative
religieFrancezafr. religion; latina și germana apar ca surse concurente
ofițerFrancezafr. officier; rusa și germana sunt etimoane concurente
bancăFrancezafr. banc pentru sensul publicat; italiana explică un alt sens și o analiză paralelă
organizațieFrancezafr. organisation; germ. Organisation este etimon concurent
realFrancezafr. réel în uzul modern; germana și latina apar în trasee concurente

Refacerea analizei

Arhiva publică include codul, datele procesate, notele de cercetare și fișierele cu care poți reconstrui pagina și verifica cifrele.

Descarcă arhiva pentru refacerea analizei SHA-256

Pentru a reface analiza de la sursă, trebuie descărcate separat fișierele complete de la dexonline, Wikisource, Wikipedia și OpenSubtitles. Ele nu sunt redistribuite în arhivă. Fișierul REPRODUCERE.md indică sursele, numele așteptate și ordinea pașilor. După descărcare, comenzile de mai jos pot fi rulate în ordinea indicată.

python3 tools/fetch_categories.py
python3 tools/dex_extract.py
python3 tools/ws_index.py
python3 tools/corpus_hist.py
python3 tools/corpus_now.py
python3 tools/official.py
python3 tools/shortlist.py
python3 tools/fetch_entries.py
python3 tools/dex_check.py
python3 tools/audit_top.py
python3 tools/function_filter.py
python3 tools/analyse.py
python3 tools/explore.py
node build.mjs
node qa_assertions.mjs