Metodă
Cum am clasificat cuvintele, ce texte am numărat și unde se oprește analiza.
Atribuirea straturilor
Aici, «stratul» înseamnă, de regulă, limba din care româna a împrumutat direct un cuvânt. Bulevard este trecut la franceză, chiar dacă franceza îl împrumutase mai devreme din neerlandeză.
Cuvintele provenite din forme vechi slave cer mai multă prudență. Wiktionary separă protoslava de slavona bisericească, dar forma veche a cuvântului nu arată singură dacă româna l-a preluat din vorbire sau din texte. Le-am pus împreună la «Slava veche», păstrând în lanț forma indicată de sursă.
Am clasificat 47.657 de cuvinte de dicționar (leme) folosind categoriile de origine și articolele din Wiktionary. Programul citește prima propoziție care indică o limbă-sursă. Ipotezele alternative rămân separate: dacă le-am uni, am crea un traseu etimologic pe care sursa nu îl susține.
Când articolul-sursă oferă o glosă explicită pentru o verigă, fișa o afișează lângă etimon. Este o glosă furnizată de Wiktionary, nu o traducere automată; dacă lipsește, pagina nu inventează un sens.
Pentru 14.550 dintre cuvintele publicate, am verificat rezultatul în notele despre originea cuvintelor din dicționarele adunate de dexonline. Cele două surse indică același strat în 88,0 la sută dintre cazuri și aceeași limbă de origine în 92,0 la sută. Diferențele apar mai ales la împrumuturile din secolul al XIX-lea, unde specialiștii pot indica fie latina, fie franceza ca sursă directă. Fiecare fișă semnalează aceste cazuri.
Cele mai frecvente 200 de cuvinte de dicționar reprezintă aproape jumătate din text, deci o clasificare greșită poate schimba vizibil procentele. Wiktionary folosește un singur articol pentru cuvinte scrise la fel, dar cu istorii diferite, iar programul citește prima secțiune despre origine. Cele 36 de cazuri în care sensul frecvent nu era cel din acea secțiune au fost corectate manual și sunt listate mai jos.
Texte istorice: proză datată, 1825–1949
Am numărat 6.626 texte românești de pe Wikisource, cu 10.998.608 de cuvinte, grupate în cinci intervale de câte 25 de ani. Fiecare text primește data indicată pe pagină. Dacă data lipsește, folosim o estimare din perioada activă a autorului: anul nașterii plus 35 de ani, fără a depăși anul morții.
Am luat trei măsuri de precauție. Am exclus traducerile, fiindcă anul autorului străin nu spune când a fost scris textul românesc. Un autor nu poate contribui cu mai mult de 2.000.000 de caractere într-un interval, ca un singur autor să nu domine rezultatul. Paragrafele repetate se numără o singură dată, deoarece Wikisource păstrează atât pagina principală, cât și capitolele ei.
Primul interval, 1825–1849, are cele mai puține date: 369.815 de cuvinte de la 18 de autori, iar cel mai prolific dintre ei furnizează 30,8 la sută din text. Proza tipărită în românește înainte de 1850 este puțină, ceea ce limitează comparația.
Texte contemporane: două tipuri de limbaj
OpenSubtitles 2018: 306.494.203 de cuvinte din replici de film subtitrate în română. Wikipedia: 15.566.007 de cuvinte din 41.357 de articole în română, luate în ordinea în care apar în fișierul sursă.
Le-am analizat separat, fiindcă reprezintă două tipuri diferite de limbaj.
Cum unim formele aceluiași cuvânt
Într-un text, același cuvânt apare sub mai multe forme: casă, casa, casei, case, casele, caselor. Le-am adus la forma de dicționar înainte de a calcula frecvențele. Procesul se numește lematizare.
Am legat formele de dicționar folosind cele 2.273.343 de forme flexionare din baza dexonline. Am adus la aceeași formă și variantele ortografice: sedila în locul virgulei, î în locul lui â, diacriticele secolului al XIX-lea și textele scrise fără diacritice, printre ele constituțiile din 1952 și 1965.
Dacă aceeași formă putea aparține mai multor cuvinte de dicționar, am împărțit aparițiile între ele după frecvența formelor neambigue. Astfel, si, scris fără diacritice, ajunge aproape în întregime la și, nu la nota muzicală.
Cuvintele gramaticale foarte frecvente
Analiza principală numără toate aparițiile, inclusiv prepoziții, articole, pronume, conjuncții și alte cuvinte gramaticale foarte frecvente. Am făcut și o variantă care le scoate pentru a vedea cât schimbă rezultatul.
Am luat decizia pentru forma de dicționar, nu pentru fiecare apariție. Unele forme au și rol gramatical, și rol de cuvânt cu sens propriu; în lipsa unei separări sigure, le păstrăm sau le scoatem peste tot. Aceasta este o verificare a sensibilității rezultatului, nu o analiză gramaticală completă.
Am scos 242 de forme de dicționar. Ele reprezintă 50,9 la sută dintre aparițiile analizate în OpenSubtitles și 42,1 la sută în Wikipedia. După filtrare, 83,1 la sută din aparițiile rămase în OpenSubtitles și 73,0 la sută în Wikipedia pot fi legate de un strat.
Am verificat primele 200 de forme, împreună cu excluderile și formele ambigue păstrate, în ordinea frecvenței lor cumulate în cele două surse.
Varianta prudentă păstrează formele care au mai multe roluri atunci când rolurile nu pot fi separate. În această variantă, latina moștenită are 57,7 la sută în OpenSubtitles și 28,9 la sută în Wikipedia, iar franceza 21,5 la sută și 48,6 la sută.
Varianta extinsă scoate și putea, tot, mult, doar, chiar și cât. Cu 248 de forme scoase, latina moștenită ajunge la 55,1 la sută în OpenSubtitles și 27,6 la sută în Wikipedia, iar franceza la 22,8 la sută și 49,5 la sută.
Inventarul complet este publicat în data/function_lemmas.csv, iar ordinea frecvenței, marcajul reviziei și ambele variante apar în raportul de audit.
Pentru fiecare set de texte, procentele se calculează din aparițiile rămase care pot fi legate de un strat. Filtrul nu este aplicat statisticilor istorice sau textelor constituționale.
Ce măsoară paralela albaneză și ce nu poate măsura
Numărul de leme legate de albaneză este calculat numai în dicționarul public al paginii. Programul caută codurile de limbă sq și aln în fiecare lanț etimologic și însumează frecvențele acelor leme în OpenSubtitles și Wikipedia.
Ponderile de 24,3 la sută și 28,4 la sută folosesc drept numitor masa tuturor lemelor căutabile clasificate la substrat în corpusul respectiv. Ele nu sunt procente din întregul corpus și nu includ lemele nepublicate în căutare.
Un lanț care conține o formă albaneză nu stabilește singur dacă româna a împrumutat din albaneză, albaneza din română sau ambele dintr-o sursă mai veche. În același fel, baza nu codifică isoglosele dialectale italiene invocate de Dan Ungureanu: acestea sunt comparații între forme înrudite, nu limbi donatoare.
Licența datelor dexonline
Formele flexionare și formele de dicționar folosite pentru a grupa cuvintele provin din exportul oficial dexonline. Datele procesate și publicate din acest set respectă termenii GNU GPL v2 sau orice versiune ulterioară. Copyright © 2004–2026 dexonline, https://dexonline.ro.
Fișierele originale ale bazei de date și textele definițiilor nu sunt redistribuite. Arhiva publică include doar legăturile prelucrate dintre forme și formele de dicționar, statistici agregate și marcarea diferențelor privind originea cuvintelor. Poți vedea atribuirea, legăturile către licență și inventarul exact în fișierul public DEXONLINE-NOTICE.md.
Ce nu poate spune pagina
Prima apariție în textele numărate nu este și prima apariție documentată a cuvântului. Primele atestări din istoria limbii se află în Dicționarul limbii române și nu pot fi extrase automat din sursele folosite aici. Pagina arată doar că termenul era deja folosit în primul interval în care apare; putea exista mai devreme.
Un grafic separat apare numai pentru cele 9.385 de cuvinte cu cel puțin douăsprezece apariții în proza datată, răspândite în cel puțin trei intervale. Pentru restul se arată graficul stratului din care fac parte.
Între 1949 și corpusurile contemporane există un gol de aproximativ 50 de ani. Textele oficiale acoperă doar registrul administrativ, iar graficele nu trasează o linie continuă peste această perioadă.
Wikipedia arată un tip de scris enciclopedic, nu limba scrisă în general. Replicile de film sunt dialog scris de scenariști și traducători, nu conversații înregistrate. Etichetele din pagină spun explicit ce reprezintă fiecare sursă.
Procentele sunt calculate numai pentru partea de text care a putut fi clasificată: 87,4 la sută din lista OpenSubtitles și 78,9 la sută din articolele Wikipedia analizate. Pentru restul nu am găsit în categoriile Wiktionary o origine suficient de clară.
Varianta prudentă nu verifică rolul gramatical al fiecărei apariții. O formă cu mai multe roluri rămâne inclusă sau exclusă peste tot, conform inventarului public.
Unde dicționarele se despart
Pentru 14.550 de cuvinte publicate există și o notă etimologică în dicționarele agregate de dexonline. Clasificarea coincide la nivel de strat în 88,0 la sută dintre cazuri; în 1.748 de cazuri, sursele aleg alt donator direct.
Diferențele nu sunt distribuite aleatoriu. Cele mai multe apar la cuvintele moderne care pot fi explicate fie ca împrumut direct din latină, fie ca intrate prin franceză, italiană sau germană, și la delimitarea dintre slava veche și limbile slave vecine.
Mai există o nealiniere în interiorul sursei Wiktionary: pentru 803 dintre cele 17.694 de fișe verificabile automat, stratul atribuit din categorii nu corespunde primei etape recognoscibile a lanțului publicat. Cauza tipică este că același articol reunește omonime sau etimologii concurente. Interfața marchează aceste fișe cu semnul ?. Ele nu sunt corectate automat fără dezambiguizare pe sensuri.
Latina savantă→Latină 403 cazuri
Exemple abecedar abrevia acvilin ad-hoc admirabil alias ambiguu audient aulă aură auspiciu baptisteriu
Franceza→Latină 238 cazuri
Exemple abroga absolut act acvatic adjudeca afabil alega altitudine audio august aulic benign
Slava veche→Vecinii slavi de mai târziu 180 cazuri
Exemple babă baniță baștină bivoliță bleg bolovan borș boz bragă braniște breaz bujor
Germana→Franceza 94 cazuri
Exemple adresă africată automobil bandă bloc boxer cadavru clasă hinduism idiș infarct mașină
Italiana→Latină 64 cazuri
Exemple acut acvariu acvilă amic amiciție genera glorie incipient infern insuficient invada investiga
Franceza→Italiana 61 cazuri
Exemple acont adio bancar bariton bas basorelief capitul caramel carmin cicerone ciment guelf
Latina savantă→Franceza 51 cazuri
Exemple abdomen administrator admira apex canicular cedru chimie dativ genitiv gratis gravitate imaginație
Latina moștenită→Necunoscut 50 cazuri
Exemple acolea adică adulmeca borî brâncă buf buiestru butuc funigel gaie genune ghioc
Germana→Latină 39 cazuri
Exemple abstract chirurg ie insurgent matroană personal reumatic tabelă tort pacient paralel parazit
Franceza→Greaca 37 cazuri
Exemple acrostih aed caligrafie canapea gradat granitic granular gregorian icter pelican manie analog
Corecții verificate manual
Lista cuprinde cuvinte frecvente la care programul a ales sensul rar al unui cuvânt scris la fel. Motivul fiecărei corecții este notat.
| Cuvânt | Strat | Motiv |
|---|---|---|
| mai | Latina moștenită | lat. magis; Wiktionary listează mai întâi sensurile «ciocan» și «lună», dar forma frecventă este adverbul comparativ |
| cap | Latina moștenită | lat. caput, moștenit; prima secțiune descrie sensul nautic, împrumutat din franceză |
| duce | Latina moștenită | lat. ducere; substantivul italian duce e omonimul rar |
| prin | Latina moștenită | per + in, amândouă latine |
| prim | Latina savantă | lat. primus, împrumut savant de secol XIX, nu maghiar |
| secol | Latina savantă | lat. saeculum |
| ultim | Latina savantă | lat. ultimus |
| mod | Latina savantă | lat. modus |
| persoană | Latina savantă | lat. persona |
| dar | Necunoscut | conjuncția nu are o origine stabilită; slavonul darŭ explică substantivul dar, nu legătura dintre propoziții |
| parte | Latina moștenită | lat. partem, moștenit |
| joc | Latina moștenită | lat. jocus, moștenit |
| trimite | Latina moștenită | lat. tramittere, moștenit |
| politic | Franceza | fr. politique; nota rusească se referă la un derivat de secol XX |
| fiecare | Formarea internă | format în română din fie + care |
| întrece | Formarea internă | format în română din în- + trece |
| scară | Latina moștenită | lat. scala; mențiunea franceză din dexonline explică unele sensuri după fr. échelle, nu originea cuvântului |
| vorbi | Formarea internă | derivat în română din vorbă + -i; forma «vorbit» este participiul acestui verb |
| păi | Latina moștenită | interjecție moștenită din lat. post; articolul o lasă în afara categoriilor etimologice folosite la inventar |
| film | Franceza | fr. film; clasificarea automată a păstrat și categoria germană, dar lanțul și DEX indică donatorul francez |
| mașină | Franceza | fr. machine; germ. Maschine este etimon concurent, nu clasificarea proximă folosită aici |
| motiv | Franceza | fr. motif; italiana și germana apar ca surse concurente în notele etimologice |
| telefon | Franceza | fr. téléphone; germana apare ca etimon concurent în datele automate |
| corp | Franceza | fr. corps pentru sensul modern; lat. corpus și germana apar ca trasee concurente |
| cameră | Italiana | it. camera; clasificarea automată o trimitea greșit la engleză |
| scuză | Italiana | it. scusa; franceza este menționată ca paralelă pentru excuse |
| profesor | Franceza | fr. professeur; germ. Professor este etimon concurent |
| rezultat | Franceza | fr. résultat; germ. Resultat este etimon concurent |
| birou | Franceza | fr. bureau; rusa apare ca variantă concurentă, dar lanțul și DEX indică franceza |
| doctor | Latina savantă | lat. doctor; franceza și germana sunt forme concurente, iar clasificarea germană era o alegere automată greșită |
| spital | Germana | germ. Spital pentru forma română standard; greaca și latina apar în trasee alternative |
| religie | Franceza | fr. religion; latina și germana apar ca surse concurente |
| ofițer | Franceza | fr. officier; rusa și germana sunt etimoane concurente |
| bancă | Franceza | fr. banc pentru sensul publicat; italiana explică un alt sens și o analiză paralelă |
| organizație | Franceza | fr. organisation; germ. Organisation este etimon concurent |
| real | Franceza | fr. réel în uzul modern; germana și latina apar în trasee concurente |
Refacerea analizei
Arhiva publică include codul, datele procesate, notele de cercetare și fișierele cu care poți reconstrui pagina și verifica cifrele.
Descarcă arhiva pentru refacerea analizei SHA-256
Pentru a reface analiza de la sursă, trebuie descărcate separat fișierele complete de la dexonline, Wikisource, Wikipedia și OpenSubtitles. Ele nu sunt redistribuite în arhivă. Fișierul REPRODUCERE.md indică sursele, numele așteptate și ordinea pașilor. După descărcare, comenzile de mai jos pot fi rulate în ordinea indicată.
python3 tools/fetch_categories.py python3 tools/dex_extract.py python3 tools/ws_index.py python3 tools/corpus_hist.py python3 tools/corpus_now.py python3 tools/official.py python3 tools/shortlist.py python3 tools/fetch_entries.py python3 tools/dex_check.py python3 tools/audit_top.py python3 tools/function_filter.py python3 tools/analyse.py python3 tools/explore.py node build.mjs node qa_assertions.mjs