Grai · Date audio
Cu licență curată și consimțământ. E singurul lucru care ne mai desparte de un model românesc care nu mai are nimic împrumutat.
Româna noastră e slabă dintr-un motiv simplu și reparabil: recunoașterea pe care o folosim n-a fost antrenată pe română. Antrenarea costă sub 500 de dolari de calcul. Nu banii sunt blocantul. Datele sunt.
Și nu orice date. Un corpus cu licență greșită contaminează modelul antrenat pe el — dacă materia primă e „necomercial", produsul devine neutilizabil comercial. De aceea nu descărcăm ce se nimerește: verificăm licența pe pagina fiecărui set, la sursă, și scriem alături ce am găsit.
Pentru corpusuri consistente, cumpărăm sau licențiem, cu contract. Spune-ne ce ai și discutăm cifre.
Pentru instituții și proiecte culturale: acces gratuit la ce iese din datele voastre, pe termen nelimitat.
Sursa datelor scrisă în fișa modelului și pe pagina asta, dacă asta preferați în locul plății.
Segmentare, aliniere, filtre de integritate, manifeste. Voi dați materialul brut, restul e treaba noastră.
Dacă un vorbitor își retrage acordul, segmentele lui ies din corpus. Vocea unei persoane e dată biometrică.
Datele voastre rămân ale voastre. Nu le redistribuim și nu le amestecăm în seturi publicate.
Am verificat licența pe pagina fiecărui set. Tabelul e util și dacă nu colaborați cu noi — greșelile de licență din domeniul ăsta sunt scumpe și frecvente.
| Corpus | Ore RO | Licență, verificată la sursă | Comercial |
|---|---|---|---|
VoxPopuli ro | 89,00 măsurat | CC0 — domeniu public | da, fără umbră |
Granary ro | ~12.900 estimat | CC-BY-4.0 pe adnotări; audio rămâne CC0 de la VoxPopuli | da |
FLEURS ro_ro | ~10 | CC-BY-4.0 | da |
| SWARA (UTCluj) | 21 | CC-BY-SA 4.0 — share-alike | teren juridic neclarificat pe greutăți |
Common Voice ro | variabil | CC0, dar din octombrie 2025 doar pe Mozilla Data Collective, cu cont | da, dar cu poartă |
WorldSpeech ro_ro + ro_md | 1.746 | CC-BY-NC-4.0 — necomercial | nu |
| RSC | 100 | CC-BY-NC-ND 4.0 — nici derivate | nu, deloc |
RSC e cel mai mare corpus curat de română și e interzis. „ND" înseamnă că nu poți face nici măcar derivate — un model antrenat pe el e un derivat. E cel mai tentant și cel mai interzis din listă.
WorldSpeech are exact ce ne trebuie — 1.746 de ore, inclusiv ro_md — și e
necomercial. Excepția din Legea 8/1996 acoperă înregistrarea parlamentară originală, nu
compilația lor. Ca să folosim orele acelea comercial, trebuie refăcută extracția din arhiva
originală a Senatului — săptămâni de muncă, plus o verificare juridică pe care nu ne-o putem
da singuri.
Concluzia practică: domeniul public și CC0 sunt singurele fără nicio umbră. Pentru orice altceva, sursa cea mai curată e o înregistrare făcută cu acord explicit — de aceea pagina asta există.
În Republica Moldova, Legea 195/2024 privind protecția datelor cu caracter personal e în vigoare din 23 august 2026. Vocea unei persoane identificabile e dată biometrică — categorie specială, cu temei juridic explicit, scop limitat și drept de ștergere. Orice colaborare pe date pornește de acolo, nu de la o strângere de mână.
Radiodifuzori, arhive, instituții culturale, centre de apel, universități, proiecte de documentare orală — scrieți-ne ce aveți și în ce condiții s-ar putea folosi. Răspundem la fiecare mesaj.