Grai · Date audio

Căutăm vorbire
românească înregistrată

Cu licență curată și consimțământ. E singurul lucru care ne mai desparte de un model românesc care nu mai are nimic împrumutat.

De ce

Licența datelor decide licența modelului

Româna noastră e slabă dintr-un motiv simplu și reparabil: recunoașterea pe care o folosim n-a fost antrenată pe română. Antrenarea costă sub 500 de dolari de calcul. Nu banii sunt blocantul. Datele sunt.

Și nu orice date. Un corpus cu licență greșită contaminează modelul antrenat pe el — dacă materia primă e „necomercial", produsul devine neutilizabil comercial. De aceea nu descărcăm ce se nimerește: verificăm licența pe pagina fiecărui set, la sursă, și scriem alături ce am găsit.

Ce căutăm

Ce oferim în schimb

Plată sau licențiere

Pentru corpusuri consistente, cumpărăm sau licențiem, cu contract. Spune-ne ce ai și discutăm cifre.

Acces la modelul rezultat

Pentru instituții și proiecte culturale: acces gratuit la ce iese din datele voastre, pe termen nelimitat.

Creditare publică

Sursa datelor scrisă în fișa modelului și pe pagina asta, dacă asta preferați în locul plății.

Prelucrarea o facem noi

Segmentare, aliniere, filtre de integritate, manifeste. Voi dați materialul brut, restul e treaba noastră.

Ștergere la cerere

Dacă un vorbitor își retrage acordul, segmentele lui ies din corpus. Vocea unei persoane e dată biometrică.

Nu revindem corpusul

Datele voastre rămân ale voastre. Nu le redistribuim și nu le amestecăm în seturi publicate.

Inventarul public

Ce există deja, și ce nu putem atinge

Am verificat licența pe pagina fiecărui set. Tabelul e util și dacă nu colaborați cu noi — greșelile de licență din domeniul ăsta sunt scumpe și frecvente.

CorpusOre ROLicență, verificată la sursăComercial
VoxPopuli ro89,00 măsurat CC0 — domeniu publicda, fără umbră
Granary ro~12.900 estimat CC-BY-4.0 pe adnotări; audio rămâne CC0 de la VoxPopulida
FLEURS ro_ro~10 CC-BY-4.0da
SWARA (UTCluj)21 CC-BY-SA 4.0 — share-aliketeren juridic neclarificat pe greutăți
Common Voice rovariabil CC0, dar din octombrie 2025 doar pe Mozilla Data Collective, cu cont da, dar cu poartă
WorldSpeech ro_ro + ro_md1.746 CC-BY-NC-4.0 — necomercialnu
RSC100 CC-BY-NC-ND 4.0 — nici derivatenu, deloc

Două capcane care par oportunități

RSC e cel mai mare corpus curat de română și e interzis. „ND" înseamnă că nu poți face nici măcar derivate — un model antrenat pe el e un derivat. E cel mai tentant și cel mai interzis din listă.

WorldSpeech are exact ce ne trebuie — 1.746 de ore, inclusiv ro_md — și e necomercial. Excepția din Legea 8/1996 acoperă înregistrarea parlamentară originală, nu compilația lor. Ca să folosim orele acelea comercial, trebuie refăcută extracția din arhiva originală a Senatului — săptămâni de muncă, plus o verificare juridică pe care nu ne-o putem da singuri.

Concluzia practică: domeniul public și CC0 sunt singurele fără nicio umbră. Pentru orice altceva, sursa cea mai curată e o înregistrare făcută cu acord explicit — de aceea pagina asta există.

Reguli proprii

Ce nu facem cu datele

Cadrul legal aplicabil

În Republica Moldova, Legea 195/2024 privind protecția datelor cu caracter personal e în vigoare din 23 august 2026. Vocea unei persoane identificabile e dată biometrică — categorie specială, cu temei juridic explicit, scop limitat și drept de ștergere. Orice colaborare pe date pornește de acolo, nu de la o strângere de mână.

Colaborare

Aveți înregistrări în română?

Radiodifuzori, arhive, instituții culturale, centre de apel, universități, proiecte de documentare orală — scrieți-ne ce aveți și în ce condiții s-ar putea folosi. Răspundem la fiecare mesaj.