Grai · Clonarea vocii
Se poate, în șase până la treizeci de minute. Dar nu așa cum se vinde, și cu obligații pe care majoritatea furnizorilor nu le scriu în contract.
Piața vinde clonare zero-shot: dai cinci secunde de înregistrare, primești vocea. Noi nu facem asta, și motivul e că tot ce face zero-shot pe română e non-comercial — nu din întâmplare, ci pentru că aproape toate acele modele sunt antrenate pe același set de date cu licență restrictivă.
Ce facem în schimb: optimizare inversă cu gradient. Modelul de sinteză rămâne înghețat, iar parametrii de stil ai vocii se optimizează până se potrivesc cu vocea țintă. Rezultatul nu e un model nou — e un fișier de câțiva kilobyți, care se încarcă în motorul existent.
Metoda prinde identitatea vorbitorului, nu expresivitatea emoțională. Vocea sună a persoana respectivă; nu-i reproduce felul de a se entuziasma sau de a ezita.
Pentru cazul real — „vocea recepționerei noastre" — asta e suficient. Vocea nu trebuie generată în cinci secunde, trebuie generată o dată, bine.
Am verificat licența fiecărui model de clonare cu română, pe pagina lui. Rezultatul e un tipar, nu o coincidență:
| Model | Română | Clonare | Licență | Comercial |
|---|---|---|---|---|
| OmniVoice | da | zero-shot | non-comercială | nu |
| XTTS-v2 | da | zero-shot | Coqui Public Model License | nu |
| F5-TTS și derivatele românești | da | zero-shot | moștenită din setul de antrenare | nu |
| Supertonic 3 + optimizator de stil | da | prin optimizare, 6–30 min | OpenRAIL-M pe model, MIT pe optimizator | da, cu obligații |
Cauza tiparului nu e limba. E un singur set de date pe care s-au antrenat aproape toate modelele de clonare zero-shot. Afirmația „tot ce are română și clonare e non-comercial" e aproape adevărată — și falsă exact în cazul pe care îl folosim noi.
Astea nu sunt detalii juridice de subsol. Sunt obligații care se propagă la fiecare client căruia îi instalăm sistemul, și pe care le scriem aici fiindcă nu le scrie aproape nimeni.
Doar codul de exemplu al Supertonic 3 e MIT. Greutățile sunt OpenRAIL-M — uz comercial permis, dar cu restricții de utilizare care trebuie transmise mai departe, la fiecare client. Nu e blocant. E o clauză contractuală reală.
Consimțământ scris al persoanei, scop limitat, ștergere la cerere. În Republica Moldova, Legea 195/2024 e în vigoare din 23 august 2026 și tratează vocea identificabilă drept categorie specială de date.
Producătorul motorului vinde separat un serviciu propriu de construit voci, cu termenii lui. Un stil produs local, prin optimizare peste greutăți OpenRAIL-M, dintr-o înregistrare a clientului, e după interpretarea noastră o operă derivată guvernată de OpenRAIL-M. Interpretarea e rezonabilă, nu e verificată de un jurist. E pe listă înaintea primului contract care menționează clonarea.
Nici la cererea unui client care spune că are dreptul. Cerem acordul scris al vorbitorului, nu declarația celui care comandă.
Până când clonarea intră în produs cu contractele lămurite, sistemul livrează zece voci existente. Aceeași voce vorbește și română, și rusă — comutarea se face în timpul conversației, fără reconectare.
Sinteza are 99 de milioane de parametri și rulează pe procesor, fără accelerator. 31 de limbi în model, dintre care româna și rusa ne interesează.
Scrieți-ne ce voce, pentru ce, și cu ce acord. Vă spunem cinstit dacă se poate azi, ce obligații vin cu ea, și ce rămâne de lămurit înainte de semnătură.