Grai · Clonarea vocii

Clonarea vocii

Se poate, în șase până la treizeci de minute. Dar nu așa cum se vinde, și cu obligații pe care majoritatea furnizorilor nu le scriu în contract.

Ce se poate azi

Nu în cinci secunde. În jumătate de oră, o dată.

Piața vinde clonare zero-shot: dai cinci secunde de înregistrare, primești vocea. Noi nu facem asta, și motivul e că tot ce face zero-shot pe română e non-comercial — nu din întâmplare, ci pentru că aproape toate acele modele sunt antrenate pe același set de date cu licență restrictivă.

Ce facem în schimb: optimizare inversă cu gradient. Modelul de sinteză rămâne înghețat, iar parametrii de stil ai vocii se optimizează până se potrivesc cu vocea țintă. Rezultatul nu e un model nou — e un fișier de câțiva kilobyți, care se încarcă în motorul existent.

6–30minute per voce
2,6 GBmemorie de vârf
3.000pași de optimizare
~KBce se livrează la client

Limita, declarată de autorul metodei

Metoda prinde identitatea vorbitorului, nu expresivitatea emoțională. Vocea sună a persoana respectivă; nu-i reproduce felul de a se entuziasma sau de a ezita.

Pentru cazul real — „vocea recepționerei noastre" — asta e suficient. Vocea nu trebuie generată în cinci secunde, trebuie generată o dată, bine.

De ce nu zero-shot

Am verificat licența fiecărui model de clonare cu română, pe pagina lui. Rezultatul e un tipar, nu o coincidență:

ModelRomânăClonareLicențăComercial
OmniVoicedazero-shot non-comercialănu
XTTS-v2dazero-shot Coqui Public Model Licensenu
F5-TTS și derivatele româneștidazero-shot moștenită din setul de antrenarenu
Supertonic 3 + optimizator de stilda prin optimizare, 6–30 min OpenRAIL-M pe model, MIT pe optimizatorda, cu obligații

Cauza tiparului nu e limba. E un singur set de date pe care s-au antrenat aproape toate modelele de clonare zero-shot. Afirmația „tot ce are română și clonare e non-comercial" e aproape adevărată — și falsă exact în cazul pe care îl folosim noi.

Obligații

Ce trebuie scris în contract

Astea nu sunt detalii juridice de subsol. Sunt obligații care se propagă la fiecare client căruia îi instalăm sistemul, și pe care le scriem aici fiindcă nu le scrie aproape nimeni.

Modelul de sinteză nu e „open source"

Doar codul de exemplu al Supertonic 3 e MIT. Greutățile sunt OpenRAIL-M — uz comercial permis, dar cu restricții de utilizare care trebuie transmise mai departe, la fiecare client. Nu e blocant. E o clauză contractuală reală.

Vocea e dată biometrică

Consimțământ scris al persoanei, scop limitat, ștergere la cerere. În Republica Moldova, Legea 195/2024 e în vigoare din 23 august 2026 și tratează vocea identificabilă drept categorie specială de date.

O ambiguitate pe care n-o ascundem

Producătorul motorului vinde separat un serviciu propriu de construit voci, cu termenii lui. Un stil produs local, prin optimizare peste greutăți OpenRAIL-M, dintr-o înregistrare a clientului, e după interpretarea noastră o operă derivată guvernată de OpenRAIL-M. Interpretarea e rezonabilă, nu e verificată de un jurist. E pe listă înaintea primului contract care menționează clonarea.

Nu clonăm voci fără acordul persoanei

Nici la cererea unui client care spune că are dreptul. Cerem acordul scris al vorbitorului, nu declarația celui care comandă.

Ce e disponibil azi

Zece voci, două limbi, fără clonare

Până când clonarea intră în produs cu contractele lămurite, sistemul livrează zece voci existente. Aceeași voce vorbește și română, și rusă — comutarea se face în timpul conversației, fără reconectare.

Sinteza are 99 de milioane de parametri și rulează pe procesor, fără accelerator. 31 de limbi în model, dintre care româna și rusa ne interesează.

Vreți o voce proprie?

Scrieți-ne ce voce, pentru ce, și cu ce acord. Vă spunem cinstit dacă se poate azi, ce obligații vin cu ea, și ce rămâne de lămurit înainte de semnătură.