31 august 2026 · Limba Noastră

Un agent vocal pentru română, care rulează pe serverul tău

Ascultă. Vorbește. Îl poți întrerupe. Și nu trimite vocea nimănui.

Ascultă

Aceeași frază, patru voci

Toate sintetizate local, pe procesor, fără niciun serviciu extern. Apasă ca să auzi.

Aceeași voce, două limbi

Comutarea se face în timpul conversației, fără reconectare. Se schimbă recunoașterea, sinteza și instrucțiunile deodată.

Cazurile grele

„Suma totală este de 23480 de lei, iar programul e de la 09:00 până la 22:00."

Numerele rostite se transformă în cifre înainte să ajungă la model — „douăzeci și trei de mii patru sute optzeci" devine 23480. E defectul cel mai scump din orice agent vocal: unul care nu reține o oră corect nu poate lua o programare.

„Îmi pare rău, în această înserare târzie nu găsesc nicio șansă."

ă, â, î, ș, ț în aceeași frază. Sunt semnul limbii — și primul lucru care sună fals la un sistem antrenat pe altceva.

„Ați dori să vă sun înapoi mâine dimineață?"

Aceeași pantă a înălțimii pe care sistemul o citește ca să știe dacă ai terminat de vorbit — de data asta produsă, nu ascultată.

Modelul de sinteză are 99 de milioane de parametri și rulează pe procesor, fără accelerator. Zece voci disponibile. Nu are clonare de voce în greutățile publice — e pe listă, nu în produs.

Numele

Grai e felul în care vorbește un om

Nu limba ca sistem. Vorbirea vie — cu accent, cu ritm, cu pauzele care spun că mai ai ceva de zis.

Asta încearcă să prindă sistemul. Nu doar ce spui, ci cum.

pauza

Semnul: linia vorbirii, ruptă de o pauză. Sub pauză stă virgulița de la ș și ț — semnul limbii pe care nu o servește nimeni. Pauza e locul unde sistemul trebuie să decidă dacă ai terminat de vorbit. E problema centrală a oricărui agent vocal.

Unde rulează

Vocea se oprește la granița serverului tău

Recunoașterea vorbirii și sinteza rulează pe mașina ta. Spre exterior pleacă doar text — niciodată audio.

MAȘINA TA granița tu ascultă 92 ms vorbește 305 ms model de limbaj 2180 ms doar text trece dincolo

Singura piesă din afara mașinii e modelul de limbaj — și el primește text, nu sunet. Restul lanțului stă la tine: recunoaștere, sinteză, anularea ecoului, decizia de tură.

Pentru cabinete și birouri

Unde vocea pacientului sau a clientului n-are voie să plece, asta nu e o preferință tehnică. E condiția de a putea folosi ceva.

Nu se depreciază sub tine

Un furnizor de voci a fost cumpărat, platforma s-a închis, clonele clienților au fost șterse. Ce rulează la tine rămâne.

Cost zero la rulare

Piesele de audio nu se plătesc per minut. Singurul cost variabil e modelul de limbaj.

Cum ascultă

Pauza se aude în intonație, nu în tăcere

Aproape toți agenții vocali decid că ai terminat de vorbit după un număr fix de milisecunde de liniște. E un cronometru, nu un detector — și taie oamenii la mijlocul frazei.

Grai se uită la panta înălțimii vocii pe ultima jumătate de secundă. Coborâre fermă: ai încheiat. Plat sau urcare: mai ai ceva de spus.

„aș vrea o masă pentru patru persoane." coboară → a terminat „aș vrea o masă pentru…" rămâne sus → continuă

Măsurat pe conversații umane reale: la aceeași rată de greșeală ca un prag fix de 820 ms, decizia pe intonație așteaptă 560 ms — și ia mai multe decizii, deci câștigul nu vine din a decide mai rar. Costă 0,42 milisecunde.

„Mhm" nu e o întrerupere

Confirmările scurte nu-l opresc. Distinge patru cazuri: scurt sau lung, confirmare sau preluare de tură.

Lipește frazele rupte

Te oprești la mijloc și continui — continuarea nu e tratată ca întrebare nouă. Iar dacă apucase să răspundă, răspunsul se anulează.

Ridică pragul la dictare

Când dictezi cifre, un cod sau o adresă, așteaptă mai mult. Ca să nu te taie între „șapte" și „sute".

Se potrivește ritmului tău

Pragul se calibrează pe cât de repede vorbești, în silabe pe secundă. Cine face pauze lungi nu mai e tăiat.

Ascultă cât vorbește

Anularea de ecou scoate din microfon propria voce, deci microfonul rămâne deschis și pe difuzoare, nu doar pe căști.

−15,7 dB măsurat

Aude cum vorbești

Ritm, înălțime, ezitare, șoaptă — normalizate față de linia ta de bază. Altfel ar măsura cine ești, nu cum ești.

1,9 ms per replică
Întreruperea

Vorbește peste el și tace

Partea grea nu e să se oprească. E ce rămâne în memoria lui după.

agentul vorbește întrerupere generat, dar niciodată auzit în memoria lui rămâne exact cât s-a auzit din difuzor

Sinteza merge mai repede decât redarea, deci la întrerupere rămâne în tampon audio care n-a ajuns niciodată la ureche. Fără corecție, modelul crede că a spus tot — și la replica următoare zice „v-am spus deja" despre ceva ce n-ai auzit. Istoricul se taie la câte milisecunde s-au redat efectiv.

Oprirea durează între 1 și 3 milisecunde.

În paralel

Lucrează cât vorbește

Când are nevoie de o informație din afară, majoritatea agenților tac și așteaptă. Grai bifurcă: spune o punte scurtă, trimite treaba pe alt fir, și rămâne întreruptibil.

firul vorbirii unealta lucrează rezultatul intră „verific" și poți vorbi peste el aici dacă unealta întârzie, rezultatul se anunță separat — chiar dacă ai închis fila

Un al doilea model poate rula în fundal, cu alt rol, ca să răspundă la întrebări laterale fără să blocheze conversația principală.

Nu se stinge

Agentul trăiește în afara conexiunii

La aproape toți furnizorii, conversația e legată de sesiune. Închizi fila, se pierde. Cade rețeaua, se pierde. Repornește serverul, se pierde.

conversație închizi fila uneltele termină · trezirile se declanșează · ce are de spus se pune la coadă te întorci continuă de unde a rămas

Supraviețuiește repornirii serverului

Nu doar reîncărcării paginii — și unei reporniri complete a mașinii. Din tot ce am verificat pe piață, nimeni nu face asta.

Revine singur

Își programează o revenire — „îți spun în zece minute" — și se declanșează chiar dacă nu e nimeni conectat.

Ține minte oamenii

Memorie între conversații, cu revizuire în timp: ce era „vine vineri" devine „a venit vineri" după ce trece vineri.

Uită când i se cere

Ștergerea funcționează pe disc, nu doar în interfață. Vocea unei persoane e dată biometrică.

Pentru cine îl instalează

Mai mulți agenți, aceleași motoare

Modelele sunt tot costul. Agenții sunt doar configurație — deci zeci de agenți încap pe același proces.

Fiecare agent, al lui

Voce, limbă, instrucțiuni, unelte, bază de cunoștințe. Zece voci disponibile, română și rusă cu comutare la cald.

Clienți izolați

Fiecare cu cheia lui. Un client nu vede și nu poate atinge agenții altuia.

Widget de o linie

Un script pe pagina clientului. Fără dependențe, izolat de stilurile gazdei.

27,6 KB

Cote și coadă

Limite pe client și pe adresă, cu poziția în coadă în loc de refuz sec.

Comparație

Față de ChatGPT Live și de restul pieței

Cifrele altora sunt marcate ca declarate de ei. Ale noastre sunt măsurate, cu metodologia publicată. Nu comparăm mărimi diferite doar pentru că poartă același nume.

GraiChatGPT LiveRestul pieței
Românăda da, dar fișa de model recunoaște că detecția limbii cade pe accente non-native 5 din 6 laboratoare mari nu o au deloc
Audio pe serverul tăuda, integral nudoar on-premise scump, la doi furnizori
Disponibil ca APIda nu — listă de așteptareda
Reluarea sesiunii după refresh, deconectare și repornire de server moare la 60 de minute un singur furnizor are reluare adevărată
Lucrează între viziteda nunimeni
Full-duplex nativnu — cascadat, cu întrerupere damajoritatea, cascadat
Acuratețe pe română26,31% nepublicat 3,0–5,28% (declarat)
Până la răspuns2667 ms nepublicat 1,26 s la vârful competiției
Cost la rulare0 per minut0,40–1,20 $/oră

Pe acuratețe suntem la un factor de cinci față de cei mai buni. Nu e o nuanță de metodologie, e o diferență reală.

Măsurat

Unde se duc milisecundele

De la ultimul sunet pe care îl scoți tu, până la primul care iese din difuzor. Fiecare segment are două capete observate, nu calculate — iar suma lor dă totalul cu abatere sub o jumătate de milisecundă.

decizie de tură
586 ms
recunoaștere
92 ms
modelul de limbaj
2180 ms
sinteza vocii
305 ms
coadă, transport
6 ms

Modelul de limbaj e 69% din latență — și e singura piesă care nu rulează local. Coada, în schimb, e șase milisecunde. Două zecimi de procent.

De ce e greu de comparat

Cifrele industriei nu se pot pune una lângă alta

Un furnizor publică „sub 300 ms" în comunicat. În același articol dă și măsurătoarea proprie: 0,9–1,4 secunde. Nu e o contradicție. Sunt două mărimi diferite, cu același nume.

„Sub 300 ms" măsoară inferența pe hardware ideal. Alte cifre pornesc cronometrul de la server, fără rețea și fără tamponul de redare. În singurul concurs unde full-duplexul se măsoară cu adevărat, latența câștigătorului e 1,26 secunde.

Patru întrebări care sparg orice comunicat

Unde pornește cronometrul?

Include decizia de sfârșit de tură? E măsurat pe server sau la client? Include tamponul de redare?

Primul sunet e răspunsul?

Sau e un „îhî" care acoperă așteptarea? Diferența poate fi de peste o secundă.

Ce normalizare s-a aplicat?

Un scor care scrie numerele în litere înainte de comparație ascunde exact defectul care contează la telefon.

În ce limbă a fost măsurat?

Pentru română, răspunsul e „în niciuna dintre cele publicate".

Onest

Ce nu e, și ce nu promitem încă

Nu e un model. N-am antrenat greutăți. Ce e al nostru e felul în care piesele lucrează împreună în timp real — pauzele, întreruperile, uneltele care rulează cât agentul vorbește, sesiunea care nu moare. Cifrele bune vin de acolo. Cele proaste vin din modelele împrumutate.

Nu e gata. 26,31% eroare de recunoaștere pe română. 2,7 secunde până la răspuns. Fără telefonie, fără clonare de voce, fără full-duplex nativ.

Le scriem fiindcă un client tehnic le află oricum în primele cinci minute. Mai bine de la noi, cu metodologia lângă ele.

Ce urmează

Trei antrenări, sub 1.200 de dolari

Recunoașterea pe română, prima — fiindcă detectorul de tură depinde de ea. Verificarea că o tăietură cade la graniță de cuvânt se face transcriind bucata; cu recunoaștere slabă construim setul cu rigla strâmbă.

Detectorul de sfârșit de tură, sub o sută de dolari. Modelul are 8 megaocteți și rulează în 12 milisecunde pe procesor. Româna ar fi limba a douăzeci și patra din proiect.

Vocea proprie. Blocată deocamdată nu pe bani, ci pe licența datelor.

Până atunci, ce e al nostru e harnessul — partea pe care liderii pieței au ales-o în locul unui model unic, și pe care pentru română n-o are nimeni.