Grai · Clasament

Clasament și cifre

Fiecare cifră cu eșantionul, geometria și intervalul de încredere alături. Inclusiv cele care nu ne avantajează.

Regula după care e scrisă pagina asta

Măsurat înseamnă că a rulat pe hardware-ul nostru și cifra vine din rulare. Declarat înseamnă că e luată de pe pagina furnizorului și n-am putut-o verifica — sunt modele închise, în cloud. Cele două nu se amestecă niciodată în aceeași coloană fără etichetă.

Recunoașterea vorbirii

FLEURS română și rusă

Model: Nemotron 3.5 ASR streaming, 0,6 miliarde de parametri. Eșantion: 200 de enunțuri per limbă din setul de test, aleator uniform, sămânța 20260831. Decodare pe drumul din producție — cache-aware, în flux — nu decodare offline pe fișier întreg.

FereastrăNoi, normalizatIC 95% Noi, brutNVIDIA, fișaViteză
320 ms29,18%27,63–32,21 31,05%29,04%3,6×
560 ms27,98%26,40–30,76 29,74%27,77%6,0×
1120 ms — implicitul nostru26,31% 24,07–28,6027,94% 25,90%13,8×

Trei puncte independente, toate în intervalul de încredere față de fișa NVIDIA. Cifra noastră nu e un test stricat — e comportamentul cunoscut al modelului, confirmat de producătorul lui. Ce e prost e că modelul n-a fost antrenat pe română.

Rusa, aceeași conductă, aceeași rulare

FereastrăNoi, normalizatIC 95% Noi, brutNVIDIA, fișa
320 ms10,87%9,57–12,27 14,10%9,87%
1120 ms — implicit9,30%8,19–10,99 12,37%9,17%
26,31%română
9,30%rusă
2,8×diferența dintre ele

Româna e de 2,8× mai proastă decât rusa în același model, pe același hardware, în aceeași rulare. Nu e o impresie preluată din fișa cuiva. Agentul nostru bilingv nu are două limbi egale; are o limbă bună și una slabă.

Comparație de piață

Cu condițiile de măsurare alături

Coloana „cum" e partea care face tabelul citibil. Un model care primește fișierul întreg, offline, într-un centru de date, nu rezolvă aceeași problemă ca unul care scoate text în timp ce omul încă vorbește, pe procesorul din birou.

SistemWER FLEURS roCumSursa
ElevenLabs Scribe v13,0%cloud, lotdeclarat
Gemini Flash 23,9%clouddeclarat
Speechmatics Enhanced5,28%cloud și on-prem, în fluxdeclarat
Amazon Transcribe8,94%clouddeclarat
Grai — rusă9,30%local, în flux, pe procesormăsurat
Google Chirp 210,91%clouddeclarat
Whisper large-v312,31% / 13,0%offline, fișier întreg, 1,5 miliardedeclarat
Microsoft Azure Speech13,33%clouddeclarat
Grai — română26,31%local, în flux, 0,6 miliardemăsurat
Deepgram Nova-233,89% / 35,4%clouddeclarat

Calibrarea care arată cât valorează tabelul de mai sus

Două pagini de furnizor publică cifre pentru aceleași două modele terțe, și nu coincid: Whisper large-v3 apare ca 12,31% la unul și 13,0% la altul; Deepgram Nova-2 ca 33,89% și 35,4%. Adică între două „FLEURS română" publicate există 0,7–1,5 puncte de diferență doar din partiție și normalizare.

Marja aia contează când compari 3,0% cu 5,28%. Nu contează deloc când compari oricare din ele cu 26,31%. Poziția onestă: la acuratețe pe română pierdem, cu un factor de 5–9×.

Ce avem în schimb, și ei nu

Un singur furnizor din listă oferă și on-prem cu română în flux — deci e singurul care ne atacă direct argumentul. Contra lui, argumentul rămâne costul și controlul, nu acuratețea.

Unde se pierde

Cifrele. Exact partea care contează la telefon.

Împărțind cele 200 de enunțuri după prezența cifrelor în referință:

EnunțurinWER normalizatWER brutCe spune
fără cifre16325,08%25,43% normalizarea aproape nu contează
cu cifre3730,37%36,94% normalizarea ascunde 6,6 puncte

Un enunț cu cifre e cu 5,3 puncte mai prost normalizat și cu 11,5 puncte mai prost brut. Exemple reale din rulare:

ReferințăCe a ieșit
din 1988 urnele de vot…Denomin ustie xopt, urnele de votre…
în 1537 paraguay…în o mie cinu ste și șapte, Paraguay…
pușca sa m16ca să M Shaișpe
cele 25 de postere dunlapCele douăze și inci de postere Danop

Orice normalizare care scrie numerele în litere înainte de scorare ne face să arătăm mai bine decât suntem la telefon. De aceea raportăm și brut. Pentru un agent care ia numere de telefon, ore, prețuri și date, partea cea mai importantă a limbii e și cea mai stricată. De ce contează normalizarea →

Latență

De la ultimul tău sunet, la primul al lui

Fiecare segment are două capete observate, nu calculate — suma lor dă totalul cu abatere sub o jumătate de milisecundă.

decizie de tură
586 ms
recunoaștere
92 ms
modelul de limbaj
2180 ms
sinteza vocii
305 ms
coadă, transport
6 ms
1235ms până la primul sunet
2667ms până la răspuns
69%din latență e modelul de limbaj

Cei 1235 ms se compară cu 1260 ms, latența câștigătorului de la HumDial, ICASSP 2026 — singurul concurs unde full-duplexul se măsoară cu adevărat. Starea artei nu e 300 ms. Singura piesă care nu rulează local e și 69% din întârziere.

Detecția turei

Prozodie față de cronometru

820ms · prag fix, aceeași greșeală
560ms · pe intonație
52,0%rată de tăiere corectă
0,42ms cost per pauză

Măsurat pe conversații umane reale. Câștigul nu vine din a decide mai rar: decizia pe prozodie ia mai multe decizii decât pragul fix, și tot greșește mai puțin. Reperele publice pentru comparație: 9,9% tăieri false la 300 ms și 4,5% la 600 ms, la LiveKit v1.

De ce cifrele astea nu se pot compara cu ale altora

Studiul explică cele cinci capcane de metodologie care fac tabelele publicate incomparabile — cu exemple din propriile noastre greșeli.