Grai · Clasament
Fiecare cifră cu eșantionul, geometria și intervalul de încredere alături. Inclusiv cele care nu ne avantajează.
Măsurat înseamnă că a rulat pe hardware-ul nostru și cifra vine din rulare. Declarat înseamnă că e luată de pe pagina furnizorului și n-am putut-o verifica — sunt modele închise, în cloud. Cele două nu se amestecă niciodată în aceeași coloană fără etichetă.
Model: Nemotron 3.5 ASR streaming, 0,6 miliarde de parametri. Eșantion: 200 de enunțuri per limbă din setul de test, aleator uniform, sămânța 20260831. Decodare pe drumul din producție — cache-aware, în flux — nu decodare offline pe fișier întreg.
| Fereastră | Noi, normalizat | IC 95% | Noi, brut | NVIDIA, fișa | Viteză |
|---|---|---|---|---|---|
| 320 ms | 29,18% | 27,63–32,21 | 31,05% | 29,04% | 3,6× |
| 560 ms | 27,98% | 26,40–30,76 | 29,74% | 27,77% | 6,0× |
| 1120 ms — implicitul nostru | 26,31% | 24,07–28,60 | 27,94% | 25,90% | 13,8× |
Trei puncte independente, toate în intervalul de încredere față de fișa NVIDIA. Cifra noastră nu e un test stricat — e comportamentul cunoscut al modelului, confirmat de producătorul lui. Ce e prost e că modelul n-a fost antrenat pe română.
| Fereastră | Noi, normalizat | IC 95% | Noi, brut | NVIDIA, fișa |
|---|---|---|---|---|
| 320 ms | 10,87% | 9,57–12,27 | 14,10% | 9,87% |
| 1120 ms — implicit | 9,30% | 8,19–10,99 | 12,37% | 9,17% |
Româna e de 2,8× mai proastă decât rusa în același model, pe același hardware, în aceeași rulare. Nu e o impresie preluată din fișa cuiva. Agentul nostru bilingv nu are două limbi egale; are o limbă bună și una slabă.
Coloana „cum" e partea care face tabelul citibil. Un model care primește fișierul întreg, offline, într-un centru de date, nu rezolvă aceeași problemă ca unul care scoate text în timp ce omul încă vorbește, pe procesorul din birou.
| Sistem | WER FLEURS ro | Cum | Sursa |
|---|---|---|---|
| ElevenLabs Scribe v1 | 3,0% | cloud, lot | declarat |
| Gemini Flash 2 | 3,9% | cloud | declarat |
| Speechmatics Enhanced | 5,28% | cloud și on-prem, în flux | declarat |
| Amazon Transcribe | 8,94% | cloud | declarat |
| Grai — rusă | 9,30% | local, în flux, pe procesor | măsurat |
| Google Chirp 2 | 10,91% | cloud | declarat |
| Whisper large-v3 | 12,31% / 13,0% | offline, fișier întreg, 1,5 miliarde | declarat |
| Microsoft Azure Speech | 13,33% | cloud | declarat |
| Grai — română | 26,31% | local, în flux, 0,6 miliarde | măsurat |
| Deepgram Nova-2 | 33,89% / 35,4% | cloud | declarat |
Două pagini de furnizor publică cifre pentru aceleași două modele terțe, și nu coincid: Whisper large-v3 apare ca 12,31% la unul și 13,0% la altul; Deepgram Nova-2 ca 33,89% și 35,4%. Adică între două „FLEURS română" publicate există 0,7–1,5 puncte de diferență doar din partiție și normalizare.
Marja aia contează când compari 3,0% cu 5,28%. Nu contează deloc când compari oricare din ele cu 26,31%. Poziția onestă: la acuratețe pe română pierdem, cu un factor de 5–9×.
Un singur furnizor din listă oferă și on-prem cu română în flux — deci e singurul care ne atacă direct argumentul. Contra lui, argumentul rămâne costul și controlul, nu acuratețea.
Împărțind cele 200 de enunțuri după prezența cifrelor în referință:
| Enunțuri | n | WER normalizat | WER brut | Ce spune |
|---|---|---|---|---|
| fără cifre | 163 | 25,08% | 25,43% | normalizarea aproape nu contează |
| cu cifre | 37 | 30,37% | 36,94% | normalizarea ascunde 6,6 puncte |
Un enunț cu cifre e cu 5,3 puncte mai prost normalizat și cu 11,5 puncte mai prost brut. Exemple reale din rulare:
| Referință | Ce a ieșit |
|---|---|
| din 1988 urnele de vot… | Denomin ustie xopt, urnele de votre… |
| în 1537 paraguay… | în o mie cinu ste și șapte, Paraguay… |
| pușca sa m16 | ca să M Shaișpe |
| cele 25 de postere dunlap | Cele douăze și inci de postere Danop |
Orice normalizare care scrie numerele în litere înainte de scorare ne face să arătăm mai bine decât suntem la telefon. De aceea raportăm și brut. Pentru un agent care ia numere de telefon, ore, prețuri și date, partea cea mai importantă a limbii e și cea mai stricată. De ce contează normalizarea →
Fiecare segment are două capete observate, nu calculate — suma lor dă totalul cu abatere sub o jumătate de milisecundă.
Cei 1235 ms se compară cu 1260 ms, latența câștigătorului de la HumDial, ICASSP 2026 — singurul concurs unde full-duplexul se măsoară cu adevărat. Starea artei nu e 300 ms. Singura piesă care nu rulează local e și 69% din întârziere.
Măsurat pe conversații umane reale. Câștigul nu vine din a decide mai rar: decizia pe prozodie ia mai multe decizii decât pragul fix, și tot greșește mai puțin. Reperele publice pentru comparație: 9,9% tăieri false la 300 ms și 4,5% la 600 ms, la LiveKit v1.
Studiul explică cele cinci capcane de metodologie care fac tabelele publicate incomparabile — cu exemple din propriile noastre greșeli.