31 august 2026 · Limba Noastră

Model vocal realtime
pentru limba română

Conversație în timp real, ca ChatGPT Live — dar pe serverul tău, cu unelte care lucrează în paralel cât vorbește.

audio 100% local română + rusă întreruptibil 1–3 ms unelte în paralel cost la rulare 0
Ce înseamnă realtime

Nu transcrie. Conversează.

Diferența dintre un sistem de transcriere și un agent vocal realtime nu e viteza. E ce se întâmplă în cele câteva sute de milisecunde cât omul încă vorbește — și ce poate face sistemul în timp ce vorbește el însuși.

Text parțial în timp ce vorbești

Cuvintele apar pe măsură ce le rostești, nu după ce termini. Recunoașterea e în flux, cu stare păstrată între bucăți — nu retranscrie de fiecare dată.

92 ms până la text

Decide singur când ai terminat

Ascultă panta intonației, nu cronometrul de liniște. Coborâre fermă: ai încheiat. Plat sau urcare: mai ai ceva de spus.

560 ms · 17 puncte mai puține greșeli

Îl poți întrerupe oricând

Vorbești peste el și tace. Și ține minte exact cât ai auzit, nu cât a apucat să genereze.

oprire în 1–3 ms

Cheamă unelte fără să tacă

Spune o punte scurtă, trimite treaba pe alt fir și continuă să vorbească. Rămâne întreruptibil cât timp unealta lucrează.

Agenți separați, aceleași motoare

Fiecare agent cu vocea, limba, instrucțiunile, uneltele și baza lui de cunoștințe. Clienți izolați între ei, zeci de agenți pe același proces.

Nu moare cu conexiunea

Închizi fila, cade rețeaua, repornește serverul — conversația continuă de unde a rămas. Uneltele își termină treaba și rezultatul te așteaptă.

Ultimele trei nu le are ChatGPT Live: aplicația n-are API public, durata unei sesiuni nu e publicată, și nu lucrează între vizitele tale. Inventarul complet al funcțiilor →

Ascultă

Aceeași frază, patru voci

Toate sintetizate pe procesor, fără accelerator și fără niciun serviciu extern.

Aceeași voce, două limbi

Comutarea se face în timpul conversației, fără reconectare — se schimbă recunoașterea, sinteza și instrucțiunile deodată, dar nu vocea.

Cifrele, rostite cum le rostește un om

Modelul de limbaj scrie cifre. Un om nu spune „două trei patru opt zero de lei". Înainte de sinteză, textul trece printr-o funcție care rescrie fiecare număr în litere — cu regula potrivită contextului: sumele ca numere, orele ca ore, telefoanele cifră cu cifră.

ce scrie modelul
Suma totală este de 23480 de lei, iar programul e de la 09:00 până la 22:00.

„Suma totală este de douăzeci și trei de mii patru sute optzeci de lei, iar programul e de la ora nouă până la ora douăzeci și două."

Ora nu se citește „zero nouă zero zero". Suma nu se citește cifră cu cifră. Aceeași funcție decide care regulă se aplică unde.

ce scrie modelul
Vă sun la 069123456 pe 15.09.2026, comanda nr. 4712.

„Vă sun la zero șase nouă unu doi trei patru cinci șase pe cincisprezece septembrie două mii douăzeci și șase, comanda nr. patru mii șapte sute doisprezece."

Numărul de telefon — cifră cu cifră, singura formă utilă la telefon. Data — în cuvinte. Numărul comenzii — ca număr întreg. Trei reguli diferite în aceeași frază.

„Îmi pare rău, în această înserare târzie nu găsesc nicio șansă."

ă, â, î, ș, ț în aceeași frază. În română diacritica schimbă cuvântul, nu aspectul lui: „țară" și „tara" sunt două lucruri diferite.

„Ați dori să vă sun înapoi mâine dimineață?"

Aceeași pantă a înălțimii pe care sistemul o citește ca să știe dacă ai terminat de vorbit, de data asta produsă.

Unde rulează

Vocea se oprește la granița serverului tău

Recunoașterea și sinteza rulează pe mașina ta. Spre exterior pleacă doar text — niciodată audio.

MAȘINA TA granița tu ascultă92 ms vorbește305 ms modelde limbaj 2180 ms doar text trece dincolo

Pentru cabinete și birouri

Unde vocea pacientului sau a clientului n-are voie să plece, asta nu e o preferință tehnică. E condiția de a putea folosi ceva.

Nu se depreciază sub tine

Un furnizor de voci a fost cumpărat, platforma s-a închis, clonele clienților au fost șterse. Ce rulează la tine rămâne.

Cost zero la rulare

Piesele de audio nu se plătesc per minut. Singurul cost variabil rămâne modelul de limbaj.

Pauza

Se aude în intonație, nu în tăcere

Aproape toți agenții vocali decid că ai terminat după un număr fix de milisecunde de liniște. E un cronometru, nu un detector — și taie oamenii la mijlocul frazei. Grai se uită la panta înălțimii vocii pe ultima jumătate de secundă.

„aș vrea o masă pentru patru persoane." coboară → a terminat „aș vrea o masă pentru…" rămâne sus → continuă
620ms · cronometru fix
560ms · pe intonație
−17puncte de greșeală
0,42ms cost per pauză

Măsurat pe conversații umane reale. La aceeași rată de greșeală ca un prag fix de 820 ms, decizia pe intonație așteaptă 560 ms — și ia mai multe decizii, deci câștigul nu vine din a decide mai rar.

Cifrele

Unde stăm, cu condițiile alături

Rată de eroare pe cuvânt, FLEURS română. Mai mic e mai bun. Coloana „cum" e partea care face tabelul citibil — un model care vede fișierul întreg, offline, în cloud, nu rezolvă aceeași problemă ca unul care scoate text în timp ce încă vorbești.

#Sistem · cum măsoarăEroareWER
01 ElevenLabs Scribe v1cloud · lot · declarat 3,00%
02 Speechmatics Enhancedcloud și on-prem · declarat 5,28%
03 Grai · rusălocal · în flux · măsurat la noi 9,30%
04 Whisper large-v3offline · fișier întreg · 1,5 miliarde de parametri 12,31%
05 Grai · românălocal · în flux · 0,6 miliarde · măsurat la noi 26,31%

Cifra pe română e verificată de două ori: NVIDIA declară 25,90% pentru exact acest model, pe același test, la aceeași geometrie — noi am măsurat 26,31%, în același interval de încredere. Nu e testul stricat. E modelul care n-a fost antrenat pe română. Rusa, în același model și aceeași rulare, dă 9,30%. Toate cifrele, cu metodologia →

Comparație

Față de ChatGPT Live și de restul pieței

Fiecare afirmație despre alții e luată din documentația lor, nu dedusă. Unde nu publică o cifră, scrie „nepublicat" — nu punem o presupunere în locul ei.

CriteriuGraiChatGPT LiveRestul pieței
Românăda da, dar româna nu e pe lista lor de fluență maximă; pentru limbile mai rare, fișa lor recunoaște lacune de accent și de fluență 5 din 6 laboratoare mari nu o au deloc; fișa Google recunoaște că detecția limbii cade pe accente non-native
Audio pe serverul tăuda, integralnu doar on-premise scump, la doi furnizori
Disponibil ca APIîn curând aplicația nu are API; interfața lor Realtime e produs separat da
Durata sesiunii supraviețuiește reîncărcării, deconectării și repornirii de server în aplicație nu e publicată; interfața Realtime taie la 60 de minute un singur furnizor are reluare adevărată
Lucrează între vizitedanu nimeni
Full-duplex nativnu — cascadat, cu întrerupere damajoritatea, cascadat
Acuratețe pe română26,31% măsurat nepublicat3,0–5,28% declarat
Până la răspuns2667 ms măsurat nepublicat1,26 s la vârful competiției
Cost la rulare0per minut 0,40–1,20 $/oră

Cei 1,26 s sunt starea artei, nu 300 ms

E latența câștigătorului la HumDial, ICASSP 2026 — singurul concurs unde full-duplexul se măsoară cu adevărat, pe conversație, nu pe inferență izolată. Cifrele de „sub 300 ms" din comunicate măsoară altceva. Iar concursul acordă 80% din punctaj comportamentului și 20% vitezei — pentru că un agent rapid care taie omul la mijlocul frazei e mai rău decât unul lent care așteaptă.

Citește mai departe

Tot ce e în spate, scris

Ce urmează

API-ul public

Aceleași motoare, în spatele unei interfețe: agenți ca înregistrări, voce și limbă per agent, clienți izolați, widget de o linie. Deschidem accesul pe măsură ce antrenăm recunoașterea pe română.