Diferența dintre un sistem de transcriere și un agent vocal realtime nu e viteza. E ce se întâmplă în cele câteva sute de milisecunde cât omul încă vorbește — și ce poate face sistemul în timp ce vorbește el însuși.
Cuvintele apar pe măsură ce le rostești, nu după ce termini. Recunoașterea e în flux, cu stare păstrată între bucăți — nu retranscrie de fiecare dată.
92 ms până la textAscultă panta intonației, nu cronometrul de liniște. Coborâre fermă: ai încheiat. Plat sau urcare: mai ai ceva de spus.
560 ms · 17 puncte mai puține greșeliVorbești peste el și tace. Și ține minte exact cât ai auzit, nu cât a apucat să genereze.
oprire în 1–3 msSpune o punte scurtă, trimite treaba pe alt fir și continuă să vorbească. Rămâne întreruptibil cât timp unealta lucrează.
Fiecare agent cu vocea, limba, instrucțiunile, uneltele și baza lui de cunoștințe. Clienți izolați între ei, zeci de agenți pe același proces.
Închizi fila, cade rețeaua, repornește serverul — conversația continuă de unde a rămas. Uneltele își termină treaba și rezultatul te așteaptă.
Ultimele trei nu le are ChatGPT Live: aplicația n-are API public, durata unei sesiuni nu e publicată, și nu lucrează între vizitele tale. Inventarul complet al funcțiilor →
Toate sintetizate pe procesor, fără accelerator și fără niciun serviciu extern.
Comutarea se face în timpul conversației, fără reconectare — se schimbă recunoașterea, sinteza și instrucțiunile deodată, dar nu vocea.
Modelul de limbaj scrie cifre. Un om nu spune „două trei patru opt zero de lei". Înainte de sinteză, textul trece printr-o funcție care rescrie fiecare număr în litere — cu regula potrivită contextului: sumele ca numere, orele ca ore, telefoanele cifră cu cifră.
ce scrie modelul
Suma totală este de 23480 de lei, iar programul e de la 09:00 până la 22:00.
„Suma totală este de douăzeci și trei de mii patru sute optzeci de lei, iar programul e de la ora nouă până la ora douăzeci și două."
Ora nu se citește „zero nouă zero zero". Suma nu se citește cifră cu cifră. Aceeași funcție decide care regulă se aplică unde.
ce scrie modelul
Vă sun la 069123456 pe 15.09.2026, comanda nr. 4712.
„Vă sun la zero șase nouă unu doi trei patru cinci șase pe cincisprezece septembrie două mii douăzeci și șase, comanda nr. patru mii șapte sute doisprezece."
Numărul de telefon — cifră cu cifră, singura formă utilă la telefon. Data — în cuvinte. Numărul comenzii — ca număr întreg. Trei reguli diferite în aceeași frază.
„Îmi pare rău, în această înserare târzie nu găsesc nicio șansă."
ă, â, î, ș, ț în aceeași frază. În română diacritica schimbă cuvântul, nu aspectul lui: „țară" și „tara" sunt două lucruri diferite.
„Ați dori să vă sun înapoi mâine dimineață?"
Aceeași pantă a înălțimii pe care sistemul o citește ca să știe dacă ai terminat de vorbit, de data asta produsă.
Recunoașterea și sinteza rulează pe mașina ta. Spre exterior pleacă doar text — niciodată audio.
Unde vocea pacientului sau a clientului n-are voie să plece, asta nu e o preferință tehnică. E condiția de a putea folosi ceva.
Un furnizor de voci a fost cumpărat, platforma s-a închis, clonele clienților au fost șterse. Ce rulează la tine rămâne.
Piesele de audio nu se plătesc per minut. Singurul cost variabil rămâne modelul de limbaj.
Aproape toți agenții vocali decid că ai terminat după un număr fix de milisecunde de liniște. E un cronometru, nu un detector — și taie oamenii la mijlocul frazei. Grai se uită la panta înălțimii vocii pe ultima jumătate de secundă.
Măsurat pe conversații umane reale. La aceeași rată de greșeală ca un prag fix de 820 ms, decizia pe intonație așteaptă 560 ms — și ia mai multe decizii, deci câștigul nu vine din a decide mai rar.
Rată de eroare pe cuvânt, FLEURS română. Mai mic e mai bun. Coloana „cum" e partea care face tabelul citibil — un model care vede fișierul întreg, offline, în cloud, nu rezolvă aceeași problemă ca unul care scoate text în timp ce încă vorbești.
Cifra pe română e verificată de două ori: NVIDIA declară 25,90% pentru exact acest model, pe același test, la aceeași geometrie — noi am măsurat 26,31%, în același interval de încredere. Nu e testul stricat. E modelul care n-a fost antrenat pe română. Rusa, în același model și aceeași rulare, dă 9,30%. Toate cifrele, cu metodologia →
Fiecare afirmație despre alții e luată din documentația lor, nu dedusă. Unde nu publică o cifră, scrie „nepublicat" — nu punem o presupunere în locul ei.
| Criteriu | Grai | ChatGPT Live | Restul pieței |
|---|---|---|---|
| Română | da | da, dar româna nu e pe lista lor de fluență maximă; pentru limbile mai rare, fișa lor recunoaște lacune de accent și de fluență | 5 din 6 laboratoare mari nu o au deloc; fișa Google recunoaște că detecția limbii cade pe accente non-native |
| Audio pe serverul tău | da, integral | nu | doar on-premise scump, la doi furnizori |
| Disponibil ca API | în curând | aplicația nu are API; interfața lor Realtime e produs separat | da |
| Durata sesiunii | supraviețuiește reîncărcării, deconectării și repornirii de server | în aplicație nu e publicată; interfața Realtime taie la 60 de minute | un singur furnizor are reluare adevărată |
| Lucrează între vizite | da | nu | nimeni |
| Full-duplex nativ | nu — cascadat, cu întrerupere | da | majoritatea, cascadat |
| Acuratețe pe română | 26,31% măsurat | nepublicat | 3,0–5,28% declarat |
| Până la răspuns | 2667 ms măsurat | nepublicat | 1,26 s la vârful competiției |
| Cost la rulare | 0 | per minut | 0,40–1,20 $/oră |
E latența câștigătorului la HumDial, ICASSP 2026 — singurul concurs unde full-duplexul se măsoară cu adevărat, pe conversație, nu pe inferență izolată. Cifrele de „sub 300 ms" din comunicate măsoară altceva. Iar concursul acordă 80% din punctaj comportamentului și 20% vitezei — pentru că un agent rapid care taie omul la mijlocul frazei e mai rău decât unul lent care așteaptă.
Arhitectura completă: ce model face ce, unde se leagă, ce rulează local și ce nu.
Vezi arhitectura → FuncțiiTot ce face sistemul azi, cu cifra măsurată lângă fiecare. Și ce nu face încă.
Vezi lista → DoveziToate măsurătorile, cu geometria, eșantionul și intervalul de încredere.
Vezi cifrele → StudiuCinci capcane de metodologie, cu exemple din propriile noastre greșeli.
Citește studiul → ParcursTrei antrenări, sub 1.200 de dolari, în ordinea în care fiecare o ieftinește pe următoarea.
Vezi parcursul → VoceCe se poate azi, în cât timp, și care sunt obligațiile de licență și de date biometrice.
Vezi detaliile → ColaborareVorbire românească înregistrată, cu licență curată. Ce căutăm și ce oferim în schimb.
Vezi ce căutăm →Aceleași motoare, în spatele unei interfețe: agenți ca înregistrări, voce și limbă per agent, clienți izolați, widget de o linie. Deschidem accesul pe măsură ce antrenăm recunoașterea pe română.