OpenAI a anunțat lansarea GPT-Realtime-2 și a încă două modele vocale noi în API-ul său, într-o extindere care vizează aplicațiile ce folosesc audio live. Potrivit The Next Web, pachetul include un model orientat spre conversații în timp real, unul de traducere și o variantă de streaming a Whisper pentru transcriere.
Ce aduce GPT-Realtime-2
The Next Web scrie că GPT-Realtime-2 aduce raționament de nivel GPT-5 în interacțiuni vocale live. În practică, asta plasează modelul în zona aplicațiilor care au nevoie de răspunsuri rapide și de un flux conversațional potrivit pentru utilizare în timp real.
Publicația notează și că prețurile sunt suficient de agresive încât comparația cu alternativele de pe piață devine inevitabilă. OpenAI pare astfel să mizeze atât pe capabilități, cât și pe competitivitate comercială.
Traducere și transcriere în aceeași lansare
Pe lângă GPT-Realtime-2, OpenAI a lansat un model separat de traducere care acoperă peste 70 de limbi de intrare. Compania a introdus și o variantă de streaming a Whisper pentru transcriere, ceea ce lărgește opțiunile disponibile pentru scenarii audio diferite.
Prin această actualizare, OpenAI extinde numărul de suprafețe în care dezvoltatorii pot conecta capabilități de tip GPT la audio live. Pentru echipele care construiesc produse vocale, lansarea oferă opțiuni distincte pentru conversație, traducere și transcriere, în funcție de nevoie.
Ce înseamnă pentru dezvoltatori
Anunțul sugerează că OpenAI continuă să împingă tehnologia vocală dincolo de dictare sau redare de răspunsuri, către fluxuri conversaționale mai complexe. Pentru dezvoltatori, următorul pas este compararea capabilităților și a costurilor acestor modele cu soluțiile deja existente pe piață.
Ca reper practic, merită verificată separat compatibilitatea fiecărui model cu scenariul dorit: conversație live, traducere sau transcriere. Asta poate ajuta la alegerea modelului potrivit înainte de integrarea în produs.























