Google încearcă să facă modelele sale locale Gemma 4 mai rapide, printr-o tehnică numită Multi-Token Prediction (MTP). Potrivit Ars Technica, noile drafters experimentale pentru Gemma folosesc o formă de speculative decoding, adică încearcă să anticipeze tokeni viitori pentru a accelera generarea de răspunsuri.
Ce aduce nou MTP pentru Gemma 4
Gemma 4 a fost lansată în această primăvară ca o familie de modele open, prezentată de Google ca o opțiune mai puternică pentru rularea locală. Modelele sunt construite pe aceeași tehnologie de bază care stă la baza Gemini, dar sunt ajustate pentru a funcționa pe hardware local, nu doar în infrastructura cloud a companiei.
Ars Technica notează că Google spune despre aceste modele experimentale că pot oferi o accelerare de până la 3x în anumite scenarii. Ideea este simplă: în loc ca modelul să genereze fiecare token pas cu pas, MTP încearcă să ghicească mai multe tokeni dinainte, reducând timpul necesar pentru răspuns.
De ce contează pentru rularea locală
Google a poziționat Gemma ca o familie de modele pentru utilizatori care vor să experimenteze cu AI pe propriul hardware, fără să trimită toate datele către un serviciu cloud. Totuși, există limite clare impuse de echipamentele pe care majoritatea oamenilor le au la dispoziție. Tocmai aici intervine MTP, ca o metodă de a compensa parțial constrângerile de viteză ale hardware-ului local.
Compania a mai spus că un singur accelerator AI de mare putere poate rula cel mai mare model Gemma 4 la precizie completă, iar cuantizarea ar permite rularea lui pe un GPU de consum. În același timp, Gemini este optimizat pentru TPU-urile personalizate ale Google, care funcționează în clustere mari, cu interconectări și memorie foarte rapide.
Licență mai permisivă pentru Gemma 4
Un alt element relevant este schimbarea de licență. Google a trecut Gemma 4 la Apache 2.0, o licență mai permisivă decât licența personalizată folosită la versiunile anterioare. Pentru dezvoltatori, asta poate face modelele mai ușor de integrat și testat în proiecte proprii, deși articolul citat se concentrează în principal pe impactul asupra performanței.
Ce urmează
Deocamdată, drafters MTP sunt descriși ca experimentali, iar Google nu a prezentat aceste modele ca pe o schimbare finală pentru toate implementările Gemma. Pentru utilizatorii interesați de AI local, însă, mesajul este clar: compania caută metode prin care modelele să răspundă mai repede, fără a depinde exclusiv de infrastructura cloud.
Pe scurt: Gemma 4 primește un posibil avantaj de viteză prin predicția mai multor tokeni în avans, o abordare care ar putea face AI-ul local mai practic pe hardware obișnuit.























