Chi sostiene che siamo arrivati al punto di massimo sviluppo dei modelli linguistici di grandi dimensioni dovrà ricredersi. Google ha da poco rilasciato Gemini 3 che fa segnare dei punteggi molto più elevati degli altri competitor su diversi benchmark: un record di 1501 su LMArena, il dominio su benchmark complessi come Humanity’s Last Exam (37.5%), Video-MMMU (87.6%), ARC-AGI-2 (31%). Ma come si comporta Gemini 3 nel mondo reale? Ho avuto modo di testare in anteprima questa versione perché faccio parte del programma di beta testing…
Leggi
Altre informazioni:
