Il nuovo modello 'o1' di OpenAI ottiene un punteggio di 120 al test QI del Norway Mensa, superando di gran lunga la media umana e gli altri modelli AI.
Il nuovo modello "o1" di OpenAI potrebbe avere un QI pari a 120. L'affermazione deriva da un articolo del blog americano Maximum Truth, che ha testato le funzionalità del modello: secondo il test, "o1" supera tutte le altre intelligenze artificiali nel test di QI del Norway Mensa, arrivando a un punteggio di 120.
Il modello "o1" ha risposto correttamente a 25 su 35 domande del test, superando di gran lunga la media umana, che si attesta intorno ai 100 punti. Su domande di ragionamento basate su pattern visivi, o1 è stato in grado non solo di rispondere, ma anche di motivare la propria scelta scomponendo la logica della griglia.
Non è infallibile
"o1" non è perfetto: in alcune domande riesce a vedere solo la parte additiva di un pattern e non individua la parte relativa alla rimozione delle linee comuni, sbagliando la risposta. Resta comunque un risultato notevole rispetto agli altri modelli.
Il punteggio non dipende dall'addestramento specifico
Una preoccupazione comune è che alcune AI siano state addestrate sulle stesse domande del test. Per verificarlo, è stato creato un nuovo quiz con domande inedite, scritte anche da un membro del Mensa, poi eliminato per evitare che finisse online. Su questo test creato da zero le AI hanno ottenuto risultati peggiori, ma la differenza tra "o1" e gli altri modelli è rimasta notevole, suggerendo che o1 rappresenta un vero miglioramento nella capacità di ragionamento e non solo la memorizzazione di dati specifici.
Servono ulteriori ricerche
Poiché la visione delle AI non è ancora abbastanza sviluppata, una delle ragioni dei risultati relativamente scarsi sul nuovo test potrebbe essere legata al modo in cui le domande sono descritte verbalmente. Ulteriori ricerche potrebbero testare diverse formulazioni e stabilire con più precisione dove si collochi la media umana su questi quiz.
- 'o1' raggiunge un QI di 120 al test del Norway Mensa
- 25 risposte corrette su 35, sopra la media umana
- Non infallibile: sbaglia alcuni pattern complessi
- Un vero salto nel ragionamento, non semplice memorizzazione



