Notizia
Nessuna prova che i grandi lab favoleggino pellicani in bici
Un'analisi su sette modelli di generazione immagini non trova segnali che i lab siano ottimizzati per disegnare pellicani su biciclette [S1].
Nessuna prova che i grandi lab favoleggino pellicani in bici
Dylan Castillo ha testato sette modelli su 48 prompt e non ha trovato prove di “pelicanmaxxing”, l’ipotesi che i lab addestrino di proposito i sistemi a disegnare pellicani su biciclette meglio del resto [S1].
Dettagli del test: 8 animali × 6 veicoli = 48 prompt; tre esecuzioni per prompt per ciascun modello; assistenza alla valutazione con due modelli. I modelli in prova sono GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 e DeepSeek V4 Pro. Per la valutazione, Castillo usa GPT-5.6 Luna e Gemini 3.1 Flash-Lite. Simon Willison segnala e sintetizza il lavoro nel suo link blog del 22 luglio 2026, definendolo “excellent”, e rimanda a una vista con filtri per esplorare i risultati [S1].
Verdetto, per i modelli testati:
- nessun segnale che i pellicani su biciclette escano meglio delle alternative;
- nessun vantaggio specifico su pellicani;
- nessun vantaggio specifico su biciclette;
- nessun vantaggio sulla combinazione pellicano+bicicletta anche correggendo per la difficoltà;
- nessun indizio di memorizzazione delle scene pellicano-bicicletta [S1].
Willison inserisce il lavoro nel solco di un suo esercizio precedente: un benchmark “deeply unscientific” su pellicani in bici. La domanda è se i lab abbiano orientato l’addestramento per brillare su quel motivo. I risultati raccolti da Castillo, limitati ai modelli e alle combinazioni messi alla prova, non sostengono l’ipotesi [S1].
C’è un altro tassello di contesto. Willison racconta di aver fatto controlli a campione su varianti del tema, con altri animali e veicoli, ma senza la sistematicità del test di Castillo. Qui la griglia è definita, le esecuzioni sono replicate, la valutazione riceve supporto da due modelli separati [S1].
Il link blog offre inoltre un accesso ordinato ai materiali: i lettori possono filtrare per modello, animale e veicolo e verificare i casi direttamente. Le immagini generate accompagnano le sintesi, così da confrontare in modo immediato gli esiti fra modelli [S1].
Chiusura necessaria sulle limitazioni: il test copre solo i sette modelli elencati, la griglia di 48 prompt e le tre repliche per prompt; oltre questo perimetro, il post non trae conclusioni [S1].