Venerdì 24 luglio 2026
L’edizione di oggi
Millebit
AI · Software · QA
Il segnale, non il rumore.

Notizia

Nessuna prova che i grandi lab favoleggino pellicani in bici

Un'analisi su sette modelli di generazione immagini non trova segnali che i lab siano ottimizzati per disegnare pellicani su biciclette [S1].

Nessuna prova che i grandi lab favoleggino pellicani in bici

Nessuna prova che i grandi lab favoleggino pellicani in bici

Dylan Castillo ha testato sette modelli su 48 prompt e non ha trovato prove di “pelicanmaxxing”, l’ipotesi che i lab addestrino di proposito i sistemi a disegnare pellicani su biciclette meglio del resto [S1].

Dettagli del test: 8 animali × 6 veicoli = 48 prompt; tre esecuzioni per prompt per ciascun modello; assistenza alla valutazione con due modelli. I modelli in prova sono GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 e DeepSeek V4 Pro. Per la valutazione, Castillo usa GPT-5.6 Luna e Gemini 3.1 Flash-Lite. Simon Willison segnala e sintetizza il lavoro nel suo link blog del 22 luglio 2026, definendolo “excellent”, e rimanda a una vista con filtri per esplorare i risultati [S1].

Verdetto, per i modelli testati:

  • nessun segnale che i pellicani su biciclette escano meglio delle alternative;
  • nessun vantaggio specifico su pellicani;
  • nessun vantaggio specifico su biciclette;
  • nessun vantaggio sulla combinazione pellicano+bicicletta anche correggendo per la difficoltà;
  • nessun indizio di memorizzazione delle scene pellicano-bicicletta [S1].

Willison inserisce il lavoro nel solco di un suo esercizio precedente: un benchmark “deeply unscientific” su pellicani in bici. La domanda è se i lab abbiano orientato l’addestramento per brillare su quel motivo. I risultati raccolti da Castillo, limitati ai modelli e alle combinazioni messi alla prova, non sostengono l’ipotesi [S1].

C’è un altro tassello di contesto. Willison racconta di aver fatto controlli a campione su varianti del tema, con altri animali e veicoli, ma senza la sistematicità del test di Castillo. Qui la griglia è definita, le esecuzioni sono replicate, la valutazione riceve supporto da due modelli separati [S1].

Il link blog offre inoltre un accesso ordinato ai materiali: i lettori possono filtrare per modello, animale e veicolo e verificare i casi direttamente. Le immagini generate accompagnano le sintesi, così da confrontare in modo immediato gli esiti fra modelli [S1].

Chiusura necessaria sulle limitazioni: il test copre solo i sette modelli elencati, la griglia di 48 prompt e le tre repliche per prompt; oltre questo perimetro, il post non trae conclusioni [S1].