ChatGPT Images 2.5 shows high-fidelity output but struggles with dense Waldo scenes
Early Waldo Bench results for ChatGPT Images 2.5 indicate generally high-fidelity image generation. Waldo was found in one image, while some text remained highly detailed when enlarged; however, faces became garbled under strong zoom.
The beach scene was judged too easy and not dense enough for a full Waldo test—about one-quarter of a “real Waldo” scene. The assessment described the result as possibly state of the art, but not “super intelligence” for generating Waldo scenes.
The analysis suggested that modern AI may eventually solve Waldo Bench, potentially by pairing the system with Astra, tiling, and adding more reasoning. This was an informal assessment without quantitative metrics.
ChatGPT Images 2.5 генерирует детализированные изображения, но испытывает трудности с насыщенными сценами «Где Уолли?»
Первые результаты Waldo Bench для ChatGPT Images 2.5 указывают на в целом высокую точность генерации изображений. На одной из картинок Уолли удалось найти; при увеличении отдельный текст оставался очень детализированным, однако лица при сильном масштабировании начинали искажаться.
Сцену на пляже сочли слишком простой и недостаточно насыщенной для полноценного теста Waldo — примерно одной четвертью «настоящей» сцены с Уолли. Результат оценили как, возможно, соответствующий передовому уровню, но не как «сверхинтеллект» для генерации сцен Waldo.
В анализе предположили, что современный ИИ в итоге сможет решить задачу Waldo Bench — потенциально при сочетании системы с Astra, разбиении изображения на фрагменты и добавлении большего объёма рассуждений. Оценка была неформальной и не содержала количественных метрик.
