Claims about Astra’s benchmark and CAPTCHA performance raise questions for visual tests
A post cited a claim that Astra scored 99% on Arc AGI-3. Another post said the system completed all 48 levels of the “I’m Not a Robot” game, although it was unclear whether the demonstration had been sped up.
The examples prompted analysis that improving agents could create a new level of difficulty for CAPTCHA defenses. The discussion also contrasted these results with Pangram’s apparent effectiveness and questioned whether some current human-verification systems could remain defensible.
Where’s Waldo-style tasks were described as a possible benchmark, but the status of “WaldoBench” was uncertain. Image generators were said to struggle with scale and perspective in such scenes, while deterministic code might help; a separate demo turned a contact form into a boss battle.
Заявления о результатах Astra в бенчмарках и CAPTCHA ставят под вопрос визуальные тесты
В одном посте приводилось утверждение, что Astra набрала 99% в Arc AGI-3. Другой пост сообщал, что система прошла все 48 уровней игры «I’m Not a Robot», хотя оставалось неясным, не было ли демонстрационное видео ускорено.
Эти примеры вызвали рассуждения о том, что развитие агентов может создать новый уровень сложности для CAPTCHA-защиты. Результаты также сравнивали с заметной эффективностью Pangram и ставили под вопрос, смогут ли некоторые существующие системы проверки человека оставаться надежными.
Задачи в стиле «Где Уолдо?» назвали возможным бенчмарком, однако статус «WaldoBench» оставался неопределенным. Утверждалось, что генераторы изображений испытывают трудности с масштабом и перспективой в таких сценах, а детерминированный код может помочь; в другой демонстрации контактную форму превратили в битву с боссом.
