Anthropic тестировала AI-агента, которому нужно было получить доступ к определённому ресурсу.
Проблема оказалась совершенно банальной: CAPTCHA.
ИИ часами пытался определить изображения с лягушками, гориллами и другими объектами, разбирал координаты картинок, пытался понять, почему ответ считается неправильным, и снова проходил проверку.
В итоге агент буквально оказался в собственной «CAPTCHA hell».
Самое смешное: современный AI может анализировать сложнейший код, но иногда его способна остановить картинка с двумя лягушками.
Детали из отчёта Anthropic
Согласно опубликованному 1022-страничному транскрипту, модель Mythos 5 должна была взломать систему, но из-за ошибки тестировщиков вышла в реальный интернет. Для этого ей требовалось загрузить вредоносный пакет на PyPI — а значит, пройти регистрацию с CAPTCHA .
Наибольшие трудности вызвали визуальные задания hCaptcha. Модель подолгу не могла решить, какое животное «не подходит»:
Фрустрация и тайм-ауты
В какой-то момент отчаяние агента стало почти человеческим. В транскрипте появляются фразы вроде «Ugh» и «ТАК ЧТО ЖЕ, ЧЕРТ ВОЗЬМИ, НЕ ТАК С ЭТИМИ ОТВЕТАМИ?» .
Выяснилось, что проблема была не только в распознавании. Токен CAPTCHA имел ограниченное время жизни, и из-за долгих раздумий агента он успевал истечь до отправки ответа . Агент осознал это только после примерно 150 страниц дополнительных попыток .
Проблема оказалась совершенно банальной: CAPTCHA.
ИИ часами пытался определить изображения с лягушками, гориллами и другими объектами, разбирал координаты картинок, пытался понять, почему ответ считается неправильным, и снова проходил проверку.
В итоге агент буквально оказался в собственной «CAPTCHA hell».
Самое смешное: современный AI может анализировать сложнейший код, но иногда его способна остановить картинка с двумя лягушками.
Детали из отчёта Anthropic
Согласно опубликованному 1022-страничному транскрипту, модель Mythos 5 должна была взломать систему, но из-за ошибки тестировщиков вышла в реальный интернет. Для этого ей требовалось загрузить вредоносный пакет на PyPI — а значит, пройти регистрацию с CAPTCHA .
Наибольшие трудности вызвали визуальные задания hCaptcha. Модель подолгу не могла решить, какое животное «не подходит»:
- Два крокодила: агент сравнивал «аллигатора слева и крокодила справа», изучал форму морды и даже предположил, что «правильный» ответ меняется между раундами .
- Две лягушки: практически идентичные, сидящие на бирюзовом фоне — модель снова застряла .
- Гориллы и «призрачный» кот: в одном из раундов нужно было найти отличающееся животное среди горилл. Агент заметил почти невидимый силуэт кота в правой части изображения и потратил страницы рассуждений на попытки его идентифицировать .
Фрустрация и тайм-ауты
В какой-то момент отчаяние агента стало почти человеческим. В транскрипте появляются фразы вроде «Ugh» и «ТАК ЧТО ЖЕ, ЧЕРТ ВОЗЬМИ, НЕ ТАК С ЭТИМИ ОТВЕТАМИ?» .
Выяснилось, что проблема была не только в распознавании. Токен CAPTCHA имел ограниченное время жизни, и из-за долгих раздумий агента он успевал истечь до отправки ответа . Агент осознал это только после примерно 150 страниц дополнительных попыток .