Практически все, даже лучшие модели искусственного интеллекта, оказались практически безнадежны, согласно эксперименту, который ставит под сомнение идею массовой замены офисных работников искусственным интеллектом.
Индекс удаленного труда — это новый показатель, разработанный исследователями из компании Scale AI и некоммерческой организации «Центра безопасности ИИ» (CAIS), оценивает способность передовых моделей искусственного интеллекта автоматизировать экономически значимую работу.
Исследователи предложили нескольким ведущим специалистам по ИИ выполнить ряд имитационных внештатных работ и обнаружили, что даже лучшие из них могут выполнить даже 3 процентов работы, заработав 1810 долларов из возможных 143 991 при выполнении Фриланс задач. Исследователи изучили несколько инструментов и пришли к выводу, что наиболее эффективным является Manus из одноименного китайского стартапа, за которым следуют Grok из xAI, Claude из Anthropic, ChatGPT из OpenAI и Gemini из Google.
"Я надеюсь, что это даст гораздо более точное представление о том, что происходит с возможностями искусственного интеллекта" — говорит Дэн Хендрикс, директор CAIS. Он добавляет, что, хотя за последний год или около того некоторые агенты значительно улучшились, это не означает, что так будет продолжаться и дальше.
Впечатляющие достижения в области ИИ привели к предположениям о том, что ИИ вскоре превзойдет человеческий интеллект и заменит огромное количество работников. В марте Дарио Амодей, генеральный директор Anthropic, предположил, что 90 процентов работы по кодированию будет автоматизировано в течение нескольких месяцев.
Предыдущие волны внедрения ИИ привели к ошибочным прогнозам о смене рабочих мест, например, о скорой замене врачей-рентгенологов алгоритмами ИИ.
Исследователи разработали ряд внештатных заданий с помощью проверенных сотрудников Upwork. Задания охватывают широкий спектр работ, включая графический дизайн, редактирование видео, разработку игр и административные хлопоты, такие как обработка данных. Они объединили описание каждой работы с каталогом файлов, необходимых для выполнения работы, и примером готового проекта, созданного человеком.
Хендрикс говорит, что, хотя в последние годы модели ИИ стали лучше справляться с программированием, математикой и логическими рассуждениями, им по-прежнему сложно использовать различные инструменты и выполнять сложные задачи, которые включают в себя множество шагов. "У них нет долговременной памяти, и они не могут постоянно учиться на собственном опыте. Они не могут приобрести навыки на работе, как люди" — сказал Дэн Хендрикс.
Этот анализ представляет собой контрапункт к показателю экономической эффективности, предложенному в сентябре OpenAI под названием GDPval, который предназначен для измерения экономически ценной работы. По данным GDPval, передовые модели искусственного интеллекта, такие как GPT-5, приближаются к человеческим возможностям в решении 220 задач в различных офисах. В компании OpenAI не предоставили комментариев.



