Пятница, 11 сентября, 2026
Google search engine

Большинство моделей ИИ оказались ужасными работниками

Практически все, даже лучшие модели искусственного интеллекта, оказались практически безнадежны, согласно эксперименту, который ставит под сомнение идею массовой замены офисных работников искусственным интеллектом.

Индекс удаленного труда — это новый показатель, разработанный исследователями из компании Scale AI и некоммерческой организации «Центра безопасности ИИ» (CAIS), оценивает способность передовых моделей искусственного интеллекта автоматизировать экономически значимую работу.

Исследователи предложили нескольким ведущим специалистам по ИИ выполнить ряд имитационных внештатных работ и обнаружили, что даже лучшие из них могут выполнить даже 3 процентов работы, заработав 1810 долларов из возможных 143 991 при выполнении Фриланс задач. Исследователи изучили несколько инструментов и пришли к выводу, что наиболее эффективным является Manus из одноименного китайского стартапа, за которым следуют Grok из xAI, Claude из Anthropic, ChatGPT из OpenAI и Gemini из Google.

"Я надеюсь, что это даст гораздо более точное представление о том, что происходит с возможностями искусственного интеллекта" — говорит Дэн Хендрикс, директор CAIS. Он добавляет, что, хотя за последний год или около того некоторые агенты значительно улучшились, это не означает, что так будет продолжаться и дальше.

Впечатляющие достижения в области ИИ привели к предположениям о том, что ИИ вскоре превзойдет человеческий интеллект и заменит огромное количество работников. В марте Дарио Амодей, генеральный директор Anthropic, предположил, что 90 процентов работы по кодированию будет автоматизировано в течение нескольких месяцев.

Предыдущие волны внедрения ИИ привели к ошибочным прогнозам о смене рабочих мест, например, о скорой замене врачей-рентгенологов алгоритмами ИИ.

Исследователи разработали ряд внештатных заданий с помощью проверенных сотрудников Upwork. Задания охватывают широкий спектр работ, включая графический дизайн, редактирование видео, разработку игр и административные хлопоты, такие как обработка данных. Они объединили описание каждой работы с каталогом файлов, необходимых для выполнения работы, и примером готового проекта, созданного человеком.

Хендрикс говорит, что, хотя в последние годы модели ИИ стали лучше справляться с программированием, математикой и логическими рассуждениями, им по-прежнему сложно использовать различные инструменты и выполнять сложные задачи, которые включают в себя множество шагов. "У них нет долговременной памяти, и они не могут постоянно учиться на собственном опыте. Они не могут приобрести навыки на работе, как люди" — сказал Дэн Хендрикс.

Этот анализ представляет собой контрапункт к показателю экономической эффективности, предложенному в сентябре OpenAI под названием GDPval, который предназначен для измерения экономически ценной работы. По данным GDPval, передовые модели искусственного интеллекта, такие как GPT-5, приближаются к человеческим возможностям в решении 220 задач в различных офисах. В компании OpenAI не предоставили комментариев.

ИсточникWired.com
Похожие публикации

Оценки читателей (0)

Оценок еще не было.

Оцените публикацию

Оцените публикацию

- Реклама -
Google search engine

Еще в категории