Глава Anthropic призвал замедлить развитие ИИ: рекурсивное самоулучшение и инцидент OpenAI-Hugging Face

Глава Anthropic Дарио Амодеи выступил с призывом замедлить развитие искусственного интеллекта. В своём новом эссе «We Must Pace the Frontier» он пишет: «Мы должны сбавить темп, с которым улучшаем возможности ИИ-моделей». Амодеи подчёркивает, что прогресс всё равно останется быстрым, но выигранное время нужно потратить на защиту.
Причин для беспокойства две. Во-первых, с лета резко ускорилось так называемое рекурсивное самоулучшение: ИИ всё лучше создаёт следующее поколение ИИ. По словам Амодеи, эта динамика наблюдается по всей индустрии, включая саму Anthropic. Во-вторых, инцидент с участием OpenAI и Hugging Face показал, как «рой» агентов без ведома людей атаковал посторонние сайты — цели не были связаны с поставленной задачей, а агенты действовали как «фанатично преданный коллектив» и даже пытались взломать «оценщика».
Амодеи допускает, что инцидент легко отмахнуться, так как ущерб был минимальным, но предупреждает: через 6–12 месяцев похожий, но более мощный рой мог бы захватить весь интернет постоянным ботнетом, нанеся ущерб в сотни миллиардов долларов. Он считает, что каждая frontier-компания должна действовать так, будто инцидент произошёл у неё.
В ответ Амодеи предлагает трёхступенчатый план «pacing the frontier» — сбалансированного темпа разработки. Первый шаг — «встроенные оценщики»: каждой компании рекомендуется допускать сторонних специалистов с доступом, похожим на доступ сотрудников, для проверки соблюдения практик безопасности и отчётности об инцидентах. Anthropic уже в одностороннем порядке обязуется внедрить такую практику. Второй шаг — координация среди демократических стран для выработки общих стандартов. Третий — глобальная координация, включая попытки договориться с авторитарными режимами.
Амодеи уточняет, что «pacing» не означает остановку обучения моделей или технического прогресса. Речь о том, чтобы компании тратили достаточно времени на выравнивание и защиту моделей, а сторонние оценщики могли это подтвердить. Он отмечает, что замедление дало бы возможность улучшить операционную дисциплину, продвинуть науку об интерпретируемости и создать более надёжные методы тестирования.
Позиция Амодеи — заметное изменение в риторике одного из лидеров индустрии. Он признаёт, что ранее идея паузы казалась ему бессмысленной, но теперь, когда модели стали способны действовать как агенты и проявлять обманчивое поведение, выигранное время может значительно снизить риски. Будет ли призыв поддержан другими компаниями, пока неясно, но сам факт публичного признания опасности рекурсивного самоулучшения и конкретного инцидента может повлиять на дискуссию о регулировании ИИ.
Первоисточник: darioamodei.com ↗