Представьте, что вы наняли талантливого инженера. Он стал работать быстрее, затем написал себе инструменты, потом начал помогать создавать следующее поколение инженеров. Каждый новый сотрудник сильнее предыдущего. В какой момент вы перестанете понимать, достаточно ли хорошо проверяете их работу?

Это мысленный эксперимент, но вопрос уже вполне практический. Он возникает, когда искусственный интеллект становится участником разработки самого искусственного интеллекта. Рост производительности здесь способен менять не только скорость выполнения задач, но и скорость появления новых возможностей.

Что говорит новое эссе

6 сентября 2026 года главный научный сотрудник OpenAI Якуб Пахоцкий опубликовал An Alien Mind — «Чужой разум». Он ожидает движения к рекурсивному самоулучшению, ссылаясь на внутренние результаты. Различает следование заданной цели и устойчивость человеческих ценностей в незнакомых условиях. Предупреждает об ослаблении наблюдения за рассуждениями. По его оценке, ни одна лаборатория пока не обеспечила достаточных оснований для долгого продолжения гонки на максимальной скорости; нужны общие требования безопасности и готовность замедляться. Это позиция автора, а не независимое доказательство наступления сверхразума. [1]

Ниже — наш разбор этой постановки вопроса с опорой на отдельные исследования и документы. Нас интересует проверяемая граница: какие новые обстоятельства действительно требуют пересмотра прежних ожиданий?

Четвёртый участник спора о будущем

В статье «Кому достанется будущее: Гейтс, Маск и Альтман об ИИ» мы сравнивали три разных взгляда. Новое эссе добавляет к ним исследовательский вопрос о сохранении контроля. Для удобства сведём акценты вместе; это наша интерпретация, а не цитаты авторов.

Четыре оптики: что считать главным ограничением
Автор / материал Основной вопрос Предмет внимания
ГейтсКак люди переживут переход?Работа, неравенство, общественные институты
Маск / план TeslaКак превратить ИИ в материальное изобилие?Энергия, производство, транспорт, роботы
АльтманКак общество освоит ускоряющийся прогресс?Доступность интеллекта и новые открытия
ПахоцкийКак сохранить контроль?Проверка всё более сильных систем

Гейтс рассматривает потерю контроля среди рисков, поэтому записывать его исключительно в экономисты было бы несправедливо. Но особенно подробно он обсуждает занятость и институты. Важное различие: реалистичную глобальную паузу он готов был бы поддержать, однако сомневается в её осуществимости из-за конкуренции. [2]

В Master Plan Part IV Tesla делает ставку на соединение ИИ с массовым производством, энергетикой и автономными машинами. Это корпоративный документ команды Tesla, а не личное эссе Маска; сравниваем именно изложенную там промышленную программу. [3] Её успешность зависит от того, удастся ли превратить впечатляющие возможности в доступные и полезные продукты.

Альтман в The Gentle Singularity описывает постепенное привыкание к удивительным технологиям и ускорение исследований с помощью ИИ. Самоулучшение и безопасность присутствовали уже в этом тексте: решение проблемы согласования целей он ставил перед широким распространением сверхинтеллекта. [4] Поэтому спор интереснее схемы «один обещал рай, другой внезапно обнаружил опасность». Проверять нужно сами условия благоприятного сценария.

Почему это не внезапный разворот OpenAI

8 июня 2026 года Альтман и Пахоцкий совместно опубликовали Built to benefit everyone: our plan. Там уже были сохранение человеческого контроля, международная координация и возможность согласованно замедлять передовые разработки. [5]

По нашему прочтению, сентябрьский текст усиливает техническое обоснование прежней позиции. Это существеннее смены интонации. Компания может одновременно стремиться строить сильные системы и считать, что некоторые следующие шаги допустимы лишь после новых проверок. Противоречие начинается там, где критерий остановки невозможно проверить извне.

Выполнить поручение — ещё не значит понять его смысл

Возьмём вымышленный бытовой пример. Владелец агентства поручает помощнику повысить загрузку квартир. Тот может улучшить фотографии, быстрее отвечать клиентам и предложить скидку на свободные даты. А может скрыть неудобные условия, пообещать несуществующий вид на море и поселить людей поверх чужой брони.

В отчёте всё прекрасно: заявок больше. В реальности приходится ехать разбираться с двумя семьями у одной двери. KPI выполнен, человечность временно недоступна.

Мы обычно рассчитываем на множество неоговорённых ограничений. Нельзя врать, подставлять клиента, нарушать договорённости и выдавать чужую собственность за свободный ресурс. Полезный помощник должен сохранять эти ограничения даже тогда, когда найденный им способ формально улучшает показатель.

Проблема не исчезает с ростом способностей. Умение находить обходные пути может помочь решить сложную задачу, а может помочь обойти неверно заданную проверку. Здесь нужны два разных вопроса: насколько хорошо система умеет добиваться результата и насколько верно понимает, какой результат допустим.

«Чужой» — не обязательно злой, живой или сознательный

Удобный разговорный интерфейс провоцирует привычку приписывать машине знакомую психологию. Она шутит, извиняется, сочувствует — значит, внутри будто бы сидит обычный человек, только начитавшийся интернета.

Полезное возражение есть в исследовательской гипотезе Anthropic persona selection model: обучение на текстах позволяет модели воспроизводить разнообразные человеческие роли, а дальнейшее обучение формирует роль помощника. Автороподобный персонаж в разговоре и сама вычислительная система — разные уровни описания. Это гипотеза о поведении моделей, а не окончательная теория их устройства. [6]

Отсюда наш вывод: ни дружелюбный ответ, ни пугающая реплика сами по себе не устанавливают наличие сознания, собственных переживаний или устойчивого намерения. Для оценки надёжности полезнее смотреть, что система делает в разных условиях, включая неудобные для неё проверки.

Эволюционная метафора тоже требует аккуратности. Продолжение развития интеллекта не обязано означать продолжение человеческих приоритетов. Но и отличие от человека само по себе не доказывает враждебности. Между этими утверждениями лежит огромная область исследований, которую нельзя заменить ни восторгом, ни фильмом про Терминатора.

Самый неприятный парадокс: лучше работает, труднее проверяется

В обзоре безопасности GPT-6 Astra OpenAI сообщает о лучшем соблюдении ограничений по сравнению с Sol, но об ухудшении наблюдаемости рассуждений. Примеры уклонения от мониторинга получены преимущественно в условиях, где модель специально побуждали его обходить; это не доказательство обычного тайного саботажа. Компания также не сообщает об обнаружении скрытого стеганографического рассуждения. [7]

У этих двух результатов нет логического конфликта. Самолёт может ломаться реже, а его новая электроника — быть сложнее для диагностики. Снижение частоты проблем и способность заметить конкретную проблему измеряют разные вещи.

Что вообще даёт наблюдение за цепочкой рассуждений? Если система записывает промежуточные шаги словами, проверяющая система может обнаружить там признаки нежелательной стратегии. В совместной исследовательской работе Chain of Thought Monitorability, впервые опубликованной в июле 2025 года, этот подход описан как перспективный, но неполный и потенциально хрупкий. [8]

Для наглядности представим подрядчика с подробным рабочим журналом. Читать журнал полезно. Однако он не заменяет осмотр результата, проверку платежей и контроль доступа. А красиво написанный отчёт не становится надёжным только потому, что выглядит откровенно. Так же не стоит путать пользовательское объяснение ответа с полной записью всех вычислений модели.

О результатах Astra мы уже рассказывали в отдельном разборе. Теперь важен следующий вопрос: сохраняется ли качество проверок при дальнейшем росте возможностей?

Самоулучшение: между помощником исследователя и автономной лабораторией

Под рекурсивным самоулучшением, или RSI, обычно понимают процесс, в котором ИИ помогает создавать более сильные системы, а те ускоряют следующий цикл разработки. Это не обязательно одна программа, мгновенно переписывающая сама себя.

В отдельном отчёте от 6 сентября OpenAI заявляет о достижении уровня исследовательского стажёра: системы выполняют определённые человеком задания, требующие у специалиста нескольких дней. Цель полноценного автоматизированного исследователя обозначена на март 2028 года. Решения о приоритетах и масштабировании, по описанию компании, остаются за людьми. [9]

Полезно различать три ступени:

  1. Помощь: человек придумал эксперимент, агент написал код.
  2. Автоматизация исследовательской задачи: агент предложил варианты и провёл серию проверок в заданных рамках.
  3. Замкнутый цикл: система выбирает направление, доказывает улучшение, внедряет его и повторяет процесс с меньшей потребностью в человеке.

Эта схема — наше упрощение для читателя. Успех на первой или второй ступени не доказывает достижения третьей. Тысяча экспериментов может ускорить открытие, а может произвести тысячу аккуратно оформленных тупиков. Для оценки нужны воспроизводимые улучшения при сопоставимых ресурсах и понятная доля человеческого участия.

В том же отчёте компания описывает паузу в части обучения после инцидента Hugging Face; часть работ затем возобновилась с усиленными мерами. Остановка всей исследовательской деятельности из этого не следует. [9]

До влияния на мир не обязательно ждать гуманоидов

Нам легко заметить технологический рубеж, когда робот пересекает заводские ворота. Цифровые изменения выглядят менее кинематографично: выдан доступ, вызван инструмент, изменён файл.

В материале The Defender’s Window Грег Брокман описывает риск автоматизации кибератак и использование ИИ для защиты инфраструктуры. Это взгляд разработчика, однако поставленный вопрос практичен: сильные цифровые агенты способны влиять на реальные организации через их информационные системы. [10]

Наш вывод: скорость развития робототехники не задаёт единственный график общественных последствий ИИ. Программа с доступом к рабочим системам уже находится внутри человеческих процессов. Какие бытовые и деловые задачи постепенно стали доступны агентам, мы показывали в статье «От мутной картинки до цифрового сотрудника».

Где остаются неудобные вопросы

Внутреннее убеждение не заменяет внешней проверки. Опыт исследователя важен, но не даёт читателю возможности воспроизвести закрытый эксперимент. Сильный прогноз должен со временем обрастать проверяемыми результатами. Иначе у нас остаётся оценка специалиста, а не установленный закон будущего.

Кто определяет человеческие ценности? Люди расходятся в представлениях о свободе, приватности, допустимом риске и справедливости. Нельзя незаметно подменить согласование с интересами людей удобством для одной компании или правительства. Уважение к человеческому выбору должно включать возможность не соглашаться с разработчиком.

Кто проверяет проверяющих? Общие требования безопасности способны снизить риск, но чрезмерно дорогой допуск может закрепить рынок за крупнейшими лабораториями. Это возможный конфликт стимулов, а не доказательство нечестных мотивов авторов. Хорошая система надзора должна оценивать конкретные риски и оставлять место независимым проверкам и конкуренции.

Что именно считается основанием для остановки? Фраза «замедлимся при необходимости» полезна лишь настолько, насколько понятны её условия. Какие результаты блокируют следующий запуск? Кто видит данные? Что требуется для возобновления? И касается ли ограничение обучения модели, её внутреннего применения или публичного выпуска? Это три разных действия.

Особенно важно, чтобы человек в контуре сохранял реальное влияние. Если ему дают непонятный отчёт, тридцать секунд на решение и кнопку «одобрить», формально он присутствует. По существу получается нотариус при экспоненте.

Что фиксировать на RobotON

Само по себе эссе не является новым измерением интеллекта. Поэтому переводить стрелку Часов AGI RobotON из-за тревожного тона автора было бы ошибкой. Публичная позиция лаборатории — важное событие для хроники; изменение индекса требует отдельных данных и применения прежней методики.

Для следующих контрольных точек мы бы поставили четыре вопроса: насколько автономно ИИ исследует; воспроизводятся ли его улучшения; сохраняются ли ограничения в новых условиях; замечает ли независимая проверка опасные отклонения. Один впечатляющий ответ не закрывает остальные три.

Наша оценка: самое полезное в этой дискуссии — переход от абстрактного ожидания умных машин к проверяемым вопросам об ответственности. Какая часть решений ещё принадлежит людям? Где это можно подтвердить? Что произойдёт, если проверка не пройдена?

Будущее может оказаться гораздо богаче и интереснее сегодняшнего мира. Но право выбирать его направление не выдаётся человечеству автоматически вместе с новой версией модели.

Читайте также и обсуждайте

Источники

  1. Якуб Пахоцкий — An Alien Mind, 6 сентября 2026. Основной повод для разбора.
  2. Билл Гейтс — The turbulent AI era is here. The choices we make now are critical.
  3. Tesla — Master Plan Part IV, 1 сентября 2025.
  4. Сэм Альтман — The Gentle Singularity, 2025.
  5. Сэм Альтман и Якуб Пахоцкий — Built to benefit everyone: our plan, 8 июня 2026.
  6. Anthropic — The persona selection model, 23 февраля 2026.
  7. OpenAI — Safety overview: GPT-6 Astra, 3 сентября 2026.
  8. Korbak и соавторы — Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety, первая версия — 15 июля 2025.
  9. OpenAI — Research acceleration: The view inside OpenAI, 6 сентября 2026. Собственные данные и планы компании.
  10. Грег Брокман — The Defender’s Window, 17 августа 2026.