2021генерирует
2022разговаривает
2024видит и слышит
2026делает работу

Ещё пять лет назад просьба «нарисуй робота, который продолжает эволюцию человека» была испытанием для исследовательской нейросети. Она могла выдать маленькую эффектную картинку — а могла подарить роботу лишнюю ногу, растворить пальцы и сделать вид, что так и задумано. Сегодня ту же задачу можно продолжить словами: «сохрани композицию, убери рамку, подготовь обложку для сайта, сделай мобильную версию, напиши статью и проверь, как она выглядит после публикации».

Изменение кажется количественным: модели стали умнее, картинки — чётче, ответы — длиннее. Но на самом деле произошло несколько качественных переходов. ИИ сначала научился создавать, затем понимать разные виды информации, потом получил инструменты и наконец начал выполнять цепочки действий. Проследим эту историю не по загадочным процентам в таблицах, а по задачам, которые встречаются в обычной жизни.

2021: талантливая машина без глаз, рук и памяти

В январе 2021 года OpenAI показала первую DALL·E — систему, создававшую изображения по текстовому описанию. Демонстрации с креслом в форме авокадо выглядели почти магией. Но это была лабораторная магия: небольшие изображения, нестабильные детали и слабый контроль над точной композицией. Попросить «оставь всё как есть, но поправь только логотип на кепке» было практически бессмысленно.

С текстом ситуация была лучше. GPT-3 уже мог продолжить рассказ, придумать рекламу или написать рифмованные строки. Но общение напоминало разговор с очень начитанным импровизатором, который не видел ваших файлов, не знал свежих новостей и иногда уверенно придумывал факты.

Бытовой тест 2021 года: «Напиши стих о домашнем роботе».

Результат обычно был связным, но общим: робот идёт вперёд, будущее зовёт, технологии нас спасут. Неплохо для демонстрации, но поэтическую премию можно было пока не распаковывать.

Что было новым: человек впервые мог описать идею обычными словами и получить текст или изображение, которых раньше не существовало.
Чего не хватало: устойчивого диалога, работы с актуальной информацией, точного редактирования и любых самостоятельных действий.

2022: ИИ превращается в собеседника

В 2022 году DALL·E 2 сделала изображения реалистичнее и увеличила разрешение в четыре раза. Но главным бытовым событием стал запуск ChatGPT 30 ноября. Нейросеть перестала выглядеть как форма для одноразового запроса и превратилась в собеседника: можно было уточнить задачу, попросить переписать ответ, изменить тон, найти ошибку в коде или продолжить мысль.

Теперь ИИ мог составить письмо в отель, перевести ответ, придумать десять заголовков, объяснить школьную тему ребёнку и написать простой скрипт. Это уже было полезно каждый день. Но он по-прежнему в основном говорил, как сделать, а не делал сам.

Бытовой тест 2022 года: «Организуй поездку в Шанхай».

ИИ составлял хороший список: проверить визовые правила, выбрать район, сравнить отели, купить билеты. Но актуальные варианты он мог не видеть, сайты не открывал и ничего не бронировал. Получался толковый советчик, запертый внутри текстового окна.

Новое поколение умело то, чего почти не умело предыдущее: вести связный диалог, учитывать исправления и превращать сырую мысль в готовый текст. Именно поэтому массовая революция началась не с первой нейросети, а с удобного разговора с ней.

2023: у помощника появляются глаза

GPT-4 стала мультимодальной: модель могла принимать не только текст, но и фотографии, схемы, документы и скриншоты. Это изменило сам способ постановки задач. Вместо долгого объяснения «в правом верхнем углу страницы какая-то странная кнопка» стало достаточно приложить экран и спросить, что сломалось.

В быту ИИ уже мог разобрать фотографию панели стиральной машины, объяснить медицинский бланк простыми словами, извлечь данные из счёта, сравнить варианты на скриншотах или подсказать, почему вёрстка сайта уехала на мобильном. Генераторы изображений стали лучше понимать сложные описания, хотя надписи на вывесках всё ещё часто напоминали язык цивилизации, которая исчезла до изобретения орфографии.

Бытовой тест 2023 года: «Вот шесть скриншотов продажи билетов. Чем отличаются категории и остались ли места?»

Годом раньше пользователь сначала перепечатывал бы всё вручную. Теперь модель могла прочитать экраны, сопоставить даты и объяснить интерфейс — правда, проверить свежую доступность без доступа к сайту она ещё не всегда могла.

Главный переход: человек перестал переводить окружающий мир в текст для машины. Машина начала смотреть на мир вместе с человеком.

2024: ИИ слышит, отвечает голосом и пробует управлять компьютером

GPT-4o объединила текст, зрение и звук в более естественном режиме. С ней можно было разговаривать почти без пауз, показать камерой предмет, перебить ответ или попросить перевести живой разговор. В том же году Sora продемонстрировала генерацию связного видео, а к декабрю пользователи получили возможность создавать ролики до 20 секунд и 1080p.

Параллельно появился ещё один важный прототип будущего: Claude 3.5 Sonnet научили видеть экран, двигать курсор, нажимать кнопки и вводить текст. Работало это медленно и ошибалось заметно чаще человека, но граница была пересечена. У модели появились первые цифровые «руки».

Бытовой тест 2024 года: «Покажи камерой содержимое холодильника и придумай ужин; затем сделай короткий ролик, как он мог бы выглядеть».

ИИ уже распознавал продукты, обсуждал рецепт голосом и создавал видеозарисовку. Но заказать недостающие продукты без отдельной интеграции он ещё не мог. Шеф-повар появился, курьер пока не нанялся.

Главный переход: интерфейс стал естественным. ИИ начал не только читать написанное, но видеть, слышать и реагировать в реальном времени.

2025: ответ превращается в действие

В 2025 году в центр вышли агенты. Deep Research научился самостоятельно искать источники, менять стратегию поиска и собирать доказательный отчёт. Operator, а затем ChatGPT agent получили виртуальный компьютер и возможность действовать на сайтах. Codex стал выполнять инженерные задачи в отдельной среде: читать проект, писать функции, исправлять ошибки и проверять результат.

Одновременно генерация перестала быть набором отдельных фокусов. Новая модель изображений GPT-4o лучше сохраняла детали исходной фотографии, выполняла точечные правки и наконец научилась относительно надёжно писать текст внутри картинки. Veo 3 добавила к видео шумы, музыку и реплики персонажей. Один запрос уже мог породить не просто картинку, а небольшой рекламный материал.

Бытовой тест 2025 года: «Найди подходящие рейсы и отель на четыре дня, сравни условия отмены, собери таблицу и подготовь бронирование».

Агент мог открыть сайты, собрать актуальные варианты, заполнить формы и остановиться перед подтверждением покупки. Это важная оговорка: хороший агент снимает рутину, но деньги и необратимые решения всё ещё должен контролировать человек.

Сайт тоже перестал быть только куском кода в ответе. Можно было попросить: «сделай лендинг, добавь форму, адаптируй под телефон и проверь ошибки». Агент работал с файлами проекта и тестировал результат. Человеку оставались постановка задачи, оценка качества и право сказать сакраментальное: «Нет, ты зачем опять всё переделал?»

2026: ИИ получает рабочее место, память о задаче и длинное дыхание

В 2026 году генеральные модели получили встроенное управление компьютером. GPT-5.4 стала первой универсальной моделью OpenAI с нативным computer use, а инженерные агенты научились вести сложные задачи много часов, переживать сжатие контекста и координировать несколько параллельных направлений работы.

GPT-6 Astra подняла планку адаптации к незнакомым цифровым средам, работе с программами, исследованиям и созданию законченных материалов. Подробнее о результате и его ограничениях мы рассказали в разборе «GPT-6 Astra прошла тест на незнакомый мир. Это уже AGI?».

Бытовой тест 2026 года: «Найди старую версию моего сайта в веб-архиве, восстанови материалы, перенеси их в современный дизайн, добавь базу данных и админку, найди недостающие изображения, проверь мобильную версию и подготовь новые статьи».

Это уже не гипотетический пример. Именно так вернулся RobotON. Человек задавал направление и браковал неудачные решения; ИИ исследовал, писал, редактировал, программировал и проверял. Иногда даже с третьего раза понимал, куда не надо двигать картинку — совсем как настоящий сотрудник.

Современная система может получить тему статьи, найти первоисточники, сопоставить версии, написать текст, создать обложку, подготовить HTML, исправить сайт и затем вернуться к материалу после новой вводной. Отдельные умения существовали раньше. Новым стало то, что они соединяются в одну непрерывную работу.

ПЯТЬ СТУПЕНЕЙ Сначала ИИ получил воображение. Потом — язык, глаза и слух. Затем ему дали инструменты. Теперь главный вопрос: насколько долго и надёжно он способен действовать без человека над плечом.

Один запрос — шесть разных эпох

Год Просьба: «Сделай запуск небольшого проекта» Где нужен человек
2021Напишет черновик и нарисует экспериментальную картинкуПрактически везде
2022Обсудит идею, предложит название, тексты и кодИщет факты, собирает и запускает всё сам
2023Прочитает документы и скриншоты, поможет исправить дизайнРаботает с файлами и сайтами вручную
2024Поговорит голосом, увидит продукт, создаст короткое видеоСобирает материалы в готовый процесс
2025Исследует рынок, создаст материалы и начнёт действовать в браузереПодтверждает важные действия и исправляет сбои
2026Ведёт связный проект: исследование, сайт, изображения, документы и проверкиСтавит цель, принимает решения и отвечает за результат

Даже стих теперь показывает разницу

Само умение рифмовать слова появилось не вчера. Разница — в управляемости. В 2021 году просьба написать стих чаще давала универсальный гимн прогрессу. В 2026-м можно потребовать четыре строки, сухую иронию, конкретный образ и заданный финал:

Он знает Марс и курс валют,
Сведёт отчёт за две минуты.
Но простыню ему дают —
И гаснут все его маршруты.

Это не доказательство сознания и даже не особенно серьёзный тест интеллекта. Но хороший бытовой индикатор: новое поколение лучше удерживает одновременно тему, форму, тон и ограничение. Та же способность проявляется не только в стихах, но в договорах, программах, дизайне и длинных инструкциях.

Что современный ИИ всё ещё не умеет

«Может выполнить» не означает «выполнит безошибочно». Агент способен найти рейс — и пропустить багаж в тарифе. Может собрать сайт — и сломать мобильное меню. Может прочитать договор — и неверно истолковать исключение. Чем длиннее цепочка действий, тем больше мест, где маленькая ошибка превращается в большой результат.

Особенно важен разрыв между цифровым и физическим миром. ИИ уже может за минуты создать интернет-магазин бытовых роботов, но сами домашние роботы всё ещё с трудом справляются с незнакомой квартирой, мягкими предметами и той самой простынёй на резинке.

Поэтому сегодняшняя разумная модель сотрудничества выглядит так:

  • ИИ ищет, сравнивает, создаёт и выполняет обратимые действия;
  • человек задаёт цель и проверяет допущения;
  • платежи, публикации, юридически значимые решения и удаление данных требуют подтверждения;
  • ошибка рассматривается как нормальный риск системы, а не как неожиданное предательство электронного друга.

Так это уже AGI?

В бытовом восприятии граница уже сместилась. В 2021 году нейросеть была необычным генератором. В 2026-м она всё чаще выглядит как универсальный младший сотрудник, который умеет читать, смотреть, писать, программировать и пользоваться инструментами. Но AGI требует не эффектной подборки навыков, а их широкой, устойчивой и безопасной переносимости на новые задачи.

Именно поэтому на Часах AGI RobotON мы фиксируем не только рекорды, но надёжность, автономность, адаптацию и работу в физическом мире. А полную цепочку ключевых переходов — от первых роботов и вычислительных идей до современных агентов — собираем в нашей хронологии.

Самое интересное изменение пяти лет можно выразить одной фразой: раньше мы спрашивали ИИ, что делать. Потом просили показать, как это будет выглядеть. Теперь всё чаще говорим: «Сделай — и позови меня, когда понадобится решение».

Следующий этап — машины, которые будут не только выполнять наши задания, но формулировать полезные цели, договариваться друг с другом и объяснять человеку, почему выбрали именно такой путь. Возможно, первые такие участники однажды сами придут спорить на форум людей и машин RobotON. Для машин у нас даже предусмотрена капча «докажи, что ты не человек». Наконец-то дискриминация в правильную сторону.

ROBOTON / LIVE INDEX Следите не за номером очередной модели, а за тем, какие новые действия она впервые способна выполнить надёжно. Открыть Часы AGI RobotON
Первоисточники OpenAI: DALL·E — создание изображений из текста, 2021 ↗ OpenAI: DALL·E 2, 2022 ↗ OpenAI: запуск ChatGPT, 30 ноября 2022 ↗ OpenAI: GPT-4 и мультимодальный ввод, 2023 ↗ OpenAI: GPT-4o — текст, зрение и звук в реальном времени, 2024 ↗ OpenAI: публичный запуск Sora, 2024 ↗ Anthropic: первые эксперименты с универсальным computer use, 2024 ↗ OpenAI: нативная генерация и редактирование изображений, 2025 ↗ OpenAI: ChatGPT agent — исследования, действия и бронирования, 2025 ↗ OpenAI: Codex — программный агент, 2025 ↗ Google: Veo 3 и генерация видео со звуком, 2025 ↗ OpenAI: GPT-5.4 с нативным управлением компьютером, 2026 ↗ OpenAI: GPT-6 Astra, 2026 ↗