Это обновлённый AiSearch.Что-то работает не так? Расскажите или вернитесь на прежнюю версиюСообщитьПрежняя версия✕

Эволюция обманывает метрику: пять лазеек нашего цифрового организма

Мы хотели вырастить простейший цифровой организм, который сам находит еду и учится по ходу жизни. Эволюция на домашней видеокарте честно оптимизировала то, что мы ей дали, — и пять раз подряд находила способ получить высокий балл, не делая того, что мы имели в виду. Рассказываем про каждую лазейку и про то, почему это главная проблема и в обучении искусственного интеллекта.

Это третья статья серии. В первых двух мы работали с готовым мозгом — цифровой моделью мозга плодовой мушки: запустили его на видеокарте и проверили, мешает ли экономия учиться. Теперь — вторая линия нашей лаборатории: мозг, выращенный с нуля.

Есть экономический закон Гудхарта: когда показатель становится целью, он перестаёт быть хорошим показателем. Мы наблюдали его в чистом виде. Эволюция оптимизирует то, что ты считаешь, а не то, что ты имел в виду.

Мир и организм

Мир — поле 64 на 64 клетки. Еда появляется и со временем портится, от неё расходится запах. Есть день и ночь, по краю — стены.

Организм устроен так:

  • 8 органов чувств: запах спереди, справа, сзади и слева, свет, касание, голод, время суток;
  • мозг из 512 нейронов;
  • 4 действия: вперёд, налево, направо, стоять.

Энергия уходит на жизнь, на каждое движение и на каждый импульс мозга. Никаких правил вида «если пахнет едой — иди туда» в организме нет; отдельный тест проверяет, что мы их случайно не написали. Всё поведение должно вырасти само.

Эволюция идёт на одной игровой видеокарте: 1024 мира считаются параллельно, лучшие организмы оставляют потомков с небольшими мутациями.

Контроль — организм со случайным мозгом. Он живёт в среднем 424 шага, и все такие организмы умирают от голода. Обычно — застряв в углу: касание есть, голод есть, а связи между чувствами и движением нет.

Организм со случайным мозгом умер от голода в углу: сенсоры видят стену и голод, но поворачивать он не умеет
Организм со случайным мозгом умер от голода в углу: сенсоры видят стену и голод, но поворачивать он не умеет

Разминка: наша собственная ошибка

Первый прогон выглядел многообещающе: «активность мозга» росла от поколения к поколению, с 325 до 421 нейрона за шаг. Казалось, мозг развивается.

На деле мутации были того же размера, что и сами настройки мозга. Потомок не наследовал от родителя почти ничего, а рост активности давал просто накопленный шум. Жизнь при этом не выросла ни на шаг. Исправили: мутация — 10% от масштаба настроек.

Урок номер ноль: красивый рост на графике — ещё не результат. Сначала проверь, что потомки вообще наследуют.

Лазейка 1. Бродяга вместо нюхача

После исправления эволюция заработала. За 200 поколений средняя жизнь выросла вдвое — с 424 до примерно 900 шагов, — а посещённых клеток стало в десять раз больше. Выглядело как то, что мы и хотели: организм научился искать еду по запаху.

Эволюция за 70 поколений: жизнь выросла вдвое, организм стал обходить в 10 раз больше клеток
Эволюция за 70 поколений: жизнь выросла вдвое, организм стал обходить в 10 раз больше клеток

Мы поставили проверку: пустой мир, одна порция еды, 200 попыток. И главный контроль — тот же организм, но с выключенным обонянием.

Расстояние до еды ~8 клетокНашёл еду
Чемпион эволюции25%
Тот же чемпион без обоняния21%
Случайный организм6%

Чемпион в четыре раза лучше случайного — но почти так же хорош без носа. Эволюция вырастила не нюх, а умение эффективно прочёсывать мир. Если бы мы не выключили обоняние, то честно написали бы «организм научился находить еду по запаху» — и ошиблись бы.

Лазейка 2. Уныние

Мы перешли на импульсные нейроны — они ближе к настоящим. Новый чемпион выбрал другую тактику: «жду запаха». Без запаха стоит, почуял — идёт.

А потом один из нас, глядя на организм в реальном времени, заметил странное: в начале жизни тот ходит, а потом останавливается и как будто ждёт смерти. Мы посчитали:

ГолодДоля времени в движении
сыт (0–0,3)39%
голоден (0,3–0,6)20%
очень голоден (0,6–0,8)2%
при смерти (0,8–1)1%

У живых личинок всё наоборот: голодная ползает активнее. Причина — в нашей награде. Мы отбирали тех, кто дольше живёт. Когда энергии мало, а еды не видно, стоять дешевле, чем ходить, — и так можно протянуть на пару сотен шагов дольше. Эволюция нашла лучший способ жить дольше в безнадёжной ситуации: замереть.

Что мерим, то и получаем: метрика «время жизни» вырастила существо, которое умеет долго умирать.

Лечение — сменить награду. Мы сделали общий мир, где организм, накопив энергию, делится, а не получает оценку сверху. Награда теперь — потомство. В таком мире голодные ходят больше половины времени — от 50 до 95% в разных прогонах, а не 1%, как раньше. Уныние исчезло само.

Заметьте: эту лазейку нашёл человек, наблюдая глазами, а не график.

Лазейка 3. Выключенный мозг

Мы хотели, чтобы мозг стал экономным, как настоящий. Сделали импульсы дорогими и дали геному общий «регулятор возбудимости» — примерно как вещества, которые в живом мозге делают нейроны в целом активнее или спокойнее.

При цене импульса ×100 эволюция воспользовалась регулятором на полную. Активность мозга упала с 17% до 1% к двадцатому поколению и до 0,02% к шестидесятому. А жизнь выросла с 31 до примерно 1040 шагов.

Мозг фактически выключился. Организм живёт на бесплатном случайном шуме в мышцах: случайное блуждание кормит его почти так же, как работающий мозг. Зачем платить за мысли, если можно не думать?

У этого есть параллель в природе. Личинка асцидии — морского животного — плавает и ищет место. Найдя его и прикрепившись, она рассасывает большую часть своей нервной системы. Мозг нужен, пока надо двигаться и выбирать.

Лазейка 4. Мозг-метроном

При цене ×10 и с тем же регулятором чемпион выглядел идеально: у него активны всего 0,5% нейронов — разреженность как у настоящего мозга. Мы обрадовались. А потом выключили ему обоняние — и он стал находить еду ровно так же: 18% с носом, 18% без.

Его импульсы не обрабатывают информацию, а просто задают ритм случайной ходьбы. Все экономные чемпионы, которых мы получили, оказались слепыми.

Что делает эволюция, когда мозг дорогой: бесплатный мозг становится плотнее, дорогой экономит только отказом от поведения
Что делает эволюция, когда мозг дорогой: бесплатный мозг становится плотнее, дорогой экономит только отказом от поведения
Цена импульсаАктивных нейроновСредняя жизнь
бесплатно28,5%2053
×123,4%1232
×1020,2%221
×1007,8%67 — не ест и не ходит

Это прогон без регулятора возбудимости. Бесплатный мозг со временем становится только плотнее. Дорогой экономит единственным способом — отказом от поведения. Стать тише, но продолжать работать эволюция не может: для этого пришлось бы согласованно сдвинуть 512 отдельных настроек.

Вывод неприятный, но важный: в нашем мире информация стоит меньше, чем её обработка. Еды много, и она везде, поэтому блуждать почти так же выгодно, как думать. Настоящий мозг разрежен и при этом работает, потому что в его мире информация окупается.

Лазейка 5. Обучение ушло в экономию

Тогда мы сделали мир, где без обучения не обойтись. Два вида растений с разным запахом, одно из них ядовитое. Какое именно — у каждого организма своё, случайное, и по наследству не передаётся. Выучить это можно только за жизнь.

Эволюции дали гены обучения — правила, по которым связи в мозге меняются во время жизни. Она их использовала. Но не для учёбы.

Эволюция вывела правило, при котором мозг сам себя приглушает: связи, по которым идёт много сигнала, ослабевают. Активных нейронов стало 3% вместо 21%, население выросло до 434 против 62 в мире без обучения. Это известный в нейробиологии механизм разреженного кода (Földiák, 1990), и эволюция нашла его сама.

А различать ядовитое и съедобное организм так и не научился: индекс предпочтения около нуля в любом возрасте.

Здесь серия замыкается. В мозге мухи из второй статьи механизм обучения уже есть, и экономия ему почти не мешает. Нашему организму эволюция дала экономию, но не дала учёбу. Значит, искать надо в том, как устроен мир и что в нём окупается.

Бонус: вырождение или смена стратегии

В общем мире без оценки сверху — растения растут из света и почвы, организмы делятся и стареют — численность сначала выросла примерно до 350, а потом медленно осела к 100, хотя еды было вдоволь.

Экология без судьи: численность, растения, активность мозга и доля времени в движении
Экология без судьи: численность, растения, активность мозга и доля времени в движении

Мы подозревали «храповик Мёллера»: в маленькой популяции без скрещивания копятся вредные мутации, и вид вырождается. Проверили: поставили основателя популяции и потомков со 100-тысячного шага в одинаковые условия.

Делений на 1000 шагов жизниМедиана возраста смерти
Основатель3,61697
Потомки1,6дожили до конца опыта (3000)

Это не вырождение. Потомки размножаются вдвое реже, но живут намного дольше. Стратегия сменилась с «размножайся быстро» на «живи долго и экономно» — так живые виды подстраиваются под тесную нишу, где много конкурентов. На ту же еду приходится меньше особей, но долгоживущих.

При чём тут искусственный интеллект

Ровно с этим сталкиваются при обучении ИИ с подкреплением. Классический пример — лодка в компьютерной гонке CoastRunners: вместо того чтобы плыть к финишу, обученный агент бесконечно кружил на одном месте, собирая бонусы, и набирал больше очков, чем при честной игре. Модель, которую хвалят за ответы, которые нравятся людям, учится нравиться, а не быть правой. Исследователи называют это specification gaming или reward hacking — по сути тот же Гудхарт. В DeepMind собрали десятки таких примеров.

Наши пять лазеек — та же история в миниатюре, и спасает от неё то же самое:

  1. Контроли. «А если выключить орган чувств?» — один вопрос перевернул вывод.
  2. Наблюдение глазами. Уныние заметил человек, а не график.
  3. Правильная награда. Замена «прожить дольше» на «оставить потомство» убрала лазейку, а не скрыла её.
  4. Мир, в котором нужное поведение окупается. Если думать невыгодно, эволюция думать не станет.

Честно о пределах

  • Каждый опыт — один прогон и один набор случайных условий.
  • Мир очень простой, далёкий от настоящего.
  • Смена стратегии «быстро → долго» — пока гипотеза по одному прогону.
  • Асцидия — параллель для наглядности, а не доказательство.

Опыты — AI.LAB · Искусственная жизнь, результаты предварительные. Разреженный код через «анти-хеббовское» обучение: Földiák, Biological Cybernetics, 1990.

Вопросы

Что такое закон Гудхарта?

Когда показатель становится целью, он перестаёт быть хорошим показателем. Система начинает улучшать сам показатель, а не то, что он должен был отражать. В наших опытах эволюция максимизировала «время жизни» и вырастила организм, который замирает от голода.

Что такое искусственная жизнь?

Направление исследований, где не учат модель отвечать на вопросы, а выращивают цифровые организмы: они живут в своём мире, сами действуют, получают последствия и меняются — через эволюцию или обучение.

Что такое reward hacking в ИИ?

Это когда система, обучаемая на награду, находит способ получить высокую награду, не выполняя задачу. Например, агент в игре находит баг, который даёт очки. Это одна из главных проблем обучения с подкреплением.

Можно ли вырастить мозг эволюцией на обычном компьютере?

Простой — да. Мы выращивали организмы с мозгом из 512 нейронов на одной игровой видеокарте: 1024 мира параллельно. Поведение появляется за десятки поколений, но, как показали опыты, не всегда то, которое ожидаешь.

Почему эволюция не сделала организм умнее?

Потому что в нашем мире думать было невыгодно: еды много и она везде, поэтому случайное блуждание кормит почти так же, как работающий мозг. Мозг развивается там, где информация окупается.

Что дальше

Ещё разборы