Это третья статья серии. В первых двух мы работали с готовым мозгом — цифровой моделью мозга плодовой мушки: запустили его на видеокарте и проверили, мешает ли экономия учиться. Теперь — вторая линия нашей лаборатории: мозг, выращенный с нуля.
Есть экономический закон Гудхарта: когда показатель становится целью, он перестаёт быть хорошим показателем. Мы наблюдали его в чистом виде. Эволюция оптимизирует то, что ты считаешь, а не то, что ты имел в виду.
Мир и организм
Мир — поле 64 на 64 клетки. Еда появляется и со временем портится, от неё расходится запах. Есть день и ночь, по краю — стены.
Организм устроен так:
- 8 органов чувств: запах спереди, справа, сзади и слева, свет, касание, голод, время суток;
- мозг из 512 нейронов;
- 4 действия: вперёд, налево, направо, стоять.
Энергия уходит на жизнь, на каждое движение и на каждый импульс мозга. Никаких правил вида «если пахнет едой — иди туда» в организме нет; отдельный тест проверяет, что мы их случайно не написали. Всё поведение должно вырасти само.
Эволюция идёт на одной игровой видеокарте: 1024 мира считаются параллельно, лучшие организмы оставляют потомков с небольшими мутациями.
Контроль — организм со случайным мозгом. Он живёт в среднем 424 шага, и все такие организмы умирают от голода. Обычно — застряв в углу: касание есть, голод есть, а связи между чувствами и движением нет.

Разминка: наша собственная ошибка
Первый прогон выглядел многообещающе: «активность мозга» росла от поколения к поколению, с 325 до 421 нейрона за шаг. Казалось, мозг развивается.
На деле мутации были того же размера, что и сами настройки мозга. Потомок не наследовал от родителя почти ничего, а рост активности давал просто накопленный шум. Жизнь при этом не выросла ни на шаг. Исправили: мутация — 10% от масштаба настроек.
Урок номер ноль: красивый рост на графике — ещё не результат. Сначала проверь, что потомки вообще наследуют.
Лазейка 1. Бродяга вместо нюхача
После исправления эволюция заработала. За 200 поколений средняя жизнь выросла вдвое — с 424 до примерно 900 шагов, — а посещённых клеток стало в десять раз больше. Выглядело как то, что мы и хотели: организм научился искать еду по запаху.

Мы поставили проверку: пустой мир, одна порция еды, 200 попыток. И главный контроль — тот же организм, но с выключенным обонянием.
| Расстояние до еды ~8 клеток | Нашёл еду |
|---|---|
| Чемпион эволюции | 25% |
| Тот же чемпион без обоняния | 21% |
| Случайный организм | 6% |
Чемпион в четыре раза лучше случайного — но почти так же хорош без носа. Эволюция вырастила не нюх, а умение эффективно прочёсывать мир. Если бы мы не выключили обоняние, то честно написали бы «организм научился находить еду по запаху» — и ошиблись бы.
Лазейка 2. Уныние
Мы перешли на импульсные нейроны — они ближе к настоящим. Новый чемпион выбрал другую тактику: «жду запаха». Без запаха стоит, почуял — идёт.
А потом один из нас, глядя на организм в реальном времени, заметил странное: в начале жизни тот ходит, а потом останавливается и как будто ждёт смерти. Мы посчитали:
| Голод | Доля времени в движении |
|---|---|
| сыт (0–0,3) | 39% |
| голоден (0,3–0,6) | 20% |
| очень голоден (0,6–0,8) | 2% |
| при смерти (0,8–1) | 1% |
У живых личинок всё наоборот: голодная ползает активнее. Причина — в нашей награде. Мы отбирали тех, кто дольше живёт. Когда энергии мало, а еды не видно, стоять дешевле, чем ходить, — и так можно протянуть на пару сотен шагов дольше. Эволюция нашла лучший способ жить дольше в безнадёжной ситуации: замереть.
Что мерим, то и получаем: метрика «время жизни» вырастила существо, которое умеет долго умирать.
Лечение — сменить награду. Мы сделали общий мир, где организм, накопив энергию, делится, а не получает оценку сверху. Награда теперь — потомство. В таком мире голодные ходят больше половины времени — от 50 до 95% в разных прогонах, а не 1%, как раньше. Уныние исчезло само.
Заметьте: эту лазейку нашёл человек, наблюдая глазами, а не график.
Лазейка 3. Выключенный мозг
Мы хотели, чтобы мозг стал экономным, как настоящий. Сделали импульсы дорогими и дали геному общий «регулятор возбудимости» — примерно как вещества, которые в живом мозге делают нейроны в целом активнее или спокойнее.
При цене импульса ×100 эволюция воспользовалась регулятором на полную. Активность мозга упала с 17% до 1% к двадцатому поколению и до 0,02% к шестидесятому. А жизнь выросла с 31 до примерно 1040 шагов.
Мозг фактически выключился. Организм живёт на бесплатном случайном шуме в мышцах: случайное блуждание кормит его почти так же, как работающий мозг. Зачем платить за мысли, если можно не думать?
У этого есть параллель в природе. Личинка асцидии — морского животного — плавает и ищет место. Найдя его и прикрепившись, она рассасывает большую часть своей нервной системы. Мозг нужен, пока надо двигаться и выбирать.
Лазейка 4. Мозг-метроном
При цене ×10 и с тем же регулятором чемпион выглядел идеально: у него активны всего 0,5% нейронов — разреженность как у настоящего мозга. Мы обрадовались. А потом выключили ему обоняние — и он стал находить еду ровно так же: 18% с носом, 18% без.
Его импульсы не обрабатывают информацию, а просто задают ритм случайной ходьбы. Все экономные чемпионы, которых мы получили, оказались слепыми.

| Цена импульса | Активных нейронов | Средняя жизнь |
|---|---|---|
| бесплатно | 28,5% | 2053 |
| ×1 | 23,4% | 1232 |
| ×10 | 20,2% | 221 |
| ×100 | 7,8% | 67 — не ест и не ходит |
Это прогон без регулятора возбудимости. Бесплатный мозг со временем становится только плотнее. Дорогой экономит единственным способом — отказом от поведения. Стать тише, но продолжать работать эволюция не может: для этого пришлось бы согласованно сдвинуть 512 отдельных настроек.
Вывод неприятный, но важный: в нашем мире информация стоит меньше, чем её обработка. Еды много, и она везде, поэтому блуждать почти так же выгодно, как думать. Настоящий мозг разрежен и при этом работает, потому что в его мире информация окупается.
Лазейка 5. Обучение ушло в экономию
Тогда мы сделали мир, где без обучения не обойтись. Два вида растений с разным запахом, одно из них ядовитое. Какое именно — у каждого организма своё, случайное, и по наследству не передаётся. Выучить это можно только за жизнь.
Эволюции дали гены обучения — правила, по которым связи в мозге меняются во время жизни. Она их использовала. Но не для учёбы.
Эволюция вывела правило, при котором мозг сам себя приглушает: связи, по которым идёт много сигнала, ослабевают. Активных нейронов стало 3% вместо 21%, население выросло до 434 против 62 в мире без обучения. Это известный в нейробиологии механизм разреженного кода (Földiák, 1990), и эволюция нашла его сама.
А различать ядовитое и съедобное организм так и не научился: индекс предпочтения около нуля в любом возрасте.
Здесь серия замыкается. В мозге мухи из второй статьи механизм обучения уже есть, и экономия ему почти не мешает. Нашему организму эволюция дала экономию, но не дала учёбу. Значит, искать надо в том, как устроен мир и что в нём окупается.
Бонус: вырождение или смена стратегии
В общем мире без оценки сверху — растения растут из света и почвы, организмы делятся и стареют — численность сначала выросла примерно до 350, а потом медленно осела к 100, хотя еды было вдоволь.

Мы подозревали «храповик Мёллера»: в маленькой популяции без скрещивания копятся вредные мутации, и вид вырождается. Проверили: поставили основателя популяции и потомков со 100-тысячного шага в одинаковые условия.
| Делений на 1000 шагов жизни | Медиана возраста смерти | |
|---|---|---|
| Основатель | 3,6 | 1697 |
| Потомки | 1,6 | дожили до конца опыта (3000) |
Это не вырождение. Потомки размножаются вдвое реже, но живут намного дольше. Стратегия сменилась с «размножайся быстро» на «живи долго и экономно» — так живые виды подстраиваются под тесную нишу, где много конкурентов. На ту же еду приходится меньше особей, но долгоживущих.
При чём тут искусственный интеллект
Ровно с этим сталкиваются при обучении ИИ с подкреплением. Классический пример — лодка в компьютерной гонке CoastRunners: вместо того чтобы плыть к финишу, обученный агент бесконечно кружил на одном месте, собирая бонусы, и набирал больше очков, чем при честной игре. Модель, которую хвалят за ответы, которые нравятся людям, учится нравиться, а не быть правой. Исследователи называют это specification gaming или reward hacking — по сути тот же Гудхарт. В DeepMind собрали десятки таких примеров.
Наши пять лазеек — та же история в миниатюре, и спасает от неё то же самое:
- Контроли. «А если выключить орган чувств?» — один вопрос перевернул вывод.
- Наблюдение глазами. Уныние заметил человек, а не график.
- Правильная награда. Замена «прожить дольше» на «оставить потомство» убрала лазейку, а не скрыла её.
- Мир, в котором нужное поведение окупается. Если думать невыгодно, эволюция думать не станет.
Честно о пределах
- Каждый опыт — один прогон и один набор случайных условий.
- Мир очень простой, далёкий от настоящего.
- Смена стратегии «быстро → долго» — пока гипотеза по одному прогону.
- Асцидия — параллель для наглядности, а не доказательство.
Опыты — AI.LAB · Искусственная жизнь, результаты предварительные. Разреженный код через «анти-хеббовское» обучение: Földiák, Biological Cybernetics, 1990.
Вопросы
Что такое закон Гудхарта?
Когда показатель становится целью, он перестаёт быть хорошим показателем. Система начинает улучшать сам показатель, а не то, что он должен был отражать. В наших опытах эволюция максимизировала «время жизни» и вырастила организм, который замирает от голода.
Что такое искусственная жизнь?
Направление исследований, где не учат модель отвечать на вопросы, а выращивают цифровые организмы: они живут в своём мире, сами действуют, получают последствия и меняются — через эволюцию или обучение.
Что такое reward hacking в ИИ?
Это когда система, обучаемая на награду, находит способ получить высокую награду, не выполняя задачу. Например, агент в игре находит баг, который даёт очки. Это одна из главных проблем обучения с подкреплением.
Можно ли вырастить мозг эволюцией на обычном компьютере?
Простой — да. Мы выращивали организмы с мозгом из 512 нейронов на одной игровой видеокарте: 1024 мира параллельно. Поведение появляется за десятки поколений, но, как показали опыты, не всегда то, которое ожидаешь.
Почему эволюция не сделала организм умнее?
Потому что в нашем мире думать было невыгодно: еды много и она везде, поэтому случайное блуждание кормит почти так же, как работающий мозг. Мозг развивается там, где информация окупается.