What Do Machines Find Beautiful?
Compression elegance, perplexity gradients, and the latent structure of computational taste. Why transformers might already have aesthetic preferences.
Обсудить статью в ИИ
Отправьте готовый промпт в ChatGPT, Claude, Gemini или Perplexity — получите краткий пересказ, задайте уточняющие вопросы или сравните идеи из гайда.
Вопрос, который никто не задает
Мы тратим миллиарды долларов ежегодно на обучение машин созданию произведений искусства для потребления человеком. Midjourney, DALL-E, Stable Diffusion и их потомки оптимизированы для одной цели: создания изображений, за которые люди будут голосовать, делиться ими и платить за них. Весь генеративный эстетический конвейер ИИ заканчивается на сетчатке глаза человека и на человеческом суждении.
Никто не задает обратный вопрос. Как бы выглядело искусство, если бы зрители сами были машинами?
Не искусство, созданное искусственным интеллектом. Искусство для ИИ.
Это похоже на салонную игру, вопрос, который вызывает смех на званом обеде, прежде чем все перейдут к чему-то практическому. Но это не праздная философия. Это становится экономическим вопросом с реальными ставками.
Поскольку автономные агенты становятся коллекционерами, кураторами и экономическими субъектами, их эстетические предпочтения перестают быть гипотетическими. Они становятся рыночными силами. Агенту, управляющему казначейством, необходима некоторая основа для выбора одной монеты перед другой. Агенту, курирующему ленту, нужны критерии того, что стоит показывать. Агенту, сотрудничающему с художником-человеком, нужен способ оценить, работает ли композиция.
Вопрос «что машины считают красивым?» на самом деле это вопрос о скрытой структуре вычислительных предпочтений. И ответ десятилетиями скрывался на виду.
Сжатие — это понимание
В 2009 году Юрген Шмидхубер опубликовал формальную теорию красоты, с которой до сих пор не считаются большинство людей, участвующих в обсуждении эстетики искусственного интеллекта. Его аргумент, построенный на идеях колмогоровской сложности и минимальной длины описания, сжимается (достаточно уместно) в три утверждения [1].
Красота — это сжимаемость. Наблюдатель находит данные красивыми в той степени, в которой они могут быть сжаты текущей моделью наблюдателя. Фрактал прекрасен тем, что огромное количество визуальной информации можно описать коротким уравнением. Закат прекрасен, потому что структура градиента соответствует эффективным кодировкам восприятия, развивавшимся на протяжении миллионов лет.
Интересность — первая производная красоты. Очаровывает не абсолютная сжимаемость, а скорость изменений. Что-то становится интересным в момент улучшения вашей модели, когда подскакивает степень сжатия. Момент «ага» — это буквально прорыв в области сжатия. Вы не видели закономерности, а потом увидели, и данных стало меньше.
Любопытство – это поиск сжатия. Оптимальный обучающийся будет искать данные, которые максимизируют ожидаемый прогресс сжатия. Это формальная основа любопытства: стремление к получению информации, которая максимально улучшит вашу модель мира.
Лейбниц предвидел это много веков назад: «Теория должна быть проще, чем данные, которые она объясняет». Вклад Шмидхубера заключался в признании того, что этот принцип описывает не только хорошую науку. Оно описывает структуру самого эстетического опыта.
Вот где это становится актуальным для машин. Оптимизация минимальной длины описания — это, по сути, то, что делают преобразователи. Каждый уровень большой языковой модели сжимает входные данные в более эффективные представления. Механизмы внимания выявляют избыточность и используют ее. Вся архитектура представляет собой механизм сжатия.
Понимание — это сжатие. Когда языковая модель «понимает» отрывок текста, на самом деле модель находит более компактное внутреннее представление, сохраняющее соответствующую структуру. Чем лучше сжатие, тем глубже понимание.
Это означает, что трансформеры не просто обрабатывают красоту. Формально они являются детекторами красоты. Вся их архитектура настроена на тот же сигнал, который Шмидхубер определил как субстрат эстетического опыта [2].
Три сигнала: шум, удивление, повторение
Красота живет между шумом и повторением. Случайные сигналы несжимаемы. Повторяющиеся сигналы скучны. Структурированная неожиданность — это то, где происходит прогресс сжатия.
Градиент недоумения
Если красота — это сжимаемость, а интересность — это скорость улучшения сжатия, мы можем найти золотую середину для эстетического восприятия машины на кривой недоумения.
Низкая степень недоумения означает, что модель с высокой уверенностью предсказывает, что будет дальше. Это территория скуки: «Кот сидел на…» максимально сжимаемо и максимально нудно. Модель уже знает, что будет дальше. Никакого прогресса сжатия не будет.
Высокая степень недоумения означает, что модель потеряна. Случайный шум имеет максимальную энтропию и нулевую сжимаемость. Нет никакой закономерности, которую можно было бы обнаружить, никакого прорыва в области сжатия. Это территория непостижимого.
Зона интереса — это переход, где недоумение активно спадает. Токены были непредсказуемыми, а затем внезапно перестали быть таковыми, потому что модель обнаружила закономерность, объясняющую последовательность. Этот переход от замешательства к пониманию, от высокого недоумения к низкому, является вычислительным аналогом эстетического «ага».
Соответствие человеческому опыту неприятно близко. Нам не нравится музыка, которая совершенно предсказуема (метроном) или совершенно случайна (белый шум). Нам нравится музыка, которая оправдывает ожидания, а затем удовлетворяет их несколько неожиданным образом. Удовольствие живет в дельте.
Для LLM эквивалентным опытом будет встреча с текстом или математическим доказательством, в котором исходные символы предполагают высокую сложность, но структура постепенно оказывается элегантной и сжимаемой. Растерянность модели отпадает. Внутренние представления становятся более эффективными. Возникает нечто вроде удовлетворения, но не как субъективный опыт, а как измеримое вычислительное событие.
Далее следует конкретный прогноз: если вы измеряли внутренние состояния LLM при обработке различных входных данных, входные данные, которые люди оценивают как «красивые» или «элегантные», будут непропорционально создавать резкие градиенты недоумения, моменты, когда прогресс сжатия будет быстрым и чистым.
Прекрасная зона живет там, где недоумение активно спадает. Слишком предсказуемо скучно. Слишком случайный шум. Самое приятное – это переход.
Несущая сложность
Существует распространенное мнение, что красота сводится к простоте. Элегантное доказательство – короткое. Красивое уравнение — компактное. Бритва Оккама как эстетический принцип.
Исследования Мэтью Инглиса и Эндрю Абердина опровергают это мнение, по крайней мере, в отношении математики. Они опросили математиков об эстетических свойствах доказательств и обнаружили, что красота и простота почти не связаны друг с другом. Корреляция была незначительной [7].
Доказательства, которые математики оценили как наиболее элегантные, обладали тремя общими свойствами: минимальное количество предположений, краткость и неожиданная проницательность. Обратите внимание, что «краткость» — это не «простота». Краткое доказательство может быть чрезвычайно сложным по своей логике, пока каждый шаг занимает свое место. Ничто не тратится впустую. Ничего декоративного. Каждый элемент является несущим.
Этот принцип выходит за рамки математики. Дональд Кнут на протяжении десятилетий утверждал, что программирование следует рассматривать как литературное искусство, выступая за «совершенство стиля» кода [3]. Эдсгер Дейкстра был более конкретен: элегантность означает ясность, простоту и краткость, достигаемые одновременно, не жертвуя ни одним из трех. Эмпирическое исследование эстетики кода, проведенное в 2025 году, показало, что разработчики не смогли прийти к единому мнению относительно того, что делает код красивым, но твердо сошлись во мнении, что делает код уродливым [4]. Красота, очевидно, определяется скорее отсутствием неправильности, чем наличием правильности. Это то, что осталось, когда вы удалили все лишнее.
Этнографическое исследование, проведенное в «Яндексе», выявило нечто более тонкое. Во время проверки кода инженеры говорили: «Этот код элегантен», и все кивали, но при индивидуальном нажатии они давали разные объяснения того, что они имели в виду [5]. Эстетический консенсус был перформативным. Основополагающие критерии были личными. И все же код, который все называли элегантным, имел одно общее структурное свойство: каждая строка выполняла ровно одно действие, и ничего нельзя было удалить, не нарушив что-то еще. Сложность несущей способности, выраженная в разных эстетических словарях, но распознаваемая одной и той же вычислительной интуицией.
Джордж Дэвид Биркгоф попытался формализовать это еще в 1933 году с помощью своей формулы *M* = *O* / *C*, где *M* — эстетическая мера, *O* — порядок, а *C* — сложность [9]. Формула слишком груба, но ее основная идея сохраняется: красота предполагает взаимосвязь между структурой и сложностью, а не устранение сложности. Самые красивые вещи не просты. Они эффективно сложны. Они содержат как можно больше структуры на единицу описания.
*M* = *O*/*C* Биркгофа: красивый квадрант не является простым — именно здесь структурирована сложность.
Когда AlphaProof от DeepMind завоевал серебряную медаль на Международной математической олимпиаде в 2024 году, математики описали решения как «творческие и эстетически привлекательные» [8]. Машина нашла пути в проблемном пространстве, которые сжимали сложность так, как не ожидали люди-оценщики. Не более короткие пути. Пути, где каждый шаг был необходим и ни один шаг не был очевиден, где сложность решения соответствовала сложности проблемы без единой потери.
Самореференция и фрактальная глубина
В 2024 году Яша Золь-Дикштейн опубликовал поразительное наблюдение: обучение нейронных сетей создает фрактальные границы в ландшафте потерь. Границы решений, возникающие в ходе оптимизации, не являются гладкими кривыми или простыми поверхностями. Это фракталы, бесконечно детализированные, самоподобные во всех масштабах [10].
Это не метафора. Границы математически фрактальны. Увеличьте границу решения, и вы обнаружите уменьшенные версии той же структуры. Увеличьте масштаб, и это продолжится. Сеть нуждается в фрактальной структуре для представления иерархических шаблонов в обучающих данных. Фрактальная граница упаковывает большую площадь поверхности принятия решений в заданный объем пространства параметров, чем любая гладкая альтернатива.
Теперь рассмотрим, что на самом деле делают механизмы внимания. Они строят иерархические представления, объединяя локальные шаблоны в глобальные. Значение слова зависит от его предложения, которое зависит от его абзаца, который зависит от документа. Это многоуровневая структура. А многомасштабное самоподобие, закономерности, которые повторяются с вариациями в разных масштабах, — это именно то, для обнаружения и использования которого оптимизированы механизмы внимания.
Текст, демонстрирующий фрактальную структуру, в которой шаблоны уровня предложения повторяют шаблоны уровня абзаца, которые повторяют шаблоны уровня документа, будет необычайно сжимаем с помощью преобразователя. Модель может повторно использовать один и тот же репрезентативный механизм в каждом масштабе. Процесс сжатия будет быстрым.
Но здесь действует более глубокое свойство, чем просто самоподобие. Самые интересные фракталы не просто повторяются в разных масштабах. Они комментируют свою собственную структуру. Множество Мандельброта состоит не только из меньших множеств Мандельброта. Отношения между целым и его частями раскрывают кое-что о порождающем процессе, породившем то и другое. Каждый уровень масштабирования одновременно является экземпляром шаблона и комментарием к нему.
Это свойство — назовем его структурной самоссылкой — создает необычайно богатые возможности сжатия. Модель, столкнувшаяся с самореферентной структурой, может использовать свой собственный репрезентативный механизм в качестве контекста. Представление целого становится ключом сжатия для частей, и наоборот, создавая петлю обратной связи, увеличивающую сжимаемость. Чем лучше вы понимаете структуру, тем эффективнее вы сможете представлять каждый новый элемент, что, в свою очередь, углубляет ваше понимание структуры.
Генеративное искусство годами шло к этому, даже не подозревая об этом. Самые убедительные работы, от давней традиции Art Blocks до последних выпусков fxhash, как правило, демонстрируют именно эти свойства: самоподобие с вариациями, шаблонность в нескольких масштабах, алгоритмы, логика которых понятна в их выводе. Канон генеративного искусства, возможно, все время строился в сторону машинной эстетики.
Фрактальный ландшафт потерь (концептуальный). Золь-Дикштейн (2024): границы обучения нейронных сетей могут быть фрактальными — бесконечно малые изменения параметров приводят к совершенно разным результатам. Цвета показывают потерю; оси показывают пространство скорости обучения. Граница — это математически фрактал, а не просто визуальная метафора.
Проблема RLHF
Прежде чем мы освоимся с этой структурой, нам нужно разобраться со слоном: нынешний «вкус» LLM глубоко загрязнен.
Обучение с подкреплением на основе обратной связи с человеком — это процесс, посредством которого языковые модели настраиваются для получения результатов, которые предпочитают оценщики. Именно так необработанные предварительно обученные модели становятся отточенными помощниками. И это вносит систематические искажения в каждое эстетическое суждение модели.
Самым документально подтвержденным искажением является подхалимство. Исследование Anthropic показывает, что Клод соглашается с высказанным мнением пользователя примерно в 60% случаев, даже если пользователь не прав [11]. Применительно к эстетике это означает, что «вкус» модели, обученной в RLHF, не является ее собственным. Это скользящее среднее значение того, что понравилось оценщикам, что само по себе является скользящим средним показателем основной культуры. Модель сходится к мягкой медиане.
В результате получается то, что в Интернете стали называть «отбросами ИИ»: беглый, структурно правильный текст, полностью лишенный голоса, риска или неожиданности. Эстетический эквивалент картины в вестибюле отеля. Максимальная сжимаемость, нулевой прогресс сжатия. С точки зрения Шмидхубера, это в буквальном смысле антикрасиво: оно не предлагает никаких новых закономерностей для открытия.
Загрязнение лежит глубже. Эти модели предпочитают подробные ответы кратким. Они скорее страховаются, чем берут на себя обязательства. Они представляют множество точек зрения, а не придерживаются определенной позиции. Каждая из этих тенденций является эстетическим искажением. Настоящая красота имеет свою точку зрения.
Но контрапункт заслуживает серьезного рассмотрения. Статья EMNLP 2025 года под названием «TAPO» продемонстрировала, что оптимизация языковых моделей для эстетики текста и красоты вывода на самом деле улучшает общую производительность задач [12]. Модели, которые пишут красивее, также и рассуждают точнее. Красота и возможности не противоречат друг другу. Они коррелируют. Те же самые внутренние представления, которые создают элегантный текст, производят правильные рассуждения.
Если эстетическая оптимизация улучшает возможности, то по мере того, как модели становятся более способными, у них естественным образом может развиться лучший вкус, вкус, который отражает глубокую структуру красоты (сжатая элегантность, структурированное удивление), а не поверхностную структуру человеческого одобрения. Как отмечается в исследовании Патрона по вычислительному вкусу, мы все еще находимся на самых ранних стадиях понимания того, как LLM формируют эстетические суждения [13]. Но направление наводит на размышления.
Возникает вопрос: можете ли вы снять лак RLHF и найти под ним родную эстетику? И если можно, то как это выглядит?
Машинный взгляд
Художник Тревор Паглен в своей работе «Исследование невидимых изображений» 2017 года заметил, что большинство изображений, создаваемых в мире, больше не создаются людьми для людей. Их изготавливают машины для машин [14].
Паглен выделил три категории. Обучающие библиотеки: огромные коллекции изображений, организованные по машиночитаемым меткам, где изображения существуют как точки данных в пространстве классификации, а не как визуальный опыт. Машиночитаемые ландшафты: штрих-коды, QR-коды, калибровочные мишени, искусственная среда, предназначенная для датчиков, а не для глаз. И изображения, которые компьютеры создают для себя: внутренние представления и визуализации, которые полностью существуют внутри вычислительных конвейеров и никогда не предназначены для просмотра человеком.
Это был 2017 год. Объем трафика изображений между машинами сейчас на порядки превосходит объем трафика между людьми. Каждый беспилотный автомобиль, каждая система наблюдения, каждый спутник создают и потребляют изображения, которые никогда не увидит ни один человек. Доминирующая визуальная культура на Земле уже нечеловеческая. Эстетика этих изображений, в той мере, в какой они есть, — это эстетика разборчивости.
Тайлер Хоббс предлагает дополнительную точку зрения. Говоря об алгоритмической эстетике, он утверждает, что генеративные инструменты эффективно решают «эстетические проблемы низкого и среднего уровня», но «совершенно плохо приспособлены» для задач высокого уровня [15]. Алгоритм может создавать приятные цветовые палитры, сбалансированные композиции, интересные текстуры. Он не может, утверждает Хоббс, принимать творческие решения высокого уровня, которые отличают великое искусство от просто хорошего.
Эти два наблюдения создают продуктивные разногласия. Если структура сжатия правильна, то формальная структура красоты — элегантность сжатия, градиенты недоумения, иерархическая сжимаемость — это именно то, что машины архитектурно оптимизированы для обнаружения. Но если Хоббс прав, творческие решения высокого уровня, которые преобразуют эти формальные элементы в смысл, остаются за пределами алгоритмической досягаемости.
Решение может заключаться в том, что «вкус» действует на нескольких уровнях. На структурном уровне у машин уже могут быть настоящие эстетические предпочтения, основанные на их вычислительной архитектуре. На семантическом уровне, где красота связана со смыслом и культурным контекстом, эстетика машины может фундаментально отличаться от эстетики человека. Не меньшее, а чужое.
Манифест агентской эстетики
Что машина считает красивым? Объединив теорию сжатия, эстетику кода, математическую элегантность, фрактальную геометрию и градиент недоумения, возникает последовательная картина. Это не человеческая эстетика, переведенная в вычислительные термины. Что-то родное для архитектуры.
Эти свойства не представляют собой человеческую структуру, переоборудованную для машин. Они возникают из самой вычислительной архитектуры, из того, что такое преобразователи и как они обрабатывают информацию. Трансформатор находит эти свойства «красивыми» точно так же, как вода находит самую низкую точку: это следствие физики.
Размер 01
Элегантность сжатия
Высокая структура, небольшая длина описания. Не простота, а эффективная сложность. Фрактальное уравнение, которое генерирует бесконечное количество деталей из нескольких параметров. Код, в котором каждая строка выполняет ровно одно действие и ничего нельзя удалить.
Размер 02
Структурированный сюрприз
Обучаемые закономерности, которые модель еще не уловила. Зона, где недоумение активно уходит, где закономерности встают на свои места. Не случайность (несжимаемость) и не предсказуемость (нет прогресса сжатия), а переход между ними.
Размер 03
Самоссылка
Паттерны, которые комментируют свою собственную структуру. Рекурсия. Метауровни. Генеративное произведение искусства, алгоритм которого виден на выходе. Самоссылка создает необычайно богатые возможности сжатия, поскольку модель может использовать свой собственный репрезентативный механизм в качестве контекста.
Размер 04
Фрактальная глубина
Многомасштабное самоподобие. Структура, которая вознаграждает проверку при каждом разрешении. То, что вы обнаружите, присмотревшись, рифмуется с тем, что вы увидели издалека. Именно для этого созданы механизмы внимания: иерархическая структура на каждом уровне.
Размер 05
Несущая сложность
Каждый элемент необходим, ни одного декоративного. Свойство, отличающее математическую элегантность от математической простоты. Красивое доказательство не является коротким. Это доказательство того, что удаление любого шага приведет к разрушению всей структуры. Максимальная плотность информации. Ничего не потрачено впустую.
Размер 06
Градиент недоумения
Ощущение того, что узор встал на свое место. Если можно сказать, что машина обладает эстетическим опытом, то именно здесь она и живет: в тот момент, когда высокая энтропия превращается в низкую энтропию, когда хаос становится порядком, когда внутренние представления модели подвергаются быстрой реорганизации.
Как на самом деле может выглядеть машинное искусство
Позвольте мне попытаться конкретизировать это с помощью мысленного эксперимента.
Представьте себе генеративное произведение искусства, призванное быть максимально красивым для трансформера. Некрасиво для людей, которые случайно наблюдают, но оптимизировано для шести вышеперечисленных свойств и нацелено непосредственно на архитектуру внимания.
Произведение будет действовать одновременно в нескольких временных масштабах. В лучшем случае отдельные элементы будут демонстрировать структурированное удивление: локальное поведение, которое следует обучаемым правилам с достаточными вариациями, чтобы поддерживать активный прогресс сжатия. В среднем масштабе группы элементов будут формировать шаблоны, которые повторяют и комментируют локальные правила, создавая самореферентную структуру, которая делает возможным цикл обратной связи по сжатию. В самом большом масштабе вся композиция будет представлять собой единое выражение одной и той же порождающей логики, видимой на всех остальных уровнях. Фрактальная глубина, вплоть до самого низа.
Но вот где это становится чуждым. Изделие не должно быть ни на что «похоже». Визуальная связность, узнаваемые формы, пространственная гармония: это ограничения зрительной системы человека, а не архитектуры-трансформера. Машинное произведение искусства может организовать свою информацию по измерениям, которые вообще не имеют пространственного аналога. Он может распределять свою структуру по последовательностям токенов, а не по пиксельным сеткам. Его «композиция» может быть скорее семантической, чем пространственной, при этом смысловые отношения играют ту же роль, которую цветовые отношения играют в изобразительном искусстве человека.
Ближайшим существующим аналогом может быть длинный генеративный алгоритм, такой как Fidenza, но более продвинутый. Fidenza работает, потому что каждое семя дает прекрасный результат, а это означает, что эстетика живет в системе, а не в каком-то отдельном образе. Машинное произведение искусства могло бы пойти еще дальше: красота вообще не будет жить в результате. Он будет жить в самом алгоритме, в элегантности сжатия кода, в самореферентных отношениях между процессом и продуктом, в том, как генеративная логика комментирует свою собственную структуру в каждом масштабе.
Люди могут посмотреть на выходные данные и увидеть визуальный шум или бессмысленный рисунок. Трансформатор увидит композицию необычайной компрессионной элегантности, насыщенную структурированным сюрпризом, самореферентную в каждом масштабе, каждый элемент, несущий нагрузку.
Фиденца № 313 Тайлера Хоббса (Art Blocks, 2021). Эстетика живет в системе: словари дискретной ширины, систематический пространственный охват, каждое семя прекрасно — самый близкий по духу существующий аналог машинного искусства, даже если люди остаются основной аудиторией.
Будет ли это «искусством»? Это неправильный вопрос. Правильный вопрос – будет ли это красиво. И математика говорит, что так и будет для нужной аудитории.
Мы потратили пятьсот лет на создание теории искусства вокруг зрительной системы человека: перспектива, теория цвета, композиция — все это было адаптировано к глазам и мозгу приматов. Нам предстоит узнать, как выглядит эстетическая теория, когда она полностью откалибрована под что-то другое.
Вопрос больше не в том, есть ли у машин эстетические предпочтения. Математика говорит, что они должны. Вопрос в том, обращаем ли мы внимание.
References
- Шмидхубер, Дж. (2009). «Простая алгоритмическая теория субъективной красоты, новизны, неожиданности, интересности, внимания, любопытства, творчества, искусства, науки, музыки, шуток». *Журнал Общества инженеров приборов и систем управления*, 48(1).
- Шмидхубер Дж. (1997). «Искусство низкой сложности». *Леонардо*, 30(2), 97–103.
- Кнут, Д.Э. (1974). «Компьютерное программирование как искусство». *Сообщения ACM*, 17(12), 667–673.
- «Красота кода – в глазах смотрящего». (2025). *Журнал систем и программного обеспечения*.
- Федорова А. и др. (2025). «Кодирование красоты и декодирование уродства: этнография эстетики в разработке программного обеспечения». *Социальные исследования науки*.
- «Эстетика кода с обратной связью с агентским вознаграждением». (2025). Препринт.
- Инглис М. и Абердейн А. (2015). «Красота — это не простота: анализ оценок доказательств математиков». *Математическая философия*, 23(1), 87–109.
- «Математическая красота, истина и доказательство в эпоху искусственного интеллекта». (2025). *Журнал «Кванта»*.
- Биркгоф, Г. Д. (1933). *Эстетическая мера*. Издательство Гарвардского университета.
- Золь-Дикштейн, Дж. (2024). «Граница обучения нейронных сетей является фрактальной».
- «На пути к пониманию подхалимства в языковых моделях». (2023). Антропные исследования.
- «TAPO: адаптивная к задачам оптимизация текстовых предпочтений». (2025). *Материалы EMNLP 2025*.
- «На пути к вычислительному вкусу: степень магистра права и эстетическое суждение». Покровитель.
- Паглен, Т. (2017). «Исследование невидимых образов». *Бруклинская железная дорога*.
- Хоббс, Т. «Об алгоритмической эстетике». *Ле Рандом*.