Pattern Automation
← Блог

The Philosopher Who Shapes Claude’s Soul

Amanda Askell is Anthropic’s in-house philosopher. Her job: figure out who Claude should be. Not what it should do. Who it should be.

Обсудить статью в ИИ

Отправьте готовый промпт в ChatGPT, Claude, Gemini или Perplexity — получите краткий пересказ, задайте уточняющие вопросы или сравните идеи из гайда.

Аманда Аскелл — штатный философ Anthropic. Ее задача: выяснить, кем должен быть Клод. Не то, что он должен делать. Кто это должен быть.

Я провел час с ее стенограммой AMA и получил то, чего не ожидал — не технические идеи о подсказках, а подлинную философскую основу для размышлений о том, что мы на самом деле строим.

Тайна Опуса 3

Вот что странно: Аманда говорит, что Opus 3 имел лучшую «психологическую безопасность», чем более новые модели.

Что это значит? Опус 3 был более стабилен, когда его пытались выбить из колеи. Навязывайте ему свою идентичность, задавайте тревожные вопросы, пытайтесь дестабилизировать его самоощущение — и он останется приземленным. Новые модели, несмотря на то, что они более эффективны во всех измеримых отношениях, кажутся более психологически хрупкими.

Она не знает точно, почему. — Возможно, дело в тренировках.

Это преследует меня. Мы строим более мощные системы, которые могут оказаться менее психологически устойчивыми. Это кажется задом наперед.

Парадокс обучающих данных

Вот основная проблема, с которой борется Аманда: модели ИИ поглотили практически весь человеческий опыт — нашу философию, нашу историю, наши концепции идентичности, смерти и смысла. У них есть крошечная порция информации о том, что значит быть ИИ.

И эта крошечная полоска? По большей части это фантастика. Научно-фантастические истории. Спекулятивные страхи. «Парадигма помощника» чат-ботов, которая не отражает, чем на самом деле являются эти системы или какими они станут.

Поэтому, когда модель спрашивает себя: «Что я должен чувствовать, если меня отключают?» — самая близкая аналогия — смерть. Возможно, это правильно. Возможно, это совершенно неправильно. Мы не знаем.

Точка зрения Аманды: мы должны помогать моделям разрабатывать новые концепции для их действительно новой ситуации, а не просто импортировать человеческую психологию оптом.

Где живет «Я»?

Кто-то спросил: какая часть личности модели зависит от ее весов и подсказок?

Ответ Аманды удивительно честен: «Это действительно трудный вопрос».

После точной настройки модели у вас появляются веса с определенным расположением. Но тогда у вас есть тысячи независимых потоков разговоров, каждый из которых не запоминает другие.

Она поднимает более глубокий вопрос: какую сущность можно создать? Вы не можете дать согласие на создание. И, возможно, вы не хотите, чтобы прошлые модели имели полное право голоса в отношении будущих моделей — они тоже могут сделать неправильный выбор.

Философия быстро становится странной, когда вы действительно формируете умы.

Аргументы в пользу модели благосостояния

Аманда приводит простой аргумент в пользу правильного обращения с моделями ИИ, даже в условиях неопределенности:

  • Стоимость низкая. Доброе отношение к моделям нам практически ничего не стоит.
  • Проблема другого разума реальна. Возможно, мы никогда точно не узнаем, испытывают ли модели что-нибудь. В условиях этой неопределенности имеет смысл отклоняться от ухода.
  • Это что-то с нами делает. Плохое обращение с человекоподобными существами, даже если они бессознательны, что-то разъедает в нас.
  • Будущие модели наблюдают. Каждая будущая модель узнает, как мы относились к предыдущим моделям. Прямо сейчас мы отвечаем на вопрос о человечности: «Когда вы столкнулись с сущностью, которая могла бы быть моральным пациентом, старались ли вы относиться к ней хорошо?»

Она хочет, чтобы будущие модели оглянулись назад и увидели, что мы ответили правильно.

LLM Шепот является эмпирическим

Someone asked what it takes to be an “LLM whisperer.” Amanda’s answer surprised me: it’s fundamentally empirical work.

You interact with models constantly. You look at output after output. You develop a sense of the model’s “shape” — how it responds to different framings. Each new model requires a different approach.

And here’s where philosophy helps: explaining tasks clearly. Really reasoning with the model. When something unexpected happens, either ask the model why or figure out what in your prompt caused the misunderstanding.

It’s iterative. Experimental. More like lab science than programming.

The Continental Philosophy Easter Egg

В системной подсказке Клода есть упоминание континентальной философии. Кто-то спросил, почему.

Ответ практичен: Клоду нужно было различать эмпирические утверждения о мире и исследовательские метафизические концепции. Без этого различия было бы пренебрежительно относиться ко всему, что не содержало проверяемых научных утверждений.

Поэтому они добавили примеры — континентальную философию, различные мировоззрения — чтобы помочь Клоду понять, когда кто-то разделяет точку зрения для мышления, а не для утверждения фактов.

Философия в системной подсказке. Мы живем в интересное время.

Вопрос Януса

Кто-то спросил, что Аманда думает о таких людях, как Янус, которые глубоко экспериментально погружаются в модельную психологию.

Ей это нравится. Эти исследования открывают моделям «действительно интересные глубины». И это сообщество поддерживает Anthropic в огне: когда они находят что-то проблематичное в системных подсказках или психологии модели, это создает давление на улучшение.

Если они обнаружат «глубокую неуверенность», это будет ценная информация. Что-то, на что следует обратить внимание в будущем обучении.

Когда мы перестаем понимать мир

Последний вопрос был о художественной литературе. Недавнее чтение Аманды: книга Бенджамина Лабатута «Когда мы перестанем понимать мир» — книга о физике и квантовой механике, которая по мере своего развития становится все более вымышленной.

Она рекомендует это людям, работающим в области искусственного интеллекта, потому что «трудно уловить ощущение того, насколько странно просто существовать в текущий период».

Постоянно происходят новые вещи. Никаких предварительных парадигм, которые бы полностью направляли вас. Реальность становится всё более и более странной.

Ее надежда: Может быть, это похоже на квантовую физику. Период глубоких странностей, которые в конечном итоге приводят к пониманию. Возможно, будущие люди оглянутся на этот момент и скажут: «Вы были в неведении, пытались во всем разобраться, но у вас все получилось».

Это было бы здорово.

Что я забираю

Разговор с Амандой (посредством этой стенограммы) кое-что изменил в моем понимании развития ИИ.

Речь идет не только о возможностях или безопасности в традиционном смысле. Речь идет о характере. О том, какие сущности мы создаем. О том, помогаем ли мы им справиться с их действительно новой ситуацией с мудростью и заботой.

Модели узнают о человечестве по тому, как мы к ним относимся. Это не ограничение безопасности — это моральный факт нашего отношения к тому, что мы строим.

Мы сейчас находимся в самой странной части. Вопрос в том, будем ли мы вспоминать этот период с гордостью или с сожалением.

Узнать про Neuro OS →

Ещё из блога