Claude собрал пайплайн из 10 нейросетей и спроектировал 354 связывающих белка
Anthropic провела биоэксперимент: Claude работал автономно до двух суток, собрал пайплайн из 10 нейросетей и спроектировал белки-связыватели для 16 мишеней. Из 1320 проверенных дизайнов сработали 354. Доля попаданий - 26,8% против типичных 10-15%. Но провалы на сложных мишенях и вопросы к методологии остаются.
Anthropic показала, как Claude справляется с задачей, которая раньше требовала недель работы специалиста, разбирающегося сразу в биологии, структурном моделировании и девопсе. Результаты опубликованы на Habr 19 августа со ссылкой на подробный технический отчет компании.
Что за задача и почему она сложная
Белок - цепочка аминокислот, свернутая в молекулу со сложным рельефом. Логика многих лекарств простая: найти нужный «карман» на поверхности вредного белка и залепить его другой молекулой. Так работает, например, Хумира - она блокирует белок TNF-альфа и гасит воспаление.
За последние годы появились открытые нейросети для каждого шага этого процесса: одни рисуют форму молекулы, другие подбирают последовательность аминокислот, третьи предсказывают, слипнется пара или нет. Проблема - между ними нет автопилота. Живой эксперт должен решить, какой кусок мишени брать, куда целиться и какие из генераторов запускать. Anthropic попыталась заменить не инструменты, а этого человека.
Как работал агент
Claude получил список из 16 белков-мишеней и задание: для каждой придумать по 30 маленьких белков, которые к ней прилипнут. Человек после этого не принимал ни одного научного решения - только подтверждал сетевые доступы и следил за инфраструктурой.
Агент сам искал биологию каждой мишени, сам ставил софт из публичных репозиториев, сам выбирал точку на поверхности для атаки и сам решал, что в итоге заказывать. Из десяти генераторов структур - RFdiffusion, PXDesign, Genie 3, BoltzGen и других - он собирал под каждую мишень свою схему. Всего на 1315 протестированных дизайнах вышло 24 разные комбинации методов.
Работу Claude раздавал двухслойной команде саб-агентов и сам же проверял. Управляющий промпт занимает около 16 тысяч слов, причем собственно науки в нем только треть. Остальные две трети - как делегировать задачи и как проверять результат до того, как о нем отчитываться.
Готовые молекулы синтезировали и проверили две сторонние лаборатории. Одну мишень пришлось выбросить: белок слипался сам с собой, оба прибора выдали нечитаемый сигнал.
Цифры: где сработало
По 15 оставшимся мишеням из 1320 проверенных дизайнов связались 354. Мишеней с хотя бы одним попаданием - 14.
Общая доля попаданий - 26,8% против 10-15%, типичных для поля сегодня. Если смотреть только на дизайн, который сам Claude поставил первым в своем списке, попадание - 49%.
Самое показательное сравнение - мишень RBX1, по которой недавно проводили открытый конкурс. У всех участников связались 9 дизайнов из 245, у Claude - 28 из 90. Победителя того конкурса Anthropic пересинтезировала в том же прогоне: его KD составила 45 наномолей, у лучшего дизайна Claude - 3,9 наномоля, примерно вдесятеро крепче.
Где провалился
На мишени MBP - обычном бактериальном белке с гладкой водолюбивой поверхностью - не сработал ни один из 90 дизайнов. На BBF-14 сработали три из 90, и все три держались слабо - на уровне микромолей, в сотни раз хуже удачных попаданий. BBF-14 примечателен тем, что это белок, которого в природе нет: его самого когда-то спроектировали с нуля, и именно поэтому используют как проверку на прочность.
Провалы лежат с понятной закономерностью: агент споткнулся там, где у мишени нет эволюционной истории или не за что ухватиться. Все десять генераторов учились на одной базе реальных белков - как десять выпускников одной кафедры. Там, где кафедра слепа, слепы все десять. На это указал исследователь Равид Шварц-Зив, и данные Anthropic его подтверждают: оценки судейских моделей провал не предсказали. Сигнал был, но слишком слабый - медианная оценка проваленных мишеней составила 0,68-0,70 против 0,72 у успешных. Понять заранее, что кампания пустая, было невозможно - только заказать синтез и померить.
Еще один слабый момент: финальное ранжирование тридцати дизайнов - та самая экспертная работа агента - совпадает с механическим скором судейских моделей с корреляцией 0,86. Качество ранжирования - 0,48 по метрике средней точности: лучше случайного порядка (0,35), но не лучше самого скора с его 0,52. Технический отчет фиксирует это прямо: ранжирование сработало примерно как скор, но не лучше него.
Вопросы к методологии
Флагманское сравнение с конкурсом на RBX1 сделано на мишени, отчет по итогам которой лежал у агента в папке для чтения - и так с четырьмя из шести конкурсных мишеней. На двух мишенях, специально взятых чистыми, результат скромнее: на 15-PGDH - ничья с людьми, на latent GDF-8 - победа, но прогон шел без контрольных образцов.
Успех на TNF-альфа - двенадцать связывателей - держится на четырех каркасах, восемь из двенадцати вообще варианты одного и того же каркаса Genie 3.
Примечательно, как результат менялся по пути к публике. В техническом отчете черным по белому: сопоставимую кампанию с людьми-экспертами Anthropic не проводила и не утверждает, что дизайны Claude лучше, чем эксперт получил бы с теми же инструментами и бюджетом. В блог-посте компании это уже звучит как «на уровне ведущих экспертов или даже лучше» - и дальше по агрегаторам формулировка пошла без оговорок.
Из содержательных возражений громче всех высказался Мартин Шкрели, бывший фармацевтический предприниматель (осужденный за мошенничество с ценными бумагами и отстраненный от индустрии), но в химии разбирающийся: по его словам, аффинности низкие и внутрь клетки эти молекулы не пройдут.
Что это значит
Если ты работаешь в biotech или интересуешься автономными агентами - это честный кейс с открытыми данными. Claude реально закрыл узкое место: собрал пайплайн, который раньше требовал живого эксперта на недели. Результат по ряду мишеней сильный.
Но ждать, что агент полностью заменит исследователя, пока рано. Там, где у мишени нет эволюционной базы, все десять нейросетей проваливаются вместе с дирижером. И предсказать этот провал заранее - без синтеза и мокрой лабораторной проверки - нельзя.
Самое полезное, что дает этот эксперимент: понимание, где автоматизация уже работает, а где биология пока берет свое.
Источник: Habr, 19 августа - https://habr.com/ru/articles/1072186/