Исследователи Apple представили SimpleDesign — новую ИИ-модель для проектирования белков

В новом исследовании специалисты Apple подробно описали SimpleDesign — оптимизированную модель искусственного интеллекта, способную одновременно генерировать аминокислотные последовательности и пространственную структуру белков. Ниже приведены основные подробности.

Немного предыстории

В сентябре прошлого года исследователи Apple опубликовали исследование под названием «SimpleFold: Folding Proteins is Simpler than You Think» («SimpleFold: свертывать белки проще, чем вы думаете»), в котором описывался упрощенный подход к прогнозированию трехмерной структуры белка по его аминокислотной последовательности.

Если говорить кратко, SimpleFold использует модель сопоставления потоков (flow matching) для генерации 3D-структуры белка непосредственно на основе его аминокислотной последовательности.

Мы подробно рассказывали о сопоставлении потоков здесь, но суть заключается в том, что этот метод начинается с зашумленной случайной базы и выстраивает относительно прямой путь к окончательному результату. Это отличает его от диффузионных моделей, которые обычно работают путем итеративного удаления шума до получения финального продукта.

Обе технологии наиболее часто (или по крайней мере исторически) ассоциируются с генерацией изображений, хотя исследователи (включая специалистов Apple) также изучали возможность применения диффузионных моделей для генерации текста и кода.

Возвращаясь к SimpleFold: специалисты Apple объединили сопоставление потоков с универсальными блоками Transformer (обычно используемыми в генерации текста), что позволило модели избежать некоторых ресурсоемких подходов, которые традиционно применяются в моделях сворачивания белков, таких как знаменитая AlphaFold от DeepMind.

Теперь исследователи Apple представили SimpleDesign, которая переносит стремление к более простым и универсальным архитектурам, реализованное в SimpleFold, на более широкий круг задач по проектированию белков, а не только на прогнозирование их 3D-структуры.

SimpleDesign

Как объясняют исследователи Apple в новом исследовании под названием «SimpleDesign: A Joint Model for Protein Sequence and Structure Codesign» («SimpleDesign: совместная модель совместного проектирования белковых последовательностей и структур»):

Существующие модели часто полагаются на многоэтапный процесс обучения, на первом этапе которого автоэнкодеры преобразуют данные в латентные представления (токенизируют их). На втором этапе генеративная модель обучается на латентном представлении автоэнкодера (-ов), то есть выполняется генеративное моделирование в латентном пространстве. Мы предполагаем, что такое многоэтапное обучение не является необходимым для получения эффективных моделей совместного проектирования, и поэтому представляем SimpleDesign — результативную мультимодальную модель проектирования белков, обученную непосредственно в пространстве данных.

Иными словами, в то время как многие существующие модели белкового дизайна опираются на многоэтапный процесс, SimpleDesign учится генерировать аминокислотные последовательности и непрерывные 3D-структуры в ходе единого сквозного процесса обучения.

Многие современные модели совместного проектирования белков работают следующим образом: сначала они обучают отдельную модель для преобразования белковых структур в дискретные представления, или «токены». Затем они обучают генеративную модель работать с этими представлениями для создания новых белковых последовательностей и структур.

SimpleDesign пропускает этот промежуточный шаг, обучаясь напрямую на сопряженных аминокислотных последовательностях и 3D-координатах, вместо того чтобы предварительно сжимать белковые структуры в отдельное токенизированное представление.

Подход, который исследователи Apple использовали для обучения SimpleDesign, весьма интересен.

Они начали с более чем 2 миллионов пар «белковая последовательность — структура», взятых в основном из набора данных AFESM, который объединяет предсказанные структуры из базы данных AlphaFold и дополнительные образцы.

В процессе обучения обе части каждой пары подвергались искажениям: аминокислоты в последовательности случайно скрывались за замаскированными токенами, а в соответствующую 3D-структуру добавлялся шум.

Исследователи также варьировали степень искажения каждой из сторон. Если последовательность оставалась практически нетронутой, а структура сильно повреждалась, задача напоминала сворачивание белка, и модель должна была восстановить структуру по известной последовательности.

И наоборот: если структура оставалась целой, а последовательность была сильно замаскирована, это напоминало обратное сворачивание. В этом случае модель должна была сгенерировать последовательность, способную сформировать заданную структуру.

Когда же обе части были частично искажены, модель училась справляться с обеими задачами одновременно, что эффективно готовило ее к совместному проектированию белков.

Согласно исследованию, SimpleDesign продемонстрировала конкурентоспособные результаты в тестах по совместному проектированию белков, генерации структур и генерации последовательностей, несмотря на использование гораздо более простого конвейера обучения.

Исследователи также выяснили, что SimpleDesign способна создавать правдоподобные белковые структуры, а создаваемые ею аминокислотные последовательности в целом не уступают или даже превосходят те, что генерируются большинством конкурирующих мультимодальных моделей.

Наконец, авторы отметили, что результаты SimpleDesign пока ограничиваются компьютерными оценками, поскольку созданные белки не проходили экспериментальную проверку на предмет того, смогут ли они реально сворачиваться, функционировать или безопасно вести себя в живых биологических системах.

Тем не менее результаты выглядят весьма обнадеживающе, и само исследование (которое, разумеется, гораздо глубже раскрывает архитектуру SimpleDesign, процесс обучения, бенчмарки и результаты) безусловно заслуживает внимания.

Чтобы прочитать полную версию исследования, перейдите по этой ссылке.