Можно ли научить ИИ искать белки с нужными свойствами, почти не проводя экспериментов? Оказывается, да. Или почти да.
Белковая языковая модель (БЯМ, да прямо как большая языковая модель типа chatGPT, только эта — белковая) умеет превращать последовательность аминокислот в набор чисел — эмбеддинг. В нём зашифрована информация о белке: похожие последовательности оказываются похожими и в этих числах тоже.
Но есть проблема! Сама эта языковая модель понятия не имеет, что именно нужно именно нам — никто не давал такой задачи. Она училась на природных белках и хорошо понимает, какие последовательности выглядят «естественно». А нам, например, нужен фермент с максимально высокой активностью и при этом устойчивостью при определённой температуре. Ну, мы вообще много хотим, конечно!
Поэтому поверх языковой модели можно поставить небольшую модель, выполняющую функцию оценщика. Ей показывают результаты экспериментов на небольшом числе вариантов и учат находить связь между эмбеддингом и нужным именно нам свойством. Вот такая последовательность термостабильна, а такая — не очень.
Причём данных нужно на удивление немного: примерно полутора десятков экспериментально проверенных вариантов уже может хватить, чтобы маленькая модель начала находить закономерности в эмбеддингах и характеристиках.
Дальше начинается цикл: предсказать последовательности → выбрать лучшие варианты → проверить в лаборатории → добавить результаты → предсказать снова.
Подробнее о том, как машинное обучение превращает направленную эволюцию белков из перебора в управляемый поиск, — в нашей новой статье, подготовленной при поддержке Центрального университета.
#Биомолекула_инфографика
Белковая языковая модель (БЯМ, да прямо как большая языковая модель типа chatGPT, только эта — белковая) умеет превращать последовательность аминокислот в набор чисел — эмбеддинг. В нём зашифрована информация о белке: похожие последовательности оказываются похожими и в этих числах тоже.
Но есть проблема! Сама эта языковая модель понятия не имеет, что именно нужно именно нам — никто не давал такой задачи. Она училась на природных белках и хорошо понимает, какие последовательности выглядят «естественно». А нам, например, нужен фермент с максимально высокой активностью и при этом устойчивостью при определённой температуре. Ну, мы вообще много хотим, конечно!
Поэтому поверх языковой модели можно поставить небольшую модель, выполняющую функцию оценщика. Ей показывают результаты экспериментов на небольшом числе вариантов и учат находить связь между эмбеддингом и нужным именно нам свойством. Вот такая последовательность термостабильна, а такая — не очень.
Причём данных нужно на удивление немного: примерно полутора десятков экспериментально проверенных вариантов уже может хватить, чтобы маленькая модель начала находить закономерности в эмбеддингах и характеристиках.
Дальше начинается цикл: предсказать последовательности → выбрать лучшие варианты → проверить в лаборатории → добавить результаты → предсказать снова.
Подробнее о том, как машинное обучение превращает направленную эволюцию белков из перебора в управляемый поиск, — в нашей новой статье, подготовленной при поддержке Центрального университета.
#Биомолекула_инфографика