Исследователи представили новый метод сжатия данных о пространственной структуре белков, использующий генеративные модели для радикального уменьшения объема файлов без потери научной точности. Технология позволяет хранить и передавать сложные биологические данные в десятки раз эффективнее, что критически важно для развития фармакологии, дизайна лекарств и фундаментальных исследований в области молекулярной биологии и биоинформатики.

Традиционные форматы хранения данных о белках, такие как PDB, становятся громоздкими по мере роста баз данных, содержащих миллионы предсказанных структур. Новый подход использует нейросетевые архитектуры для кодирования координат атомов в компактные латентные представления. Это не просто архивация, а интеллектуальное сжатие, которое сохраняет ключевые геометрические и химические свойства молекул, необходимые для дальнейшего моделирования взаимодействий с потенциальными лекарственными препаратами.

Внедрение подобных инструментов ускоряет работу исследовательских лабораторий, позволяя быстрее обмениваться данными и проводить масштабные симуляции на менее мощном оборудовании. Метод открывает возможности для создания более доступных репозиториев биологической информации, что способствует демократизации доступа к высокоточным молекулярным моделям для широкого круга ученых.

Ключевые факты

  • Алгоритм позволяет сократить размер файлов с описанием белковых структур в 20–50 раз по сравнению со стандартными форматами.
  • Метод основан на использовании глубокого обучения для аппроксимации и восстановления трехмерных координат атомов.
  • Технология обеспечивает сохранение точности на уровне ангстремов, что достаточно для большинства задач молекулярного докинга.
  • Разработка призвана решить проблему «взрывного роста» данных в хранилищах, содержащих предсказания AlphaFold и аналогичных систем.