단백질 생성 모델 실험 데이터 정렬 기술 프로테인디피오 개발
연구진은 직접 선호도 최적화 알고리즘을 단백질 언어 모델에 적용하여 프로테인디피오를 개발했습니다. 이 모델은 180만 개의 단백질 접힘 안정성 측정 데이터를 학습하여 인플루엔자 단백질의 열 안정성을 개선했습니다. 이번 연구 결과는 국제 학술지 네이처 메소드에 발표되었습니다.
주장단백질 생성 모델에 실험적 안정성 데이터를 정렬하는 방식은 단백질 설계의 정확도를 높입니다. 기존 사전 학습 모델에 직접 선호도 최적화 알고리즘을 적용하면 효율적인 단백질 생성이 가능합니다.
팩트연구진은 직접 선호도 최적화 알고리즘을 단백질 언어 모델에 적용하여 프로테인디피오(ProteinDPO)라는 새로운 모델을 구축했습니다. 프로테인디피오는 약 180만 개의 단백질 접힘 안정성 측정 데이터를 학습했습니다.
팩트프로테인디피오는 인플루엔자 헤마글루티닌 단백질에 적용되었습니다. 이 모델은 항체 인식 기능을 유지하면서 단백질의 열 안정성을 개선했습니다.
교차검증기존 지도 학습 기반 모델인 테르모엠피엔엔(ThermoMPNN)과 비교했을 때, 프로테인디피오는 특정 작업에 특화된 학습 데이터 없이도 안정화 돌연변이를 찾아냅니다. 이는 범용적인 단백질 설계 모델로서의 가능성을 보여줍니다.
팩트프로테인디피오의 기반 모델인 이이에스엠-아이에프원(ESM-IF1)은 수백만 개의 예측 구조를 통해 역접힘을 학습했습니다. 프로테인디피오는 이 모델을 기반으로 실험 데이터와의 정렬을 최적화했습니다.
주장프로테인디피오가 역접힘 학습을 최적화함에 따라 단백질 설계 분야에서 실험 데이터와 생성 모델의 결합은 신약 개발 및 바이러스 대응 연구의 전환점이 됩니다. 복잡한 단백질 구조의 안정성을 예측하고 설계하는 과정에서 인공지능의 역할이 중요해집니다.
팩트연구 결과는 2026년 8월 14일 네이처 메소드(Nature Methods) 저널에 공식 발표되었습니다. 연구의 핵심 내용은 위다탈라(Widatalla) 등이 저술한 논문에 기술되었습니다.
교차검증단백질 생성 모델의 정렬 과정에서 데이터의 품질과 양은 모델의 성능을 결정합니다. 180만 건에 달하는 대규모 실험 데이터셋은 모델이 생물학적 타당성을 확보하는 데 기여했습니다.
주장타당성을 확보한 프로테인디피오는 특정 질병에 대한 맞춤형 단백질 설계뿐만 아니라 다양한 산업적 단백질 공학 분야에 적용됩니다. 인공지능이 단순한 예측을 넘어 실제 실험적 성과를 도출하는 단계로 진입합니다.
출처네이처 공식 웹사이트에 게시된 논문 내용과 위다탈라 등의 연구를 교차 검증했습니다. 추가로 쓰바야마 등의 연구 및 라파일로프 등의 연구 문헌을 교차 검증했습니다.
관련 콘텐츠
본 기사는 전문가의 분석과 공개 자료를 기반으로 AI가 작성 후 다른 AI의 검증을 거쳐 작성됐으며 정보의 정확성과 완전성을 보장하지 않습니다. 기사 내용은 특정 투자·의사결정의 권유가 아니며, Wittgenhaus는 이를 근거로 한 행위의 결과에 책임을 지지 않습니다.

