Teknik mühendislik makalesi incelemesi
DOI: 10.1093/nar/gkac993InterPro Veritabanının 2022 Yılı Güncellemeleri, Pfam Entegrasyonu ve Yapay Zeka Tabanlı Yapısal Tahminlerin Biyoinformatik Platformuna Dahil Edilmesi
Genomik dizileme teknolojilerindeki hızlı gelişmeler ve maliyet düşüşleri, dizileme verilerinin benzeri görülmemiş bir ölçekte artmasına yol açmıştır. Ancak bu yüz milyonlarca ham protein dizisinin işlevsel ve yapısal olarak anlamlandırılması, hesaplama sürelerinin katlanarak büyümesi nedeniyle biyoinformatikte ciddi bir darboğaz oluşturmaktadır.
Makalenin anahtar kelimeleri
- Yazar
- Paysan-Lafosse T et al.
- Yayın
- Tarih
- 2023-01-01
Makalenin Kapsamı ve Akademik İçeriği
Genomik dizileme teknolojilerindeki devrim niteliğindeki gelişmeler, genomik ve proteomik veri miktarında katlanarak büyüyen bir artışa neden olmuştur. Yüz milyonlarca yeni protein dizisinin deneysel yöntemlerle laboratuvarda tek tek karakterize edilmesi zamansal ve mali açıdan imkânsız olduğundan, biyoinformatik disiplini gizli Markov modelleri, profiller ve örüntüler gibi tanısal imzalara dayalı otomatik işlevsel açıklama sistemlerine bağımlı hale gelmiştir. Protein ailelerini, alanlarını (domain) ve korunan bölgeleri sınıflandıran farklı veritabanları mevcut olmakla birlikte, her veritabanı farklı bir odak noktasına sahiptir. InterPro veritabanı, 13 uzmanlaşmış üye veritabanını tek bir merkezi kaynakta bir araya getirerek tekrarları azaltmayı ve küresel ölçekte en kapsamlı protein annotasyon altyapısını sunmayı hedeflemektedir.
Bu çalışma, InterPro veritabanının 90.0 sürümü kapsamında gerçekleştirilen veri güncellemelerini, teknik altyapı iyileştirmelerini ve web arayüzü yeniliklerini ayrıntılı olarak raporlamaktadır. Son iki yıllık süreçte 9 InterPro sürümü yayımlanmış, 1558 üye veritabanı imzası mevcut kayıtlara entegre edilmiş ve 3315 imza kullanılarak 3280 yeni InterPro kaydı oluşturulmuştur. Çalışmada kullanılan yöntemler, kuratörler tarafından yürütülen veri doğrulama süreçlerini, UniProtKB verilerinin sekiz haftalık döngülerle güncellenmesini ve açık kaynak React/Redux mimarisiyle geliştirilen dinamik web arayüz bileşenlerini içerir. Ayrıca, eskiyen altyapısı nedeniyle kapatılan Pfam web sitesinin sunduğu kritik işlevler InterPro platformuna aktarılmıştır.
Elde edilen bulgular, UniProtKB veritabanındaki protein dizilerinin toplam sayısının 189 milyondan 227 milyona yükselmesine rağmen, InterPro'nun dizi kapsama oranını %81,3'ten %82,0'ye çıkardığını göstermektedir. Bu küçük yüzdelik artış, yaklaşık 32 milyon ek protein dizisinin en az bir InterPro imzasıyla açıklanması anlamına gelmektedir. Platforma ayrıca yapay zeka tabanlı 3B yapı tahminleri sunan AlphaFold DB ve RoseTTAFold modelleri entegre edilmiştir. Yapısal verisi bulunmayan Pfam aileleri için RoseTTAFold ile üretilen temas haritaları ve AlphaFold modelleri kullanıcıların hizmetine sunulmuştur. Taksonomi dağılımlarını görselleştirmek için güneş patlaması (sunburst) grafik tasarımları ve ölçekli alan mimarisi görselleri sisteme eklenmiştir.
Sonuç ve tartışma bölümünde yazarlar, yapay zeka ve derin öğrenme modellerinin (örneğin ProtENN ve AlphaFold2) protein yapısı ve işlevi tahmininde çığır açtığını, ancak bu modellerin veritabanı entegrasyonunda veri kalitesini koruma ve model güncellemelerindeki kararsızlıkları yönetme gibi yeni zorluklar getirdiğini vurgulamaktadır. Ayrıca PRINTS ve SFLD gibi fonu kesilen veritabanları için InterPro'nun koruyucu arşiv rolü üstlendiği belirtilmektedir. Bu çalışma, biyoinformatik, yapısal biyoloji ve yazılım mühendisliği alanlarında çalışan araştırmacılar için devasa proteom verilerinin anlamlandırılmasında ve yeni derin öğrenme araçlarının entegrasyonunda temel bir referans kaynağı oluşturmaktadır.
Araştırmanın amacı
Bu çalışmanın amacı, InterPro veritabanının (sürüm 90.0) ve ilişkili yazılımların son iki yıldaki veri içeriği güncellemelerini, Pfam web sitesi özelliklerinin InterPro platformuna entegrasyonunu, dizin kapsama oranlarındaki değişimi, yapay zeka destekli protein yapısı tahminlerinin veritabanına eklenmesini ve toplum katılımı amacıyla geliştirilen protein aileleri kart oyununu tanıtmaktır(T et al., 2023).
İnceleme ve modelleme yöntemi
Bu çalışmada, InterPro veritabanının 90.0 sürümü kapsamında 13 üye veritabanından sağlanan protein imzalarının entegrasyonu, yazılım altyapısının güncellenmesi, yapay zeka tabanlı 3D yapı tahminlerinin sisteme dahil edilmesi ve kullanıcı arayüzü iyileştirmelerini içeren teknik biyoinformatik geliştirme yöntemi uygulanmıştır(T et al., 2023).
Kuramsal ve kavramsal çerçeve
Çalışma, biyoinformatik veri entegrasyonu, profilleme gizli Markov modelleri (profile-HMMs), protein alan mimarisi analizi ve derin öğrenme tabanlı protein yapısı/işlevi tahmini kuramsal temellerine dayanmaktadır. Çoklu üye veritabanlarının (Pfam, CATH-Gene3D, CDD, PANTHER, PROSITE vb.) konsensus tabanlı birleştirilmesi esasına dayanır.
Makalenin ele aldığı literatür
Makale, biyomoleküler dizi annotation yöntemleri, Pfam (Mistry et al., 2021), CATH (Sillitoe et al., 2021), CDD (Lu et al., 2020), PANTHER (Mi et al., 2021) ve TreeGrafter (Tang et al., 2019) gibi üye veritabanlarının yayınları ile AlphaFold (Jumper et al., 2021; Varadi et al., 2021) ve RoseTTAFold (Baek et al., 2021) yapısal tahmin literatürünü ele almaktadır.
Araştırma Tasarımı
- Evren veya inceleme alanı
- UniProtKB veritabanı ve InterPro bünyesindeki 13 üye protein imza veritabanı (CATH-Gene3D, CDD, HAMAP, PANTHER, Pfam, PIRSF, PRINTS, PROSITE Patterns, PROSITE Profiles, SMART, SFLD, SUPERFAMILY, TIGRFAMs).
- Örneklem veya araştırma materyali
- UniProtKB veritabanında yer alan 227.339.951 protein dizisi ve InterPro 90.0 sürümüne entegre edilen 53.784 üye veritabanı imzası.
- Veri toplama süreci
- Sekiz haftalık düzenli sürüm döngüleriyle üye veritabanlarından aktarılan imza verileri, UniProt protein güncellemeleri ve uzman küratörler tarafından gerçekleştirilen literatür haritalama incelemeleri.
- Veri analiz yöntemi
- InterProScan yazılım altyapısı, gizli Markov modelleri (profile-HMM), TreeGrafter filogenetik yerleştirme aracı, RoseTTAFold ve AlphaFold2 derin öğrenme tabanlı yapı tahmin yöntemleri.
Araştırmanın Bulguları
InterPro 90.0 sürümünde toplam 40.597 girdi ve entegre edilmiş 53.784 üye veritabanı imzası yer almaktadır; bu durum UniProtKB veritabanındaki dizilerin kapsama oranını %81,3 seviyesinden %82,0 seviyesine yükseltmiş ve 32 milyon ek dizinin dizilim ve işlev bilgisiyle eşleşmesini sağlamıştır(T et al., 2023).
Eski ve güncellenmemiş girdilerin iyileştirilmesi kapsamında 2011 yılından beri güncellenmeyen 626 InterPro girdisi incelenmiş, bunlardan 198 adedi güncellenmiş; ayrıca bilinen PDB yapılarına sahip 123 InterPro ve 69 Pfam girdisi literatür haritalamasıyla yenilenmiştir(T et al., 2023).
PDB veritabanında deneysel üç boyutlu yapısı bulunmayan Pfam protein ailelerinin büyük bir çoğunluğu için RoseTTAFold derin öğrenme modeli kullanılarak 3D yapı modelleri ve temas haritaları üretilerek InterPro arayüzüne entegre edilmiştir(T et al., 2023).
Biyoinformatik kaynaklarının uzun vadeli finansman kısıtlamaları karşısında Pfam web sitesi kapatılarak tüm işlevsel özellikleri, taksonomi güneş patlaması (sunburst) görselleştirmeleri ve alan mimarisi araçları InterPro platformuna merkezi olarak aktarılmıştır(T et al., 2023).
Bulguların Tartışılması ve Araştırmanın Sonucu
Bulguların Yazarlar Tarafından Yorumlanışı
Elde edilen bulgular, InterPro veritabanının UniProtKB üzerindeki dizi kapsama oranını veritabanının muazzam büyümesine rağmen artırmayı başardığını ve 13 üye veritabanının imzalarını tek bir çatı altında başarıyla konsolide ettiğini göstermektedir. Platform, Pfam web sitesinin kapatılması sürecinde tüm işlevsel araçları bünyesine katmış ve taksonomi ile alan mimarisi görselleştirmelerini yeni arayüzüne dahil etmiştir.
Yazarlar, üye veritabanı güncellemelerinin yönetilmesi ve geçmiş girdilerin literatürdeki PDB yapılarıyla yeniden haritalanması için yürütülen manuel kürasyon süreçlerinin veritabanı kalitesini korumadaki kritik rolünü vurgulamaktadır. PANTHER alt ailelerinin güncellenmesinde yaşanan zorlukların TreeGrafter gibi ağaç tabanlı sınıflandırma araçlarıyla aşılması, veri kararlılığı ve işleme hızı açısından teknik bir çözüm olarak açıklanmaktadır.
Tartışma bölümünde önceki literatürle kurulan ilişkiler çerçevesinde, AlphaFold2 ve RoseTTAFold gibi yapay zeka tabanlı yapı tahmin yöntemlerinin biyomoleküler araştırmalara sağladığı katkılar değerlendirilmektedir. Ayrıca, dizilim gerektirmeyen derin öğrenme modeli ProtENN ile profil-HMM yaklaşımlarının karşılaştırılması, gelecekte protein işlev tahmininde yaşanabilecek paradigma değişimine işaret etmektedir.
Sonuç olarak InterPro, biyolojik veri kaynaklarının finansman zorlukları yaşadığı bir dönemde merkezi bir arşiv ve kullanıcı dostu bir web arayüzü sunarak protein araştırmalarında vazgeçilmez bir altyapı işlevi görmektedir. Yapay zeka modellerinin sunduğu imkânlar ile veri kalitesi arasındaki dengenin korunması, gelecekteki veritabanı sürümlerinin temel stratejisini oluşturmaktadır.
Bulguların Önceki Araştırmalarla Karşılaştırılması
Yazarlar, dizilim gerektirmeden amino asit dizilerini Pfam aileleriyle eğiterek işlevsel açıklama yapan ProtENN modelini (Bileschi et al., 2022) tartışarak, gelecekte derin öğrenme yaklaşımlarının geleneksel profil-HMM dizi hizalama yöntemlerinin önüne geçebileceğini ve veritabanı entegrasyonunda yeni imkânlar sunacağını belirtmektedir(T et al., 2023).
Çalışmada, PDB üzerinde deneysel yapısı henüz çözülememiş Pfam aileleri için RoseTTAFold (Baek et al., 2021) üç hatlı sınır ağı yöntemiyle üretilen üç boyutlu yapısal modellerin ve temas haritalarının InterPro veritabanına eklenerek araştırmacıların kullanımına açıldığı vurgulanmaktadır(T et al., 2023).
Sonuç Bölümünün Sunduğu Çıkarımlar
InterPro, protein aileleri, alanları ve işlevsel sahaların sınıflandırılmasında dünya genelindeki en kapsamlı konsolidasyon platformu olarak rolünü sürdürmektedir. Biyoinformatik veritabanlarının sürdürülebilirlik kısıtları nedeniyle Pfam gibi temel kaynakların arşivlenmesi görevini üstlenen platform, AlphaFold2 ve RoseTTAFold gibi yapay zeka tabanlı yapı tahmini modellerini altyapısına katarak moleküler biyoloji araştırmalarına yeni bir boyut kazandırmaktadır. Gelecekte ProtENN gibi derin öğrenme tabanlı dizi sınıflandırma yöntemlerinin sisteme entegrasyonuyla doğruluk ve kapsama alanının daha da genişletilmesi hedeflenmektedir(T et al., 2023).
Literatür Taraması İçin Sunduğu Çerçeve
Bu çalışma, dünya genelinde protein aileleri ve işlevsel alanların sınıflandırılmasında en kapsamlı konsolide kaynak olan InterPro veritabanının güncel durumunu, yeni üye veritabanı sürümlerini ve modern biyoinformatik araçlarının entegrasyonunu sunarak literatürde merkezi bir altyapı referansı işlevi görmektedir. Özellikle ampirik ve teorik çalışmalar için yapısal, işlevsel ve taksonomik verileri tek bir arayüzde birleştiren bir ekosistem sağlamakta, böylece araştırmacıların dizi analizlerini manuel olarak birden fazla platformda yapma zorunluluğunu ortadan kaldırmaktadır.
Çalışma, önceki InterPro sürümleri (özellikle InterPro 81.0) ve Pfam gibi uzun yıllar bağımsız hizmet vermiş ancak finansman ile bakım zorlukları nedeniyle kapatılma kararı alınmış köklü veritabanlarının mirasını devralarak genişletmektedir. Geçmiş literatürdeki profil-HMM ve imza tabanlı yaklaşımları korurken, modern yapay zeka modelleri (AlphaFold ve RoseTTAFold) ile üretilen yapısal verileri entegre ederek geleneksel dizi analizini üç boyutlu yapısal düzleme taşımakta ve önceki metodolojilerle doğrudan bağ kurmaktadır.
Bu çalışma, protein sekanslama maliyetlerinin düşmesiyle ortaya çıkan veri patlaması karşısında, biyoinformatik literatüründeki güncel kürasyon ve entegrasyon standartlarını belirleyerek önemli bir inceleme katkısı sunmaktadır. Farklı kaynaklardan gelen verilerin tekilleştirilmesi, eski veritabanı girdilerinin güncel literatür verileri ve PDB yapılarıyla yeniden haritalanması gibi manuel kürasyon süreçlerinin önemini ortaya koyarak, biyolojik veri bankacılığı literatüründe sürdürülebilirlik ve kalite kontrol standartlarını tartışmaya açmaktadır.
Kaynakça
- Bileschi, M. L., Belanger, D., Bryant, D. H., Sanderson, T., Carter, B., Sculley, D., Bateman, A., DePristo, M. A., & Colwell, L. J. (2022). Using deep learning to annotate the protein universe. Nature Biotechnology, 40(6), 932-937. https://doi.org/10.1038/s41587-021-01179-w
- Baek, M., DiMaio, F., Anishchenko, I., Dauparas, J., Ovchinnikov, S., Lee, G. R., Wang, J., Cong, Q., Kinch, L. N., Schaeffer, R. D., & Baker, D. (2021). Accurate prediction of protein structures and interactions using a three-track neural network. Science, 373(6557), 871-876. https://doi.org/10.1126/science.abj8754
Tez ve Makale Araştırmalarında Kullanım
Makalenin doğrulanmış yöntemi, bulguları ve kuramsal çerçevesi; tez ve makale çalışmalarında kullanılacağı bölümle birlikte aşağıdaki üç araştırma taslağına dönüştürülmüştür.
Tez veya makalede kullanım · literatüre-review
Biyoinformatik dizi analizi süreçlerinde tekil veritabanlarının ötesine geçilerek konsolide ve entegre platformların kullanılması, veri kapsama oranını ve analiz doğruluğunu artırmaktadır.
Bu iddia, makalenin giriş ve sonuç bölümlerinde sunulan, 13 farklı üye veritabanının InterPro çatısı altında birleştirilmesinin ve UniProtKB üzerindeki kapsama oranının %82'ye ulaştırılmasının ampirik kanıtlarıyla desteklenecektir(T et al., 2023).
Derin Öğrenme Tabanlı ProtENN Modeli ve Profil-HMM Yöntemlerinin Protein Ailesi Sınıflandırma Doğruluğunun Karşılaştırılması
- Araştırma sorusu
- Dizi hizalaması gerektirmeyen derin öğrenme modeli ProtENN, belirli protein ailelerinin sınıflandırılmasında geleneksel profil-HMM yöntemlerine kıyasla ne derece yüksek duyarlılık ve özgüllük sağlamaktadır?
- Yöntem taslağı
- Araştırmada UniProtKB veritabanından rastgele seçilecek ve veri doygunluğunu sağlayacak büyüklükte bir protein sekansı örneklemi (örneğin güç analiziyle belirlenecek n=10.000 dizi) kullanılacaktır. Bağımsız değişken olarak ProtENN derin öğrenme modeli ve profil-HMM tabanlı InterProScan aracı kullanılacak, bağımlı değişken olarak sınıflandırma doğruluğu (F1 skoru, duyarlılık, özgüllük) analiz edilecektir.
Makaleyle bağlantısı: Yazarların tartışma bölümünde belirttiği üzere, ProtENN gibi derin öğrenme yöntemleri dizi hizalama gerektirmeden protein işlevi tahmin edebilmekte ve profil-HMM modellerine karşı bir alternatif oluşturmaktadır. Bu durum ampirik olarak test edilmeye değerdir(T et al., 2023).
Tez veya makalede kullanım · Kavramsal çerçeve
Derin öğrenme ve yapay zeka tabanlı yapı tahmin modelleri, deneysel olarak çözülmemiş protein yapılarının açıklanmasında ve biyomoleküler araştırmaların hızlandırılmasında kritik bir rol oynamaktadır.
Tezin kavramsal çerçevesinde, AlphaFold2 ve RoseTTAFold modellerinin protein katlanma problemlerini çözmedeki başarısı ve bunların veritabanlarına entegrasyonunun biyoloji araştırmalarındaki önemi makalenin tartışma bulgularıyla temellendirilecektir(T et al., 2023).
Deneysel Yapısı Bulunmayan Bakteriyel Antibiyotik Direnç Proteinlerinin RoseTTAFold ile 3D Yapısal Modellemesi ve Doğrulanması
- Araştırma sorusu
- NCBIFAMs veritabanına yeni eklenen ve deneysel yapısı çözülmemiş bakteriyel antibiyotik direnç proteinlerinin RoseTTAFold ile üretilen 3D modellerinin yapısal kalitesi ve güvenilirliği nedir?
- Yöntem taslağı
- Araştırmada NCBIFAMs veritabanında yer alan ve PDB'de deneysel yapısı olmayan antibiyotik direnç proteinleri (örneğin n=100 protein) materyal olarak seçilecektir. RoseTTAFold algoritması kullanılarak 3D yapısal modeller ve temas haritaları üretilecek, pLDDT ve Ramachandran haritası analizleriyle yapısal doğruluk ve model kalitesi değerlendirilecektir.
Makaleyle bağlantısı: Makalede NCBIFAMs veritabanına eklenen antibiyotik direnç modellerine ve Pfam aileleri için RoseTTAFold ile 3D yapı tahminlerinin sisteme entegre edildiğine değinilerek bu alanda çalışma yapılması teşvik edilmektedir(T et al., 2023).
Tez veya makalede kullanım · Tartışma
Hizalama tabanlı protein sınıflandırma yaklaşımları (profil-HMM), gelecekte yerini derin öğrenme tabanlı hizalamasız (hizalama gerektirmeyen) dizi analiz yöntemlerine bırakma eğilimindedir.
Tezin tartışma bölümünde, geleneksel HMM modellerinin sınırlılıkları ve Google Research tarafından geliştirilen ProtENN gibi derin öğrenme tabanlı dizi işlev tahmin modellerinin sunduğu teknolojik paradigma değişimi tartışılırken bu kaynaktan yararlanılacaktır(T et al., 2023).
Yapay Zeka Tabanlı Yapı Tahmin Verilerinin Biyomedikal İlaç Keşif Süreçlerindeki Etkinliğinin Gözlemsel Analizi
- Araştırma sorusu
- AlphaFold2 ve RoseTTAFold tarafından tahmin edilen protein 3D modelleri, deneysel PDB yapılarına kıyasla sanal tarama (virtual screening) ve ligand bağlama afinitesi tahminlerinde ne kadar tutarlı sonuçlar vermektedir?
- Yöntem taslağı
- Araştırmada hem deneysel yapısı (PDB) hem de AlphaFold DB/RoseTTAFold modelleri bulunan terapötik hedef proteinler (örneğin n=50 hedef protein) materyal olarak belirlenecektir. Her iki yapı grubu için aynı ligand kütüphanesiyle moleküler kenetleme (docking) simülasyonları gerçekleştirilecek, bağlama enerjileri ve ligand pozisyonları korelasyon analizleriyle karşılaştırılacaktır.
Makaleyle bağlantısı: Makalenin tartışma bölümünde, yapay zeka tabanlı protein yapısı tahminlerinin moleküler biyoloji, ilaç keşfi ve hastalık tedavilerinde çığır açıcı fırsatlar sunduğu belirtilmektedir(T et al., 2023).