Hesaplamalı araştırma makalesi incelemesi

DOI: 10.1038/s41587-023-01773-0

Foldseek ile Hızlı ve Hassas Protein Yapısı Arama Algoritması

Yapay zeka tabanlı protein yapısı tahmin yöntemlerinin milyonlarca yeni protein yapısı üretmesi, yapısal biyoloji ve biyoinformatik alanında devasa veri tabanlarının oluşmasını sağlamıştır. Ancak bu devasa veri tabanlarında benzerlik araması yapmak mevcut hizalama araçlarının yüksek hesaplama maliyetleri nedeniyle bir darboğaz oluşturmaktadır.

Yazar
van Kempen M et al.
Yayın
Tarih
2023-05-08
01

Makalenin Kapsamı ve Akademik İçeriği

AlphaFold2 ve ESMFold gibi yapay zeka tabanlı protein yapısı tahmin yöntemlerindeki son gelişmeler, biyolojik bilimlerde devrim niteliğinde bir dönüşüm yaratmış ve yüz milyonlarca doğruluğu yüksek protein yapısının kamuya açık veri tabanlarında depolanmasını sağlamıştır. Ancak bu devasa veri tabanlarında benzer yapıların aranması ve analiz edilmesi mevcut hesaplama yöntemleri için ciddi bir darboğaz haline gelmiştir. Geleneksel dizi hizalama araçları son derece hızlı çalışmasına rağmen evrimsel açıdan uzak ilişkileri tespit etmede yetersiz kalmakta, üç boyutlu hizalama yapan klasik araçlar ise yüksek hassasiyet sunmalarına karşın devasa ölçekteki verilerle başa çıkamayacak kadar yavaş çalışmaktadır. Dolayısıyla, doğruluktan ödün vermeden protein yapılarını saniyeler içinde karşılaştırabilecek yeni nesil algoritmaların geliştirilmesi biyoinformatik alanında kritik bir ihtiyaçtır.

Bu ihtiyacı karşılamak amacıyla tasarlanan Foldseek algoritması, proteinlerin üçüncül yapılarındaki amino asit etkileşimlerini yapısal bir alfabe üzerinden dizilere dönüştürerek hizalama süresini radikal bir biçimde kısaltmaktadır. Çalışmada geliştirilen 20 durumlu 3B Etkileşim (3Di) alfabesi, protein omurgasındaki yerel konformasyonlar yerine kalıntıların uzaysal olarak en yakın komşularıyla olan geometrik ilişkilerini tanımlamaktadır. Metodolojide, bu yapısal alfabe kullanılarak dönüştürülen diziler üzerinde MMseqs2 tabanlı hızlı k-mer ve boşluksuz prefiltre modülleri çalıştırılmakta, ardından Smith-Waterman yerel hizalama algoritması uygulanmaktadır. Küresel hizalama gereksinimleri için ise TM-align algoritmasının SIMD yönergeleriyle hızlandırılmış bir versiyonu olan Foldseek-TM entegrasyonu sunulmuştur.

Performans değerlendirme testlerinde Foldseek, tek alanlı SCOPe40 veri tabanında yapılan tüm eşleştirmelerde Dali ve TM-align araçlarından sırasıyla 184.600 ve 23.000 kat daha hızlı sonuç vermiş, SARS-CoV-2 RdRp yapısıyla yapılan aramayı ise Dali 10 günde, TM-align 33 saatte tamamlarken Foldseek yalnızca 6 saniyede gerçekleştirmiştir. Algoritma, hız avantajının yanı sıra hassasiyet açısından da Dali'nin %86'sına, TM-align'ın %88'ine ulaşmış, CE algoritmasını ise %133 oranında geride bırakmıştır. Ayrıca çok alanlı ve tam uzunluktaki AlphaFold2 protein modellerinde yapılan referanssız hassasiyet testlerinde, 3Di alfabesinin yüksek bilgi yoğunluğu ve düşük yanlış pozitif oranı sayesinde hem hassasiyet hem de hizalama kalitesinde yüksek doğruluk elde edildiği ampirik olarak kanıtlanmıştır.

Foldseek, biyoinformatik literatüründe uzun süredir aşılması zor kabul edilen yapısal benzerlik arama hız limitlerini ortadan kaldırarak yapı tabanlı protein analizi çağını başlatmıştır. Çalışmanın sunduğu yüksek hızlı ve hassas arama kabiliyeti, gelecekte dizi tabanlı homoloji çıkarımının yerini büyük ölçüde yapı tabanlı analizlerin almasına zemin hazırlamaktadır. Özellikle metagenomik veri tabanlarının ve yeni keşfedilen protein ailelerinin hızlıca işlevsel olarak etiketlenmesinde bu yeni yaklaşım vazgeçilmez bir araç niteliğindedir. Sonuç olarak, protein evrimi, fonksiyon tahmini ve rasyonel ilaç tasarımı alanlarında çalışan araştırmacılar için devasa yapı veri tabanlarını saniyeler içinde sörgülamak Foldseek sayesinde pratik ve erişilebilir bir hale gelmiştir.

Araştırmanın amacı

Devasa protein yapısı veri tabanlarında, geleneksel yapısal hizalama araçlarının yüksek hassasiyet seviyelerini korurken arama hızını dört ila beş büyüklük derecesi oranında artıran Foldseek adlı hızlı ve hassas bir protein yapısı arama algoritmasının geliştirilmesi ve doğrulanmasıdır(M et al., 2023).

İnceleme ve modelleme yöntemi

Foldseek, protein yapılarını karşılaştırma işlemini hızlandırmak amacıyla, proteinlerin üçüncül amino asit etkileşimlerini 3Di (3-boyutlu etkileşim) adı verilen 20 durumlu özel bir yapısal alfabe kullanarak tanımlar ve yapısal hizalamaları hızlı dizi hizalama algoritmalarına dönüştürür(M et al., 2023).

Kuramsal ve kavramsal çerçeve

Çalışma, yapısal biyoinformatik çerçevesinde, protein yapılarının yerel omurga konformasyonları yerine üçüncül amino asit etkileşimleri üzerinden temsil edilmesi kuramına dayanmaktadır. Geliştirilen 20 durumlu 3Di alfabesi, amino asit kalıntıları arasındaki geometrik ilişkileri vektörel ve açısal özelliklerle kodlayarak yapı karşılaştırma problemini daha hızlı çözülebilen dizi hizalama problemine indirgemektedir.

Makalenin ele aldığı literatür

Makale, dizi tabanlı homoloji çıkarım yöntemlerinin uzak evrimsel ilişkileri tespit etmedeki sınırlarını ele almaktadır. Aynı zamanda Dali, TM-align ve CE gibi üç boyutlu üst üste bindirme yapan geleneksel yapısal hizalama araçlarının yüksek hassasiyetlerine rağmen devasa veri tabanlarında çalışamayacak kadar yavaş olduğu literatürdeki çalışmalar üzerinden gösterilmiştir. CLE-SW ve 3D-BLAST gibi omurga tabanlı yapısal alfabe kullanan yöntemlerin ise hassasiyet kaybı yaşadığı vurgulanarak bu boşluğun doldurulması hedeflenmiştir.

Araştırma Tasarımı

Evren veya inceleme alanı
AlphaFoldDB, ESM Atlas, CATH ve Protein Data Bank (PDB) gibi geniş ölçekli protein yapısı veri tabanları.
Örneklem veya araştırma materyali
SCOPe 2.01 veri tabanından türetilen ve %40 dizi benzerliğine göre kümelenmiş 11.211 tek alanlı protein yapısından oluşan SCOPe40 seti ve AlphaFoldDB (sürüm 1) veri tabanından rastgele seçilen 100 çok alanlı sörgü yapısı.
Veri toplama süreci
Gemmi ve Foldcomp kütüphaneleri kullanılarak protein veri tabanlarındaki PDB/mmCIF formatlı koordinat dosyalarının taranması, omurga atomları ile C-beta koordinatlarının okunması yoluyla veri seti oluşturulmuştur.
Veri analiz yöntemi
Foldseek'in performans analizinde; SCOPe benchmark protokolü, ROC (AUROC1) eğrisi değerlendirmesi, hassasiyet-kesinlik (precision-recall) oranları ve HOMSTRAD hizalama kalite veri setleri üzerinden karşılaştırmalı testler yürütülmüştür.
3Di yapısal alfabesihizalama hızıhizalama hassasiyetiyanlış pozitif oranık-mer ön filtresiLDDT skoruTM-skoru

Araştırmanın Bulguları

01

Foldseek, SCOPe40 veri seti üzerinde yapılan testlerde geleneksel yapısal hizalama araçları olan TM-align ve Dali'den 4.000 kattan, CE aracından ise 21.000 kattan daha hızlı arama yapmaktadır(M et al., 2023).

02

Büyük ölçekli veri tabanlarında tam hızına ulaşan Foldseek, AlphaFoldDB üzerinde yapılan aramalarda Dali'den yaklaşık 184.600 kat ve TM-align aracından ise 23.000 kat daha hızlı sonuç üretir(M et al., 2023).

03

Geliştirilen 20 durumlu 3Di yapısal etkileşim alfabesi, her amino asit kalıntısının uzaysal olarak en yakın komşusuyla olan geometrik ilişkisini tanımlayarak yanlış pozitif oranını azaltır ve bilgi yoğunluğunu artırır(M et al., 2023).

04

Foldseek, devasa hız artışına karşın geleneksel yöntemlerin hassasiyet seviyesini büyük oranda koruyarak Dali'nin %86, TM-align'ın %88 ve CE'nin %133 hassasiyet düzeylerine ulaşmaktadır(M et al., 2023).

02

Bulguların Tartışılması ve Araştırmanın Sonucu

Bulguların Yazarlar Tarafından Yorumlanışı

Protein yapısı tahmin yöntemlerinin milyonlarca yeni yapı üretmesiyle birlikte, mevcut yapısal hizalama araçlarının işlem hızları büyük bir darboğaz haline gelmiştir. Geliştirilen Foldseek algoritması, bu kısıtlamayı aşmak için proteinlerin üçüncül etkileşim geometrilerini 20 durumlu bir 3Di alfabesiyle tanımlayarak yapı karşılaştırma problemini hızlı dizi hizalamasına dönüştürmüştür.

Yapılan SCOPe40 ve AlphaFoldDB testleri, Foldseek'in geleneksel araçlara göre devasa bir hız avantajı sunduğunu ortaya koymaktadır. Algoritma, hassasiyette kritik bir kayıp yaşamadan arama sürelerini dört ila beş büyüklük mertebesi kadar kısaltarak, normalde haftalar sürecek veri tabanı taramalarını saniyeler seviyesine indirmeyi başarmıştır.

Yazarlar, bu hız artışının arkasındaki temel etkenin 3Di alfabesinin yüksek bilgi yoğunluğu ve MMseqs2 tabanlı çift köşegenli k-mer ön filtreleme modülü olduğunu belirtmektedir. Geleneksel omurga tabanlı yapısal alfabelerin aksine, 3Di alfabesi üçüncül etkileşimleri yakalayarak korunan protein çekirdeklerindeki evrimsel sinyalleri daha hassas şekilde modellemektedir.

Sonuç olarak Foldseek, yapı tabanlı biyoinformatik analizlerin önündeki en büyük engel olan hesaplama süresi kısıtını ortadan kaldırarak AlphaFold veri tabanlarının tam potansiyeliyle kullanılmasının önünü açmıştır. Gelecekteki yapısal biyoloji çalışmalarında, geleneksel dizi benzerliği aramalarının yerini hızla bu tarz hassas yapısal arama motorlarının alacağı öngörülmektedir.

Bulguların Önceki Araştırmalarla Karşılaştırılması

Foldseek, protein yapılarını karşılaştırma hızında TM-align aracına kıyasla dört ila beş büyüklük derecesi oranında dramatik bir hız artışı sağlarken, yapısal benzerlikleri tespit etme hassasiyetinde TM-align'ın %88'ine ulaşarak yüksek doğruluk oranını korumayı başarmaktadır(M et al., 2023).

Sonuç Bölümünün Sunduğu Çıkarımlar

Protein yapısı tahmini alanındaki son gelişmeler sayesinde milyonlarca protein yapısının erişilebilir hale gelmesi biyoloji ve biyoinformatik alanlarında devrim yaratmıştır; Foldseek ise bu yapıların karşılaştırılmasındaki hız kısıtını tamamen kaldırarak yapı tabanlı analizlerin, geleneksel dizi tabanlı analizlerin yerini almasını sağlamaktadır(M et al., 2023).

Literatür Taraması İçin Sunduğu Çerçeve

Bu çalışma, yapay zeka tabanlı yapı tahmin araçlarının ürettiği yüz milyonlarca protein yapısının taranmasında ortaya çıkan hesaplama darboğazını çözen yenilikçi bir arama algoritması sunmaktadır. Klasik üç boyutlu yapısal hizalama yöntemleri yüksek doğruluk sunsalar da devasa veri tabanlarını taramak için gereken süreler bakımından pratik olarak uygulanamaz durumdadır. Çalışma, protein omurgasındaki üçüncül etkileşimleri 20 durumlu bir 3Di alfabesine dönüştürerek yapı hizalama problemini dizi hizalama hızına indirmektedir. Böylece literatürde yapısal biyoinformatik analizlerin ölçeklenebilirliğini kökten değiştirerek yapı tabanlı homoloji aramalarının dizi tabanlı aramaların yerini almasını sağlamaktadır.

Çalışma, önceki literatürde yer alan iki temel yaklaşımın sentezinden doğmuştur: TM-align ve Dali gibi geleneksel 3D/2D yapı hizalama araçlarının yüksek hassasiyeti ile MMseqs2 gibi gelişmiş dizi arama yazılımlarının hızı. Geleneksel omurga tabanlı yapısal alfabeler (3D-BLAST, CLE) yalnızca kısa omurga parçalarını tanımladığı için yüksek yanlış pozitif oranlarına yol açarken, bu makalede geliştirilen 3Di alfabesi kalıntıların uzaysal en yakın komşularıyla yaptığı üçüncül etkileşimleri kodlayarak evrimsel sinyali korumaktadır. MMseqs2 ön filtreleme altyapısının bu yeni alfabayla birleştirilmesi, önceki yöntemlerin yavaşlığını aşarak yapıyı dizi hızında aramayı başarmıştır.

Literatür taramalarında bu çalışma, AlphaFoldDB ve ESM Atlas gibi devasa yapısal veri tabanlarının metodolojik taranabilirliği konusunda referans bir kaynak teşkil etmektedir. Makale, yapısal korunumun dizi korunumuna kıyasla evrimsel süreçte daha yüksek düzeyde sürdürüldüğü bilgisini pratik bir arama motoruna dönüştürmüştür. Araştırmacılara, dizilim benzerliği düşük olan ancak aynı katlanmaya sahip protein ailelerinin ve işlevsel homologların hızlıca belirlenebileceğini kanıtlamaktadır. Bu durum, dizilim analiziyle tanımlanamayan bilinmeyen işlevli proteinlerin işlevsel annotation süreçlerinde yapısal aramaların nasıl bir köprü görevi gördüğünü açıkça göstermektedir.

Kaynakça

  1. Zhang, Y., Skolnick, J. (2005). TM-align: a protein structure alignment algorithm based on the TM-score. Nucleic Acids Res, 33(7), 2302-2309. https://doi.org/10.1093/nar/gki529
03

Tez ve Makale Araştırmalarında Kullanım

Makalenin doğrulanmış yöntemi, bulguları ve kuramsal çerçevesi; tez ve makale çalışmalarında kullanılacağı bölümle birlikte aşağıdaki üç araştırma taslağına dönüştürülmüştür.

01

Tez veya makalede kullanım · literatüre-review

Devasa protein yapı veri tabanlarında geleneksel 3D hizalama araçlarının arama süreleri büyük bir hesaplama darboğazı oluşturmaktadır.

Literatür taraması bölümünde, AlphaFoldDB veya ESM Atlas gibi veri tabanlarında geleneksel TM-align veya Dali araçlarıyla arama yapmanın aylar sürdüğü ve yüksek hesaplama maliyeti yarattığı iddiasını desteklemek için kullanılır(M et al., 2023).

Metagenomik Veri Setlerinde Bilinmeyen Protein İşlevlerinin Foldseek ile Yapısal Haritalanması

Araştırma sorusu
Dizilim homolojisi tespit edilemeyen metagenomik protein dizilerinin AlphaFoldDB üzerindeki Foldseek aramasıyla işlevsel olarak sınıflandırılma oranı nedir?
Yöntem taslağı
Metagenomik veri tabanlarından seçilen ve bilinen dizilim ailesi eşleşmesi bulunmayan 10.000 protein modeli materyal olarak alınacaktır. Foldseek webserver/CLI aracıyla AlphaFoldDB v4 veri tabanında 3Di tabanlı hizalama yapılacak, elde edilen yapısal homologların CATH ve UniProt işlevsel etiketleri eşleştirilerek istatistiksel z-skor ve LDDT dağılımları analiz edilecektir. Örneklem büyüklüğü %95 güven aralığı ve %1 hata payı hedefiyle güç analizi kullanılarak belirlenecektir.

Makaleyle bağlantısı: Makalede Foldseek'in dizilim homolojisiyle tespit edilemeyen uzak evrimsel ilişkileri yapıyı dizi hızında arayarak ortaya koyabildiği ve AlphaFoldDB verilerini tarayabildiği gösterilmiştir(M et al., 2023).

02

Tez veya makalede kullanım · Kavramsal çerçeve

Proteinlerin üçüncül etkileşim geometrileri, 20 durumlu 3Di alfabesiyle temsil edilerek yapısal hizalama dizi hizalaması hızına indirgenebilir.

Kavramsal çerçevede, yapısal alfabelerin tasarımı ve uzaysal komşuluk ilişkilerinin 20 durumlu ayrık sembollerle ifade edilmesinin bilgi yoğunluğunu artırdığı ve yanlış pozitifleri azalttığı kuramsal olarak açıklanırken kaynak gösterilir(M et al., 2023).

Çok Etki Alanlı Proteinlerde 3Di ve TM-align Tabanlı Hizalama Performanslarının Karşılaştırılması

Araştırma sorusu
Esnek ilmek bölgelerine sahip çok etki alanlı (multi-domain) proteinlerin hizalanmasında Foldseek'in yerel 3Di skorlaması ile global TM-align skorlamasının hassasiyet farkı nedir?
Yöntem taslağı
AlphaFoldDB'den rastgele seçilen multi-domain protein modellerinden veri doygunluğu ilkesine göre oluşturulmuş 500 test yapısı kullanılacaktır. Hem Foldseek yerel Smith-Waterman 3Di algoritması hem de Foldseek-TM modülü çalıştırılarak LDDT ve TM-skoru üzerinden etki alanlarının bağıl oryantasyon bağımsızlığı nicel olarak karşılaştırılacaktır.

Makaleyle bağlantısı: Yazarlar, esnek etki alanı oryantasyonuna sahip çoklu segmented yapılarda Foldseek'in global TM-align'a göre daha doğru hizalama ürettiğini ve yanlış pozitifleri baskıladığını tartışmaktadır(M et al., 2023).

03

Tez veya makalede kullanım · method

Foldseek algoritması, SCOPe40 veri setindeki hizalama testlerinde TM-align ve Dali araçlarına göre 4.000 kattan fazla hız artışı sağlamaktadır.

Yöntem veya karşılaştırmalı performans analizlerinde, geliştirilen biyoinformatik boru hatlarının arama hızı verimliliğini değerlendirmek ve Foldseek benchmark ölçütlerine atıfta bulunmak amacıyla kullanılır(M et al., 2023).

Sentetik Protein Tasarımında 3Di Alfabesi Tabanlı Yapısal Doğrulama Boru Hattının Geliştirilmesi

Araştırma sorusu
De novo tasarlanan yapay proteinlerin hedef katlanma yapısıyla olan benzerliği, 3Di alfabesi tabanlı k-mer arama skorlarıyla ne derece yüksek doğrulukla tahmin edilebilir?
Yöntem taslağı
De novo protein tasarım yazılımlarıyla üretilen 5.000 sentetik protein omurgası materyal olarak kullanılacaktır. Tasarlanan omurgaların 3Di dizileri türetilerek PDB100 veri tabanında Foldseek ile taranacak ve elde edilen bit-score ile yapısal LDDT değerlerinin korelasyonu Pearson testiyle incelenecektir.

Makaleyle bağlantısı: Çalışmada 3Di alfabesinin kalıntılar arasındaki uzaysal etkileşimleri 20 ayrı durumda yüksek bilgi yoğunluğu ile kodladığı ve hızlı yapısal doğrulama için uygun olduğu gösterilmiştir(M et al., 2023).