Evidence-guided paper · 2026 · independent-context · full-text
遠端同源偵測的蛋白質序列與結構搜尋方法獨立 benchmark
Yuan Liu; Yingquan Zhou; Yan Huang; Hongyi Xin; Xiaoyong Pan; Hong-Bin Shen. Benchmarking protein sequence and structure search methods for remote homology detection. Genome Biology, article in press (2026).
30 秒理解
以 14 種方法、5 種情境分開評估遠端同源檢索、殘基 alignment 與效率,避免只靠單一作者 benchmark。
核心問題
當 protein search 面對 fold、功能、多 domain、intrinsic disorder 與預測結構可信度五種情境時,哪一類方法在哪裡強,是否存在單一總冠軍?
直覺
這篇不把所有結果壓成一個分數,而是在五個生物情境以共同 top-10 protocol 比較 14 種 sequence、structure-alignment 與 representation 方法;每個情境用適合的 truth 與 metric。
為什麼重要
這是最新且獨立的全景校正:DALI 在 residue-level lDDT alignment 最高,GTalign/TM-align 接近,但搜尋任務沒有全面冠軍;FAST 未納入,因此它能界定現代候選,不能直接裁決 FAST。
閱讀前置
- 理解 retrieval ranking、residue alignment 與 functional consistency 是不同層。
- 知道 CATH、GO、TED、DisProt、AlphaFold pLDDT 各提供什麼標註。
- 能解讀 F1max、sensitivity-before-first-FP、lDDT 與 wall time。
paper-specific guide · plain → technical → input → output → source
逐步方法導讀
-
01 · 建立五個互補資料情境
同一方法分別面對乾淨 domain、低序列相似功能搜尋、多 domain、無序蛋白與高低可信預測結構,避免只在最有利資料上宣布冠軍。
論文語言: 資料來自 CATH-S20、AFDB SwissProt+GO、TED domain decomposition、DisProt 與 pLDDT-stratified AFDB。各資料以 CD-HIT 20% identity 去冗餘;query/target sets 依情境固定。
輸入: 公開結構、序列、domain、功能、disorder 與 confidence resources。
輸出: 五個有不同生物難點的 benchmark datasets。
邊界: 部分 SwissProt 來源可能與深度模型訓練資料重疊,無法完全排除 leakage。
PDF pp. 5–6, Fig. 2; PDF pp. 24–26, Methods: Benchmark datasets
-
02 · 以共同 top-10 protocol 跑 14 法
每個工具盡量多回傳 hits,再按自己的原生分數排序,只取前十;若不足十個,以固定亂數補非 hits,讓矩陣大小一致。
論文語言: 四個 structure aligners、六個 representation models、四個 sequence methods 使用公開版本與 default/recommended parameters。CATH 保留 PLMSearch/ERAST 的 PfamClan filter;reference-free scenarios 關閉,以減少外部 annotation confounding。
輸入: 各情境 query/target sets 與 14 種工具。
輸出: 每 query 的統一 top-10 ranked list 與 runtime。
邊界: random padding 會懲罰嚴格 filter 的方法;native scores 與搜尋 completeness 並未完全等價。
PDF pp. 6 and 29–33, Tables 1–2 and Evaluation protocol
-
03 · 按任務分別評分與解釋
fold 看排名是否在第一個錯誤前找回真鄰居;功能看 GO;多 domain 看局部距離;disorder 與 pLDDT 看穩健性;最後才做跨圖總覽。
論文語言: CATH 用 sensitivityFP1 與 per-query F1max;功能/disorder 用 Wang GO-MF semantic similarity;結構相似用 modified lDDT,對每 query-hit 取 DALI/TM-align/GTalign/Foldseek 四種 alignment 中最大 lDDT,再平均 top-10。
輸入: top-10 hits、標註與必要的 residue alignments。
輸出: 情境特定的 retrieval、functional、structural 與效率結果。
邊界: 取四 aligners 最大 lDDT 是 method-agnostic upper envelope,不等於每個 retrieval tool 自己能產生該 alignment。
PDF pp. 26–28, Evaluation tasks and metrics
關鍵結果
DALI 的 residue-level lDDT 最佳,GTalign/TM-align 接近;沒有任何方法在所有任務都是單一總冠軍。
逐節證據導讀
論文事實、本站判讀與教學模型分開標示。
paper-fact
residue alignment 的獨立結論
為計算 top-hit lDDT,作者對相同 query-hit pairs 分別跑 DALI、TM-align、GTalign、Foldseek。DALI 一致得到最高 lDDT,TM-align 與 GTalign 接近,Foldseek 較低,反映其偏重快速 retrieval。
這是獨立 residue-level comparison,但仍不是 RMSD+aligned length,而且 FAST 缺席。它支持 DALI 是當前強 alignment reference,卻不能補造 DALI/GTalign 對 FAST 的同場數字。
原文定位: PDF pp. 11–12, Fig. 5 and Additional-file Fig. S1 discussion
paper-fact
不同任務的冠軍不同
GTalign/TM-align 在 CATH fold classification 穩定強;DALI/Foldseek 的 local alignment 對功能一致性與 multi-domain local structure 更有利;representation methods 在低 pLDDT 與部分 disorder 下較穩健且搜尋快。
Fig. 9 的要點不是找 row winner,而是 applicability boundaries。若把五種 metric 平均,權重本身就會偷偷替使用者決定『功能、幾何、速度誰比較重要』。
原文定位: PDF pp. 18–20, Fig. 9 and Discussion: Applicability boundaries
project-reading
這篇證據的邊界
論文是 2026-07-08 接受、未 copyedit 的 article-in-press;頁碼與文字仍可能變。作者也列出模型 training exposure、GO annotation imbalance、semantic metric choice 與自建資料集的 reuse bias。
FAST 不在 14 methods 中。故這篇最有價值的用法是:替未來 FAST re-benchmark 選定 DALI/GTalign/TM-align/Foldseek 與五情境 protocol;不是把『現代 benchmark 冠軍』直接等號成『已超越 FAST』。
原文定位: PDF p. 1, manuscript metadata; PDF pp. 22–24, limitations and Conclusions; PDF p. 6, Table 1
研究設計與評估
資料與樣本
CATH-S20 15,043 domains;SwissProt functional set 1,000 queries/7,735 targets;multi-domain 100/4,573 與 TED-decomposed 204/11,041;DisProt 534/6,955;pLDDT 三層各 100 queries。
比較基準
- structure:GTalign、TM-align、DALI、Foldseek。
- representation:GraSR、TMvec、PLMSearch、DHR、FoldExplorer、ERAST;sequence:BLAST、Diamond、jackhmmer、MMseqs2。
指標
- SensitivityFP1 / F1max
- 衡量第一個錯誤前的早期 retrieval 與全 ranked list 的最佳 precision–recall 平衡。
邊界: 依 CATH 分類標籤,不直接看 coordinate geometry。 - Modified lDDT
- 在 0.5/1/2/4 Å thresholds 比較 aligned local inter-residue distances,並懲罰 fragmented alignment。
邊界: 取四 aligners 的最大值是 upper envelope,且不是 RMSD。 - GO semantic similarity
- 以 Wang graph measure 與 best-match average 評估 top-10 functional coherence。
邊界: GO coverage 不均,IDP 的 context-dependent function 尤其可能漏標。
論文報告的結果
沒有單一總冠軍:global structural alignment 主導 fold,local structural alignment 主導若干功能/局部幾何情境,representation 主導部分 robustness 與效率;DALI 的 residue lDDT 最佳。
PDF pp. 5–19, Figs. 2–9; PDF pp. 24–33, Methods
teaching-model · not a reported experiment
教學例(不是論文實驗)
同一方法為何跨情境翻盤
假設 query 是由兩個 domains 組成,target 只共享其中一個 catalytic domain,但整體 domain arrangement 不同。
- global aligner 會為整體 superposition 付出未共享 domain 的代價,排名可能下降。
- local aligner 可只抓 catalytic domain,得到高 local lDDT 與較高 GO functional consistency。
- 若先按 TED 拆 domain,representation method 也能避免全長向量被另一 domain 稀釋,論文觀察到多法提升 3–32.1%。
帶走什麼: 排名改變可能來自問題單位改變,而不是演算法突然變聰明。
independent-context
相對 FAST 的證據邊界
這是很重要的獨立校正,但 FAST 未納入,所以不能拿結果直接宣稱某法已同場擊敗 FAST。
合法來源與取用
46 pages · SHA-256 07040af0aa0a09e67e22bc9182ea285b7ef947452ab237a170a14c17974a205f
2026-07-08 已接受、尚未 copyedit 的 article-in-press;頁面可能在正式出版時改變。
Springer accepted-manuscript PDF
限制與防誤讀
- 目前是未校稿接受稿,正式版本可能修正文字與頁碼。
證據定位清單
- PDF pp. 5–6, Fig. 2 and Table 1
- PDF pp. 11–12, Fig. 5 and lDDT alignment comparison
- PDF pp. 18–20, Fig. 9 and Discussion
- PDF pp. 22–24, limitations and Conclusions
- PDF pp. 24–33, Methods and Tables 1–2
理解檢查
本文哪個 aligner 的 residue-level lDDT 最佳?
答案: DALI;TM-align 與 GTalign 接近,Foldseek 較低。
這是相同 query-hit pairs 的 alignment comparison,不是整體 retrieval 冠軍。
為何作者對每個 pair 取四種 alignment 的最大 lDDT?
答案: 為了讓 retrieval tool 的 top hits 盡量不受某一 alignment strategy 拖累。
這提升 method-agnostic 性,但形成 upper envelope,不能當工具自身 alignment 輸出。
這篇能否直接宣布 DALI 或 GTalign 全面勝 FAST?
答案: 不能,FAST 未參賽,且沒有同場 RMSD+coverage。
它是獨立現代背景證據,不是 FAST direct comparison。
讀完標準: 為『找同 fold』『找功能 motif』『找低可信預測結構的近鄰』三個任務各選一種 method class,並用 Fig. 9 的證據寫出理由與一項限制。
本篇詞彙表
- sensitivity before first FP
- ranked list 出現第一個錯誤前找回的 true positives 比例。
- lDDT
- 比較局部 residue–residue distances 是否在多個容許誤差內保存的分數。
- pLDDT
- AlphaFold 對每 residue 預測結構可信度的分數,本篇以平均值分層。
- applicability boundary
- 方法優勢成立的資料、任務與 metric 範圍,而非單一總排名。