Evidence-guided paper · 2024 · indirect-modern · full-text
Reseek:以豐富結構字母提高遠端同源搜尋靈敏度
Robert C. Edgar. Protein structure alignment by Reseek improves sensitivity to remote homologs. Bioinformatics 40:btae687 (2024).
30 秒理解
Reseek 的 mega-alphabet 同時編碼胺基酸與八種結構特徵,再用成熟 local sequence alignment 搜尋遠端同源。
核心問題
如何把極豐富的局部與長程結構狀態壓成可用序列 alignment 搜尋的表示,同時讓 E-value 真能預測大型資料庫中的錯誤數?
直覺
Reseek 不直接為 858 億種 mega-letters 學一張巨大替換矩陣,而是把 amino acid、局部構形、最近三維鄰居距離等特徵分解,各自學 log-odds,再相加成 residue-pair score,交給 Smith–Waterman。
為什麼重要
在 SCOP40 search benchmark,Reseek v2 於相同 false-positive errors per query 下比 DALI、TM-align、Foldseek 有更高 homolog sensitivity,且 E-value 校準更可靠;這是 retrieval 證據,不是對 FAST 的 RMSD/coverage head-to-head。
閱讀前置
- 理解 structural alphabet 與 substitution log-odds score。
- 知道 Smith–Waterman local alignment 與 affine gap penalty。
- 能解讀 sensitivity、FPEPQ、CVE curve 與 E-value calibration。
paper-specific guide · plain → technical → input → output → source
逐步方法導讀
-
01 · 將結構環境拆成小 alphabets
每個 residue 不只記胺基酸,還記附近骨架形狀、最近三維鄰居與反向鄰居的距離和構形;每種特徵各自分箱。
論文語言: FV 包含 AA、DistNEN/DistREN、以中心±3 residues 的 pairwise distances 表示的 Conf,以及 NEN/REN contexts。scalar features 以等頻 bins 離散,vector features 以 K-means representatives 離散。
輸入: 蛋白 Cα backbone 與訓練結構集合。
輸出: 每個 residue 的 discrete feature vector。
邊界: 離散化與特徵選擇會丟失座標細節;相同 mega-letter 不等於完整三維環境相同。
PDF pp. 2–3, §2 Materials and methods
-
02 · 加總分解 log-odds 並做 local alignment
比較兩個 residue 時,各項特徵各給一票,再把票加權相加;如此不用看過每一種巨大組合,也能算 pair score。
論文語言: 每項 feature f 有 log-odds matrix Mf 與 weight wf,Sij=Σf wf Mf[Vf(i),Vf(j)];AA 加八個 16-letter structural features,mega-alphabet 大小 20×16^8=85,899,345,920。Smith–Waterman/BLAST-like search 最大化 substitution sum 減 affine gaps。
輸入: 兩條 discrete feature-vector sequences 與各 feature score matrices。
輸出: local alignment 與 raw alignment score。
邊界: 本質是 local search;找到 homolog 的能力不能直接當成全域剛體疊合品質。
PDF p. 3, Equations 2–3
-
03 · 把 alignment 轉成 AQ 與 E-value
把 alignment 分數、局部距離保存度與反向序列對照合成 0–1 的 AQ,再用實際錯誤分布校準 E-value,讓門檻能預測會出現多少假陽性。
論文語言: AQ test statistic 結合 LDDT-mu、forward score、query-vs-reversed-query score 與平均長度,再以 logistic mapping 至 [0,1];constants 於 SCOP40 holdout 訓練,E-value 由 AQ empirical distribution 擬合。
輸入: alignment、座標衍生 LDDT-mu、reverse score 與長度。
輸出: AQ、E-value、排名與可選 Kabsch superposition。
邊界: E-value 外推到 AFDB 規模仍依 null model 與資料庫組成;作者明示 superfamily 數未知。
PDF p. 3, Equation 4 and SCOP40 assessment protocol
關鍵結果
作者在 SCOP40 all-v-all 報告高遠端同源靈敏度與可校準 E-value,主題是搜尋而非疊合 RMSD。
逐節證據導讀
論文事實、本站判讀與教學模型分開標示。
paper-fact
在固定錯誤率下讀 sensitivity
Table 1 以 FPEPQ=.1/1/10 報 sensitivity:Reseek-sensitive 是 .22/.34/.48,Reseek-very-sensitive 才是 .22/.35/.51;TM-align .12/.24/.42、DALI .075/.17/.44、Foldseek .11/.22/.41。模式與錯誤預算都會改變結論,因此不能把兩個 Reseek preset 混成一列。
執行時間同表為 Reseek-fast 49 秒、Foldseek 78、Reseek-sensitive 178、Reseek-very-sensitive 840、TM-align 3.7×10^5、DALI 4.1×10^5;這是在 32-thread i9-14900K、排除建庫時間的設定。
原文定位: PDF pp. 3–5, Fig. 3 and Table 1
paper-fact
為何 E-value 校準是核心成果
CVE plot 直接問『在每個 query 平均容許 x 個 false positives 時能找回多少 homologs』,比只看 ROC/precision 更貼近大型資料庫門檻設定。理想 E-value 應滿足 E≈FPEPQ。
Fig. 3 的例子中,Foldseek E-value=10^-6 時實測 FPEPQ 約 .1,低估錯誤五個 orders;Reseek E-values 與實測較一致。這是 significance calibration,不是 coordinate alignment RMSD。
原文定位: PDF pp. 4–5, Figs. 2–3 and Discussion
project-reading
與 FAST 問題的證據距離
FAST 未列入 tested methods,且 Reseek 的 gold standard 是 SCOP40 superfamily retrieval、主要輸出是 sensitivity/FPEPQ/E-value。這些不能回答 FAST 的 aligned length 與 RMSD。
Reseek 可合理稱為『更適合 AI-scale structure search 的現代候選』;若要稱『疊合更高、誤差更小』,需另取同一 pair set,固定 coverage rule,再用兩法輸出的 correspondence 計 RMSD/TM-score。
原文定位: PDF p. 3, SCOP40 protocol; PDF p. 5, Table 1
研究設計與評估
資料與樣本
SCOP40 v1.75,共 11,206 domains、1,960 superfamilies,做 all-versus-all;同 superfamily 作 homolog truth。
比較基準
- DALILite v5、TM-align 2022/4/12、Foldseek 8-ef4e960。
- BLASTP 作 sequence-search context。
指標
- Sensitivity@FPEPQ
- 在固定每 query 假陽性數下找回的 homolog 比例。
邊界: 依 SCOP superfamily 當 truth,可能把未知 homology 當 negative。 - E-value calibration
- 比較報告 E-value 與實測 FPEPQ 是否接近。
邊界: 校準會受資料庫大小、組成與 null distribution 影響。 - Time / memory
- 同硬體 all-vs-all search 的 wall time 與峰值記憶體。
邊界: 建庫時間排除,且不同工具的 filter/output completeness 不同。
論文報告的結果
Reseek variants 在 SCOP40 的固定 FPEPQ sensitivity 普遍最高,E-value 也較校準;但速度取決於 preset:fast 49 秒、sensitive 178 秒、very-sensitive 840 秒,而 Foldseek 為 78 秒。FAST 未參賽。
PDF pp. 3–5, §3 Results, Figs. 3–4, and Table 1
teaching-model · not a reported experiment
教學例(不是論文實驗)
E-value 低估如何在大庫放大
某工具對一個 query 報 E=10^-6,但小 benchmark 實測每 query 有 .1 個 false positives。
- 使用者以為平均一百萬次搜尋才一個錯誤;實際約十次搜尋就一個。
- 兩者相差 10^5 倍,故即使 ranking 尚可,門檻的風險解讀仍嚴重錯誤。
- CVE 以實測 FPEPQ 畫 sensitivity,可把 ranking 與 calibration 分開驗證。
帶走什麼: 大型搜尋不只要把好 hits 排前面,還要知道 cutoff 對應多少錯誤。
indirect-modern
相對 FAST 的證據邊界
沒有直接比較 FAST,也不是 RMSD/coverage benchmark。
合法來源與取用
6 pages · SHA-256 998dff41139e909b3c0dcdacf8681bff76a985c5988dea5b00152b1740ee62fe
CC BY 4.0 正式開放全文。
限制與防誤讀
- 單一作者與作者自評需要獨立 benchmark 校正。
證據定位清單
- PDF pp. 2–3, §2 Materials and methods and Equations 2–4
- PDF pp. 3–5, §3 Results and Figs. 2–4
- PDF p. 5, Table 1
- PDF pp. 4–5, Discussion on CVE and E-value calibration
理解檢查
85,899,345,920 states 是否代表需要同樣大的 substitution matrix?
答案: 不需要;Reseek 將 mega-state 拆成多個小 feature alphabets,分別計 log-odds 再加總。
這正是避免稀疏觀測與記憶體爆炸的核心。
Reseek-very-sensitive 的 Sens(10)=.51 能解讀為 RMSD 較低嗎?
答案: 不能;它是在 FPEPQ=10 下找回 homolog 的比例。
這是 retrieval operating point,不是 superposition geometry。
本文是否直接證明 Reseek 勝 FAST?
答案: 沒有,FAST 未納入。
且主指標為 sensitivity/FPEPQ,不是 FAST 問題中的 RMSD+coverage。
讀完標準: 用 Table 1 畫出四種結構法在 FPEPQ .1、1、10 的三點曲線,再寫一行說明這張圖為何不能替代 Nmat/RMSD 表。
本篇詞彙表
- mega-alphabet
- 多個離散特徵的笛卡兒積狀態;Reseek 不直接枚舉完整矩陣。
- FPEPQ
- 每個 query 平均產生的 false-positive hits 數。
- CVE curve
- 以 sensitivity 對實測錯誤率作圖的 search evaluation。
- AQ
- Reseek 結合 alignment、reverse control 與 LDDT-mu 的 0–1 test statistic。