Evidence-guided paper · 2024 · indirect-modern · full-text

Reseek:以豐富結構字母提高遠端同源搜尋靈敏度

Robert C. Edgar. Protein structure alignment by Reseek improves sensitivity to remote homologs. Bioinformatics 40:btae687 (2024).

30 秒理解

Reseek 的 mega-alphabet 同時編碼胺基酸與八種結構特徵,再用成熟 local sequence alignment 搜尋遠端同源。

核心問題

如何把極豐富的局部與長程結構狀態壓成可用序列 alignment 搜尋的表示,同時讓 E-value 真能預測大型資料庫中的錯誤數?

直覺

Reseek 不直接為 858 億種 mega-letters 學一張巨大替換矩陣,而是把 amino acid、局部構形、最近三維鄰居距離等特徵分解,各自學 log-odds,再相加成 residue-pair score,交給 Smith–Waterman。

為什麼重要

在 SCOP40 search benchmark,Reseek v2 於相同 false-positive errors per query 下比 DALI、TM-align、Foldseek 有更高 homolog sensitivity,且 E-value 校準更可靠;這是 retrieval 證據,不是對 FAST 的 RMSD/coverage head-to-head。

閱讀前置

  • 理解 structural alphabet 與 substitution log-odds score。
  • 知道 Smith–Waterman local alignment 與 affine gap penalty。
  • 能解讀 sensitivity、FPEPQ、CVE curve 與 E-value calibration。

paper-specific guide · plain → technical → input → output → source

逐步方法導讀

  1. 01 · 將結構環境拆成小 alphabets

    每個 residue 不只記胺基酸,還記附近骨架形狀、最近三維鄰居與反向鄰居的距離和構形;每種特徵各自分箱。

    論文語言: FV 包含 AA、DistNEN/DistREN、以中心±3 residues 的 pairwise distances 表示的 Conf,以及 NEN/REN contexts。scalar features 以等頻 bins 離散,vector features 以 K-means representatives 離散。

    輸入: 蛋白 Cα backbone 與訓練結構集合。

    輸出: 每個 residue 的 discrete feature vector。

    邊界: 離散化與特徵選擇會丟失座標細節;相同 mega-letter 不等於完整三維環境相同。

    PDF pp. 2–3, §2 Materials and methods

  2. 02 · 加總分解 log-odds 並做 local alignment

    比較兩個 residue 時,各項特徵各給一票,再把票加權相加;如此不用看過每一種巨大組合,也能算 pair score。

    論文語言: 每項 feature f 有 log-odds matrix Mf 與 weight wf,Sij=Σf wf Mf[Vf(i),Vf(j)];AA 加八個 16-letter structural features,mega-alphabet 大小 20×16^8=85,899,345,920。Smith–Waterman/BLAST-like search 最大化 substitution sum 減 affine gaps。

    輸入: 兩條 discrete feature-vector sequences 與各 feature score matrices。

    輸出: local alignment 與 raw alignment score。

    邊界: 本質是 local search;找到 homolog 的能力不能直接當成全域剛體疊合品質。

    PDF p. 3, Equations 2–3

  3. 03 · 把 alignment 轉成 AQ 與 E-value

    把 alignment 分數、局部距離保存度與反向序列對照合成 0–1 的 AQ,再用實際錯誤分布校準 E-value,讓門檻能預測會出現多少假陽性。

    論文語言: AQ test statistic 結合 LDDT-mu、forward score、query-vs-reversed-query score 與平均長度,再以 logistic mapping 至 [0,1];constants 於 SCOP40 holdout 訓練,E-value 由 AQ empirical distribution 擬合。

    輸入: alignment、座標衍生 LDDT-mu、reverse score 與長度。

    輸出: AQ、E-value、排名與可選 Kabsch superposition。

    邊界: E-value 外推到 AFDB 規模仍依 null model 與資料庫組成;作者明示 superfamily 數未知。

    PDF p. 3, Equation 4 and SCOP40 assessment protocol

關鍵結果

作者在 SCOP40 all-v-all 報告高遠端同源靈敏度與可校準 E-value,主題是搜尋而非疊合 RMSD。

逐節證據導讀

論文事實、本站判讀與教學模型分開標示。

paper-fact

在固定錯誤率下讀 sensitivity

Table 1 以 FPEPQ=.1/1/10 報 sensitivity:Reseek-sensitive 是 .22/.34/.48,Reseek-very-sensitive 才是 .22/.35/.51;TM-align .12/.24/.42、DALI .075/.17/.44、Foldseek .11/.22/.41。模式與錯誤預算都會改變結論,因此不能把兩個 Reseek preset 混成一列。

執行時間同表為 Reseek-fast 49 秒、Foldseek 78、Reseek-sensitive 178、Reseek-very-sensitive 840、TM-align 3.7×10^5、DALI 4.1×10^5;這是在 32-thread i9-14900K、排除建庫時間的設定。

原文定位: PDF pp. 3–5, Fig. 3 and Table 1

paper-fact

為何 E-value 校準是核心成果

CVE plot 直接問『在每個 query 平均容許 x 個 false positives 時能找回多少 homologs』,比只看 ROC/precision 更貼近大型資料庫門檻設定。理想 E-value 應滿足 E≈FPEPQ。

Fig. 3 的例子中,Foldseek E-value=10^-6 時實測 FPEPQ 約 .1,低估錯誤五個 orders;Reseek E-values 與實測較一致。這是 significance calibration,不是 coordinate alignment RMSD。

原文定位: PDF pp. 4–5, Figs. 2–3 and Discussion

project-reading

與 FAST 問題的證據距離

FAST 未列入 tested methods,且 Reseek 的 gold standard 是 SCOP40 superfamily retrieval、主要輸出是 sensitivity/FPEPQ/E-value。這些不能回答 FAST 的 aligned length 與 RMSD。

Reseek 可合理稱為『更適合 AI-scale structure search 的現代候選』;若要稱『疊合更高、誤差更小』,需另取同一 pair set,固定 coverage rule,再用兩法輸出的 correspondence 計 RMSD/TM-score。

原文定位: PDF p. 3, SCOP40 protocol; PDF p. 5, Table 1

研究設計與評估

資料與樣本

SCOP40 v1.75,共 11,206 domains、1,960 superfamilies,做 all-versus-all;同 superfamily 作 homolog truth。

比較基準

  • DALILite v5、TM-align 2022/4/12、Foldseek 8-ef4e960。
  • BLASTP 作 sequence-search context。

指標

Sensitivity@FPEPQ
在固定每 query 假陽性數下找回的 homolog 比例。
邊界: 依 SCOP superfamily 當 truth,可能把未知 homology 當 negative。
E-value calibration
比較報告 E-value 與實測 FPEPQ 是否接近。
邊界: 校準會受資料庫大小、組成與 null distribution 影響。
Time / memory
同硬體 all-vs-all search 的 wall time 與峰值記憶體。
邊界: 建庫時間排除,且不同工具的 filter/output completeness 不同。

論文報告的結果

Reseek variants 在 SCOP40 的固定 FPEPQ sensitivity 普遍最高,E-value 也較校準;但速度取決於 preset:fast 49 秒、sensitive 178 秒、very-sensitive 840 秒,而 Foldseek 為 78 秒。FAST 未參賽。

PDF pp. 3–5, §3 Results, Figs. 3–4, and Table 1

teaching-model · not a reported experiment

教學例(不是論文實驗)

E-value 低估如何在大庫放大

某工具對一個 query 報 E=10^-6,但小 benchmark 實測每 query 有 .1 個 false positives。

  1. 使用者以為平均一百萬次搜尋才一個錯誤;實際約十次搜尋就一個。
  2. 兩者相差 10^5 倍,故即使 ranking 尚可,門檻的風險解讀仍嚴重錯誤。
  3. CVE 以實測 FPEPQ 畫 sensitivity,可把 ranking 與 calibration 分開驗證。

帶走什麼: 大型搜尋不只要把好 hits 排前面,還要知道 cutoff 對應多少錯誤。

indirect-modern

相對 FAST 的證據邊界

沒有直接比較 FAST,也不是 RMSD/coverage benchmark。

合法來源與取用

6 pages · SHA-256 998dff41139e909b3c0dcdacf8681bff76a985c5988dea5b00152b1740ee62fe

CC BY 4.0 正式開放全文。

Europe PMC open-access PDF

限制與防誤讀

  • 單一作者與作者自評需要獨立 benchmark 校正。

證據定位清單

  1. PDF pp. 2–3, §2 Materials and methods and Equations 2–4
  2. PDF pp. 3–5, §3 Results and Figs. 2–4
  3. PDF p. 5, Table 1
  4. PDF pp. 4–5, Discussion on CVE and E-value calibration

理解檢查

  1. 85,899,345,920 states 是否代表需要同樣大的 substitution matrix?

    答案: 不需要;Reseek 將 mega-state 拆成多個小 feature alphabets,分別計 log-odds 再加總。

    這正是避免稀疏觀測與記憶體爆炸的核心。

  2. Reseek-very-sensitive 的 Sens(10)=.51 能解讀為 RMSD 較低嗎?

    答案: 不能;它是在 FPEPQ=10 下找回 homolog 的比例。

    這是 retrieval operating point,不是 superposition geometry。

  3. 本文是否直接證明 Reseek 勝 FAST?

    答案: 沒有,FAST 未納入。

    且主指標為 sensitivity/FPEPQ,不是 FAST 問題中的 RMSD+coverage。

讀完標準: 用 Table 1 畫出四種結構法在 FPEPQ .1、1、10 的三點曲線,再寫一行說明這張圖為何不能替代 Nmat/RMSD 表。

本篇詞彙表

mega-alphabet
多個離散特徵的笛卡兒積狀態;Reseek 不直接枚舉完整矩陣。
FPEPQ
每個 query 平均產生的 false-positive hits 數。
CVE curve
以 sensitivity 對實測錯誤率作圖的 search evaluation。
AQ
Reseek 結合 alignment、reverse control 與 LDDT-mu 的 0–1 test statistic。