Evidence-guided paper · 2026 · indirect-modern · full-text

豐富結構字母帶來高準確蛋白質搜尋(Reseek v3 預印本)

Robert C. Edgar. Rich structure alphabets enable highest accuracy protein search. bioRxiv preprint (2026).

30 秒理解

Reseek v3 以多個結構 alphabet 與層級專用統計模型擴張狀態空間,針對 family/superfamily/fold 分別校準搜尋。

核心問題

能否用分層 filters、更多結構 alphabets 與 family/superfamily/fold 專用統計模型,在 AI-scale 結構庫維持更高搜尋準確度?

直覺

Reseek v3 先用很小的 κ alphabet 找 two-hit diagonals,再用單 byte ν alphabet 做 SIMD Smith–Waterman,最後才用約 5×10^22 states 的 Mega′ 精排;高分 alignment 再融合 reverse score、LDDT 與 DALI signal。

為什麼重要

預印本在 SCOP40/SCOP40c/CATH40 的多種 collection 與 categorization metrics 報 Reseek-sensitive median rank 1,且 pairwise rank test 顯著;但它是單一作者、未同行審查、自訂 summary metrics,FAST 也未納入。

閱讀前置

  • 理解 structural alphabet、spaced seed 與 SIMD Smith–Waterman。
  • 知道 CVE、PR、ROC 與 collection/categorization 的差異。
  • 能辨識預印本、作者 benchmark 與獨立驗證的證據層級。

paper-specific guide · plain → technical → input → output → source

逐步方法導讀

  1. 01 · κ spaced-seed 快篩

    先把每個 residue 壓成 32 種很粗的狀態,只找兩個落在同一 diagonal 的相似 7-mers,迅速丟掉絕大多數不可能 pairs。

    論文語言: Kappa32=aa4×sec4×pm2;k=7,spaced pattern 1010011。Reseek 將 query k-mers 建 inverted index,RAM 大致隨 query size 而非 database size 增長。

    輸入: query/database 的 κ sequences。

    輸出: 通過 two-hit diagonal 的少量候選 pairs。

    邊界: filter 會丟棄部分真陽性;fast/sensitive presets 正是在速度與 sensitivity 間換取。

    PDF pp. 2 and 5, Methods: Algorithm workflow; PDF p. 10, Fig. 1

  2. 02 · ν filter 後用 Mega′ 精排

    第二關用 256 狀態的一 byte 表示快速做 local alignment;只有分數夠高者才建更昂貴、融合許多特徵的 Mega′ profiles。

    論文語言: Nu256=aa4×sec32×pm2,modified Parasail 做 SIMD Smith–Waterman;forward+reverse ν score 再篩選。Mega′ 是 component alphabets 的 weighted product,約 5×10^22 states,on-the-fly profile 再做 forward/reverse alignment。

    輸入: 通過 κ 的候選與 ν/Mega′ profiles。

    輸出: 高資訊量 local alignments 與 forward/reverse scores。

    邊界: Mega′ 建構較貴;速度依前兩層 filter 的 hit rate 與 query/database 分割方式。

    PDF pp. 2–3 and 5, Algorithm workflow; PDF p. 10, Fig. 1

  3. 03 · 用任務專用 test statistic 排名

    family、superfamily、fold 不是同一種相似;v3 為三者各自學權重,再把 alignment、短程 LDDT 與長程 DALI signal 合成 P-value。

    論文語言: TS 是 forward/reverse Mega′ scores、LDDT、DALI 的 weighted combination,權重以 Hooke–Jeeves optimization 調整;P-value 依 truth standard 作 log-linear fitting。LDDT 幾乎只貢獻 family,DALI 幾乎只貢獻 fold。

    輸入: 通過所有 filters 的 alignment signals 與指定 family/superfamily/fold model。

    輸出: 任務特定 P-value、排序與 top hits。

    邊界: 用錯 statistical model 會明顯改變 hit order;使用者必須先定義搜尋目的。

    PDF pp. 3–4, Results: Model weights; PDF p. 13, Fig. 4

關鍵結果

作者報告跨指標 median rank 1,但這仍是單一作者預印本與搜尋準確率主張。

逐節證據導讀

論文事實、本站判讀與教學模型分開標示。

paper-fact

median rank 1 到底代表什麼

Table 3 對多個 reference×truth×metric combinations 排名:Reseek-sensitive median rank 1、Reseek-fast 2、TM-align 3、DALI/Foldseek 4。指標包括 collection Sum3/PR90 與 categorization Top3。

Table 4 以 Wilcoxon signed-rank 比較 ranks,Reseek-sensitive 對 DALI p=.0007144、Foldseek 1.198×10^-5、TM-align .0005855、Reseek-fast 2.705×10^-6。這支持作者定義的多任務排名,不是每個 pair 的幾何勝利。

原文定位: PDF pp. 3 and 21–22, Tables 3–4

project-reading

summary metrics 也帶有價值選擇

Sum3=2×SEPQ0.1+1.5×SEPQ1+SEPQ10,明確給低 false-positive regime 較高權重;PR90 是 precision=.9 時 recall;Top3 也對 .1%、1%、10% error rates 加權。

這些選擇合理但不是自然常數。若使用者重視 exhaustive collection、不同 error budget 或 geometry,median rank 可能改變;所以應保留 raw curves 與 metric definition。

原文定位: PDF pp. 6–7, Methods: Collection accuracy and Categorization accuracy

paper-fact

AI-scale 可行,不等於嚴謹速度冠軍

AFDB50 約 54M structures 的示範中,100 queries:Foldseek 9m、Reseek-fast 6m、sensitive 23m;1,000 queries:19m、61m、4h。記憶體則 Foldseek 227/284GB,Reseek 約 4.4–6.7GB。

作者明示兩法索引方向與 scaling behavior 差異太大,這些只是 anecdotal examples,不是 commensurate rigorous comparison。再加上單一作者預印本與 FAST 缺席,證據標籤應是 indirect-modern/preprint。

原文定位: PDF p. 4, Scaling to large databases; PDF p. 19, Table 1

研究設計與評估

資料與樣本

SCOP40、curated SCOP40c、CATH40,涵蓋 family/superfamily/fold truth;另以 AFDB50 約 54M structures 作 scaling demonstration。

比較基準

  • DALI、Foldseek、TM-align。
  • Reseek-fast 與 Reseek-sensitive 兩個 operation points 互相比較。

指標

Sum3 / PR90
collection search 在多個 FPEPQ 或 90% precision 的 sensitivity/recall。
邊界: Sum3 權重為作者設計,且 filtered tools 不輸出完整 score curve。
Top3
leave-category-out top-hit categorization 在多個錯誤率的加權 sensitivity。
邊界: 只看 top hit,不能代表全面收集所有 homologs。
Median method rank
跨 reference、truth 與 summary metrics 的排名中位數。
邊界: 忽略 effect size,且受 metric set/weights 選擇影響。

論文報告的結果

在作者定義的多組 retrieval metrics 中,Reseek-sensitive median rank 1 且顯著高於 baselines;結果尚未同行審查、未獨立重現,也未比較 FAST。

PDF pp. 2–7, Results and Methods; PDF pp. 10–14, Figs. 1–5; PDF pp. 21–22, Tables 3–4

teaching-model · not a reported experiment

教學例(不是論文實驗)

為何 family model 不應拿來找 fold

query 與 target 序列已高度分化,但共享相同 fold;它們局部 secondary-structure packing 相似,amino-acid identity 很低。

  1. family model 對 aa20 給約 61% 權重,低序列相似會把 pair 往下排。
  2. fold model 降低 primary sequence、提高 nensec32 至 27%,並主要使用長程 DALI signal。
  3. 同一 raw alignment 因 truth objective 不同而排序不同;選 model 是科學問題的一部分。

帶走什麼: 『蛋白相似』不是單一關係;family、superfamily、fold 需要不同 evidence weighting。

indirect-modern

相對 FAST 的證據邊界

FAST 未被比較;而且搜尋準確率不等於更低 RMSD 與更高 coverage。

合法來源與取用

22 pages · SHA-256 5a45b5d76cac3ca54fd5425d166a043f8b90de89258cd58d8ad68bb8c3f8c9f5

2026-07-30 v1 預印本,尚未同行審查。

bioRxiv preprint PDF

限制與防誤讀

  • 未同行審查且缺乏獨立重現。

證據定位清單

  1. PDF pp. 2–5, Results and Methods overview
  2. PDF pp. 5–7, Methods: Algorithm workflow and accuracy definitions
  3. PDF pp. 19–22, Tables 1–4
  4. PDF pp. 10–18, Figs. 1–9

理解檢查

  1. median rank 1 是否等於所有 metric 都第一?

    答案: 不等於;Table 3 仍有 Reseek-sensitive 排第 2 或第 3 的欄位。

    median 摘要整體位置,不抹除 task-specific exceptions。

  2. 為何 AFDB50 的 100-query 與 1,000-query 速度會翻轉?

    答案: Reseek 索引 query、Foldseek 索引 database,兩者時間與記憶體隨 query/database size 的 scaling 不同。

    因此單一規模的速度比不能外推成普遍倍率。

  3. 這篇能否證明 Reseek v3 在 RMSD+coverage 勝 FAST?

    答案: 不能;FAST 未比較,主結果是 retrieval ranks。

    要回答幾何問題需另做同 pair、同 coverage rule 的 alignment benchmark。

讀完標準: 從 Table 3 找出 Reseek-sensitive 不是第一的三列,逐列說明 truth/reference/metric 改變了什麼,再評估 median rank 是否掩蓋重要例外。

本篇詞彙表

spaced seed
只在指定 pattern positions 比較字元的 k-mer seed,可容忍部分差異。
collection
在可接受 errors 下盡量找回多個相關 structures 的任務。
categorization
用 top hit 把 query 指派到 family/superfamily/fold category。
Mega′
將多個 sequence/structure alphabets 加權組合的高容量 residue representation。