Evidence-guided paper · 2012 · outside-scope · full-text
用功能探針進行微生物基因體代謝分類
Chi-Ching Lee; Wei-Cheng Lo; Szu-Ming Lai; Yi-Ping Phoebe Chen; Chuan Yi Tang; Ping-Chiang Lyu. Metabolic classification of microbial genomes using functional probes. BMC Genomics 13:157 (2012).
30 秒理解
以一組能代表代謝能力的功能探針基因,把微生物基因體投影成可比較的功能輪廓。
核心問題
能否把每個微生物 proteome 壓縮成一組具已知功能的短保守 motif 頻率,進而同時看見高階親緣關係與較細緻的代謝/生活型態差異?
直覺
這個方法不逐一對齊整個基因體,而像替每個微生物製作一張「功能條碼」:約一千個 Prosite descriptors 是固定探針,每個 proteome 中各探針出現多少次,除以 protein-coding gene 數後形成向量。向量相似的物種再被聚類。
為什麼重要
固定長度的 compositional representation 可快速比較大量或不完整基因體,也讓差異可回到具功能語意的 motifs 解讀。但得到的是由 probe composition 支持的分類,不是完整代謝 flux、機制因果或單一 marker 的鑑定結果。
閱讀前置
- 理解 genome、protein-coding gene、proteome 與 conserved motif 的差別。
- 知道 Prosite descriptor 是可掃描胺基酸序列的 pattern,而不是完整蛋白質功能的充分證明。
- 理解 feature vector、頻率正規化、hierarchical clustering 與 average linkage。
- 能分辨 pattern correlation、clustering distance、tree-topology correlation 與 classification accuracy。
paper-specific guide · plain → technical → input → output → source
逐步方法導讀
-
01 · 以保守功能 motifs 掃描 proteome
準備一套固定的短序列探針,逐一搜尋每個物種的所有蛋白質。
論文語言: 使用 Prosite descriptors(多數約 10–20 residues)作為 probes,排除 Prosite 標記為 highly frequent 的 patterns;對 RefSeq proteomes 計數每個 probe 的 occurrences。
輸入: 微生物 protein sequences 與一套約 1,000 個 Prosite-derived probes。
輸出: 每個物種的 probe occurrence counts。
邊界: motif match 是功能線索;probe 選擇與當時 Prosite/proteome annotations 會限制可見的功能空間。
PDF pp. 2–3, Probe-set concept; PDF p. 12, Methods, Data preparation
-
02 · 建立正規化功能條碼
把不同大小的 proteomes 轉成可比較的相對頻率向量。
論文語言: 對物種 A 的每個 probe i,以 occurrence count 除以該 proteome 的 protein-coding gene 數;全部 probes 的 normalized frequencies 組成 frequency pattern。pattern 間描述性相似度以 Pearson CC 計算。
輸入: probe counts 與各 proteome 的 protein-coding gene 數。
輸出: 每個微生物一個固定維度的 normalized probe-frequency vector。
邊界: 除以 gene count 控制整體 proteome 大小,但不能修正所有 gene-calling、annotation completeness 或 motif-copy-number 偏差。
PDF pp. 12–13, Methods, Computation of probe-set frequencies and Equation 1
-
03 · 聚類物種並量化樹拓樸
依功能條碼排序物種;若要比較兩棵樹,先把葉節點間要走過的節點數轉成矩陣,再比較兩個矩陣。
論文語言: CLUSTER 3.0 以 Spearman rank correlation 作 pattern distance、average linkage 建 hierarchical tree。tree comparison 對相同 leaves 建 N×N leaf-to-leaf traveling-distance matrices,再取兩矩陣的 Pearson CC。
輸入: 多個 probe-frequency vectors;比較樹時還需要完全相同的 organism nodes。
輸出: probe-set classification tree,以及成對樹之間的 topology CC。
邊界: 建樹用的 Spearman distance、frequency-pattern 的 Pearson CC、tree-matrix 的 Pearson CC 是三個不同物件;不能互換解讀。
PDF pp. 8–10, Figures 7–8; PDF p. 13, Methods, Construction and comparison of classification trees
關鍵結果
少量具生物意義的 probe 可支援跨基因體分類,提供比全基因組黑箱距離更可解釋的視角。
逐節證據導讀
論文事實、本站判讀與教學模型分開標示。
paper-fact
先驗證探針能看見功能層級
作者從每個 EC level-4 類別隨機選一個 enzyme,建立 2,935-enzyme nonredundant set。六個 EC level-1 classes 形成不同 probe-frequency patterns;接著 carbohydrate、energy、lipid、nucleotide 與 amino-acid metabolism 五條 pathways 也呈現可區分的 patterns。
在 proteome 層級,8 個 host-associated 與 21 個 free-living microbes 被清楚分開。這些例子支持 probe composition 捕捉功能差異,但 Figure 1 的低 cross-class CC 與 Figure 2 的 cluster separation 不是同一個 supervised classification accuracy。
原文定位: PDF pp. 3–5, Figures 1–3
paper-fact
高階偏親緣,細階可顯出代謝表型
843-microbe global tree 大致分開 Archaea 與 Bacteria,且多數物種依 phylum 與 class 聚集;較低階層則出現依寄生/共生、光合作用或化學合成等特徵重組的 clusters。作者在所述 Intel Xeon 2.13 GHz、3 GB memory 環境中建此樹耗時 1.3 分鐘。
十個 Lactobacillus species 依 homo-/hetero-fermentation 分成兩群;67 個 photosynthetic microbes 則在同一代謝能力背景下依六個 phyla 聚集。這支持方法同時保留部分親緣與功能訊號,但沒有證明 cluster 差異就是代謝機制的因果來源。
原文定位: PDF pp. 5–8, Figures 4–6; PDF p. 11, runtime
project-reading
HGT 與缺失資料測的是不同 robustness
415 個 HGT database organisms 的完整基因體樹與移除標註 HGT genes 後的樹,其 leaf-distance-matrix topology CC 為 0.93。這是兩棵固定 node-set 樹的拓樸穩定性,不是 HGT gene 偵測 accuracy,也不能排除未標註 HGT。
缺失資料測試選 87 species,每個 truncation rate 重複 10 次。一次只截短一個 genome 時,保留 50% genome 的平均 reclassification accuracy 為 94%;同時截短全部 87 genomes 至保留 50% 時,新樹與 reference tree 的 topology CC 約 0.78。兩個數字的實驗單位與成功條件不同,不能合成一個「94% 樹相似度」。
原文定位: PDF pp. 7–10, HGT analysis, Figures 7–8; PDF p. 12, Random truncation of proteomes
研究設計與評估
資料與樣本
多層驗證包含:2,935 個 nonredundant enzymes(每個 EC level-4 類別取一個)、五類 KEGG metabolic pathways、29 個 host/free-living microbes、843 個 microbes 的 global tree、10 個 Lactobacillus、67 個 photosynthetic microbes、415 個具 HGT annotations 的 microbes,以及 87-species random-truncation set。
比較基準
- NCBI taxonomy/傳統 phylogenetic grouping 與 GOLD 的 living-environment/metabolic annotations,作為 cluster interpretation 的外部參照。
- 未截短的 87-species probe-set tree 作為 incomplete-genome experiments 的 reference tree。
- 含 HGT genes 與移除資料庫標註 HGT genes 的兩個 415-organism inputs,形成 robustness contrast。
指標
- Probe-pattern correlation
- 兩個 normalized probe-frequency vectors 之間的 Pearson CC,用來描述 probe composition 相似度。
邊界: 不是建 hierarchical tree 時使用的 Spearman distance,也不是樹拓樸相似度。 - Tree-topology CC
- 兩棵具有相同 leaves 的 leaf-to-leaf traveling-distance matrices 之 Pearson CC;1 代表此表示下完全相同。
邊界: 需要完全相同的 nodes;不直接衡量 taxonomic correctness,且不同拓樸可有相近的 matrix correlation。 - One-genome reclassification accuracy
- 逐一截短一個 genome 後,重建樹拓樸仍與 reference 完全相同的案例數除以 87。
邊界: 不同於同時截短全部 genomes 的 tree-topology CC;結果也依 random removal 與選定 87 species。 - Wall-clock runtime
- 在指定 Intel Xeon 2.13 GHz、3 GB memory 電腦上建立 843-organism tree 的經過時間。
邊界: 是 2012 年實作與硬體的系統時間,不是跨硬體的 algorithmic complexity benchmark。
論文報告的結果
probe-set trees 在高階分類多與 taxonomy 一致,並在細階呈現生活型態/代謝差異。HGT+ 與 HGT− trees 的 topology CC 為 0.93;87-species truncation 中,單一 genome 保留 50% 時平均 reclassification accuracy 為 94%,全部 genomes 同時保留 50% 時 topology CC 約 0.78。843-organism tree 在指定硬體耗時 1.3 分鐘。
PDF pp. 5–11, Figures 4–9 and runtime; PDF pp. 12–13, Methods
teaching-model · not a reported experiment
教學例(不是論文實驗)
三個 toy proteomes 的功能條碼
本站教學模型:固定使用三個 probes P1、P2、P3。Genome A 有 100 個 coding genes、counts=[10,5,0];B 有 200 genes、counts=[20,10,0];C 有 100 genes、counts=[1,2,12]。
- 將每個 count 除以 coding-gene 數,得到 A=[0.10,0.05,0]、B=[0.10,0.05,0]、C=[0.01,0.02,0.12]。
- A 與 B 雖然基因體大小不同,正規化後功能條碼相同;C 因 P3 富集而不同。
- 以指定 distance 與 linkage 聚類 vectors,記錄 A/B 同群、C 分離;再查 P3 的生物註解,提出可實驗驗證的功能假說。
- 若移除 C 的一半 proteins,重複掃描與建樹;分開報它是否回到同一位置,以及整棵樹的 topology metric。
帶走什麼: 正規化能處理總量尺度,但 cluster interpretation 仍須指定 probes、distance、linkage、missingness 與外部生物註解。
outside-scope
相對 FAST 的證據邊界
這是功能基因體分類,與 FAST 的三維疊合指標無直接可比性。
合法來源與取用
15 pages · SHA-256 748668dc776d365c1d8cb24970b3bc972cd9c1e3df6648b62ebaf94e2fbfda4e
合法開放全文。
限制與防誤讀
- 結果依賴 probe 選擇與基因註解品質。
證據定位清單
- PDF pp. 2–4, Probe-set concept and Figure 1
- PDF pp. 4–8, Proteome-level evaluation and Figures 2–6
- PDF pp. 8–10, HGT and incomplete-genome experiments, Figures 7–8
- PDF p. 11, runtime and classification of incomplete genomes
- PDF pp. 12–13, Methods, frequency normalization, clustering and tree comparison
理解檢查
為何 probe occurrence 要除以 protein-coding gene 數?
答案: 讓不同 proteome 大小的 probe frequencies 能在共同尺度比較。
未正規化 counts 會把較大的 proteome 系統性推向較高值。
HGT+/HGT− 的 0.93 是何種 correlation?
答案: 兩棵樹 leaf-to-leaf traveling-distance matrices 的 topology CC。
它不是兩個 proteomes 的 frequency-pattern CC,也不是 HGT detection accuracy。
50% genome retained 的 94% 與約 0.78 為何能同時成立?
答案: 94% 來自一次截短一個 genome 的 exact-topology reclassification;約 0.78 來自同時截短全部 87 genomes 的 tree-matrix CC。
兩個實驗的 perturbation scope、分母與成功定義都不同。
讀完標準: 用一組至少 20 個 complete 與 20 個 simulated-incomplete proteomes 重建 probe-frequency workflow;預先固定 probe version、gene normalization、Spearman distance 與 average linkage,並分別報 pattern similarity、leaf-placement accuracy、tree-topology CC、runtime 與 annotation coverage。
本篇詞彙表
- Functional probe
- 本文用來掃描 proteome 的短、保守、具功能註解之 Prosite sequence descriptor。
- Probe-frequency pattern
- 所有 probes 的 occurrence counts 經 protein-coding gene 數正規化後組成的向量。
- Compositional analysis
- 以成分的出現頻率比較 genomes,不依賴基因排列順序或 whole-genome alignment。
- Leaf-to-leaf traveling distance
- 兩個 leaves 沿樹走到 lowest common ancestor 所跨越節點數的總和。