Evidence-guided paper · 2012 · outside-scope · full-text

用功能探針進行微生物基因體代謝分類

Chi-Ching Lee; Wei-Cheng Lo; Szu-Ming Lai; Yi-Ping Phoebe Chen; Chuan Yi Tang; Ping-Chiang Lyu. Metabolic classification of microbial genomes using functional probes. BMC Genomics 13:157 (2012).

30 秒理解

以一組能代表代謝能力的功能探針基因,把微生物基因體投影成可比較的功能輪廓。

核心問題

能否把每個微生物 proteome 壓縮成一組具已知功能的短保守 motif 頻率,進而同時看見高階親緣關係與較細緻的代謝/生活型態差異?

直覺

這個方法不逐一對齊整個基因體,而像替每個微生物製作一張「功能條碼」:約一千個 Prosite descriptors 是固定探針,每個 proteome 中各探針出現多少次,除以 protein-coding gene 數後形成向量。向量相似的物種再被聚類。

為什麼重要

固定長度的 compositional representation 可快速比較大量或不完整基因體,也讓差異可回到具功能語意的 motifs 解讀。但得到的是由 probe composition 支持的分類,不是完整代謝 flux、機制因果或單一 marker 的鑑定結果。

閱讀前置

  • 理解 genome、protein-coding gene、proteome 與 conserved motif 的差別。
  • 知道 Prosite descriptor 是可掃描胺基酸序列的 pattern,而不是完整蛋白質功能的充分證明。
  • 理解 feature vector、頻率正規化、hierarchical clustering 與 average linkage。
  • 能分辨 pattern correlation、clustering distance、tree-topology correlation 與 classification accuracy。

paper-specific guide · plain → technical → input → output → source

逐步方法導讀

  1. 01 · 以保守功能 motifs 掃描 proteome

    準備一套固定的短序列探針,逐一搜尋每個物種的所有蛋白質。

    論文語言: 使用 Prosite descriptors(多數約 10–20 residues)作為 probes,排除 Prosite 標記為 highly frequent 的 patterns;對 RefSeq proteomes 計數每個 probe 的 occurrences。

    輸入: 微生物 protein sequences 與一套約 1,000 個 Prosite-derived probes。

    輸出: 每個物種的 probe occurrence counts。

    邊界: motif match 是功能線索;probe 選擇與當時 Prosite/proteome annotations 會限制可見的功能空間。

    PDF pp. 2–3, Probe-set concept; PDF p. 12, Methods, Data preparation

  2. 02 · 建立正規化功能條碼

    把不同大小的 proteomes 轉成可比較的相對頻率向量。

    論文語言: 對物種 A 的每個 probe i,以 occurrence count 除以該 proteome 的 protein-coding gene 數;全部 probes 的 normalized frequencies 組成 frequency pattern。pattern 間描述性相似度以 Pearson CC 計算。

    輸入: probe counts 與各 proteome 的 protein-coding gene 數。

    輸出: 每個微生物一個固定維度的 normalized probe-frequency vector。

    邊界: 除以 gene count 控制整體 proteome 大小,但不能修正所有 gene-calling、annotation completeness 或 motif-copy-number 偏差。

    PDF pp. 12–13, Methods, Computation of probe-set frequencies and Equation 1

  3. 03 · 聚類物種並量化樹拓樸

    依功能條碼排序物種;若要比較兩棵樹,先把葉節點間要走過的節點數轉成矩陣,再比較兩個矩陣。

    論文語言: CLUSTER 3.0 以 Spearman rank correlation 作 pattern distance、average linkage 建 hierarchical tree。tree comparison 對相同 leaves 建 N×N leaf-to-leaf traveling-distance matrices,再取兩矩陣的 Pearson CC。

    輸入: 多個 probe-frequency vectors;比較樹時還需要完全相同的 organism nodes。

    輸出: probe-set classification tree,以及成對樹之間的 topology CC。

    邊界: 建樹用的 Spearman distance、frequency-pattern 的 Pearson CC、tree-matrix 的 Pearson CC 是三個不同物件;不能互換解讀。

    PDF pp. 8–10, Figures 7–8; PDF p. 13, Methods, Construction and comparison of classification trees

關鍵結果

少量具生物意義的 probe 可支援跨基因體分類,提供比全基因組黑箱距離更可解釋的視角。

逐節證據導讀

論文事實、本站判讀與教學模型分開標示。

paper-fact

先驗證探針能看見功能層級

作者從每個 EC level-4 類別隨機選一個 enzyme,建立 2,935-enzyme nonredundant set。六個 EC level-1 classes 形成不同 probe-frequency patterns;接著 carbohydrate、energy、lipid、nucleotide 與 amino-acid metabolism 五條 pathways 也呈現可區分的 patterns。

在 proteome 層級,8 個 host-associated 與 21 個 free-living microbes 被清楚分開。這些例子支持 probe composition 捕捉功能差異,但 Figure 1 的低 cross-class CC 與 Figure 2 的 cluster separation 不是同一個 supervised classification accuracy。

原文定位: PDF pp. 3–5, Figures 1–3

paper-fact

高階偏親緣,細階可顯出代謝表型

843-microbe global tree 大致分開 Archaea 與 Bacteria,且多數物種依 phylum 與 class 聚集;較低階層則出現依寄生/共生、光合作用或化學合成等特徵重組的 clusters。作者在所述 Intel Xeon 2.13 GHz、3 GB memory 環境中建此樹耗時 1.3 分鐘。

十個 Lactobacillus species 依 homo-/hetero-fermentation 分成兩群;67 個 photosynthetic microbes 則在同一代謝能力背景下依六個 phyla 聚集。這支持方法同時保留部分親緣與功能訊號,但沒有證明 cluster 差異就是代謝機制的因果來源。

原文定位: PDF pp. 5–8, Figures 4–6; PDF p. 11, runtime

project-reading

HGT 與缺失資料測的是不同 robustness

415 個 HGT database organisms 的完整基因體樹與移除標註 HGT genes 後的樹,其 leaf-distance-matrix topology CC 為 0.93。這是兩棵固定 node-set 樹的拓樸穩定性,不是 HGT gene 偵測 accuracy,也不能排除未標註 HGT。

缺失資料測試選 87 species,每個 truncation rate 重複 10 次。一次只截短一個 genome 時,保留 50% genome 的平均 reclassification accuracy 為 94%;同時截短全部 87 genomes 至保留 50% 時,新樹與 reference tree 的 topology CC 約 0.78。兩個數字的實驗單位與成功條件不同,不能合成一個「94% 樹相似度」。

原文定位: PDF pp. 7–10, HGT analysis, Figures 7–8; PDF p. 12, Random truncation of proteomes

研究設計與評估

資料與樣本

多層驗證包含:2,935 個 nonredundant enzymes(每個 EC level-4 類別取一個)、五類 KEGG metabolic pathways、29 個 host/free-living microbes、843 個 microbes 的 global tree、10 個 Lactobacillus、67 個 photosynthetic microbes、415 個具 HGT annotations 的 microbes,以及 87-species random-truncation set。

比較基準

  • NCBI taxonomy/傳統 phylogenetic grouping 與 GOLD 的 living-environment/metabolic annotations,作為 cluster interpretation 的外部參照。
  • 未截短的 87-species probe-set tree 作為 incomplete-genome experiments 的 reference tree。
  • 含 HGT genes 與移除資料庫標註 HGT genes 的兩個 415-organism inputs,形成 robustness contrast。

指標

Probe-pattern correlation
兩個 normalized probe-frequency vectors 之間的 Pearson CC,用來描述 probe composition 相似度。
邊界: 不是建 hierarchical tree 時使用的 Spearman distance,也不是樹拓樸相似度。
Tree-topology CC
兩棵具有相同 leaves 的 leaf-to-leaf traveling-distance matrices 之 Pearson CC;1 代表此表示下完全相同。
邊界: 需要完全相同的 nodes;不直接衡量 taxonomic correctness,且不同拓樸可有相近的 matrix correlation。
One-genome reclassification accuracy
逐一截短一個 genome 後,重建樹拓樸仍與 reference 完全相同的案例數除以 87。
邊界: 不同於同時截短全部 genomes 的 tree-topology CC;結果也依 random removal 與選定 87 species。
Wall-clock runtime
在指定 Intel Xeon 2.13 GHz、3 GB memory 電腦上建立 843-organism tree 的經過時間。
邊界: 是 2012 年實作與硬體的系統時間,不是跨硬體的 algorithmic complexity benchmark。

論文報告的結果

probe-set trees 在高階分類多與 taxonomy 一致,並在細階呈現生活型態/代謝差異。HGT+ 與 HGT− trees 的 topology CC 為 0.93;87-species truncation 中,單一 genome 保留 50% 時平均 reclassification accuracy 為 94%,全部 genomes 同時保留 50% 時 topology CC 約 0.78。843-organism tree 在指定硬體耗時 1.3 分鐘。

PDF pp. 5–11, Figures 4–9 and runtime; PDF pp. 12–13, Methods

teaching-model · not a reported experiment

教學例(不是論文實驗)

三個 toy proteomes 的功能條碼

本站教學模型:固定使用三個 probes P1、P2、P3。Genome A 有 100 個 coding genes、counts=[10,5,0];B 有 200 genes、counts=[20,10,0];C 有 100 genes、counts=[1,2,12]。

  1. 將每個 count 除以 coding-gene 數,得到 A=[0.10,0.05,0]、B=[0.10,0.05,0]、C=[0.01,0.02,0.12]。
  2. A 與 B 雖然基因體大小不同,正規化後功能條碼相同;C 因 P3 富集而不同。
  3. 以指定 distance 與 linkage 聚類 vectors,記錄 A/B 同群、C 分離;再查 P3 的生物註解,提出可實驗驗證的功能假說。
  4. 若移除 C 的一半 proteins,重複掃描與建樹;分開報它是否回到同一位置,以及整棵樹的 topology metric。

帶走什麼: 正規化能處理總量尺度,但 cluster interpretation 仍須指定 probes、distance、linkage、missingness 與外部生物註解。

outside-scope

相對 FAST 的證據邊界

這是功能基因體分類,與 FAST 的三維疊合指標無直接可比性。

合法來源與取用

15 pages · SHA-256 748668dc776d365c1d8cb24970b3bc972cd9c1e3df6648b62ebaf94e2fbfda4e

合法開放全文。

Europe PMC open-access PDF

限制與防誤讀

  • 結果依賴 probe 選擇與基因註解品質。

證據定位清單

  1. PDF pp. 2–4, Probe-set concept and Figure 1
  2. PDF pp. 4–8, Proteome-level evaluation and Figures 2–6
  3. PDF pp. 8–10, HGT and incomplete-genome experiments, Figures 7–8
  4. PDF p. 11, runtime and classification of incomplete genomes
  5. PDF pp. 12–13, Methods, frequency normalization, clustering and tree comparison

理解檢查

  1. 為何 probe occurrence 要除以 protein-coding gene 數?

    答案: 讓不同 proteome 大小的 probe frequencies 能在共同尺度比較。

    未正規化 counts 會把較大的 proteome 系統性推向較高值。

  2. HGT+/HGT− 的 0.93 是何種 correlation?

    答案: 兩棵樹 leaf-to-leaf traveling-distance matrices 的 topology CC。

    它不是兩個 proteomes 的 frequency-pattern CC,也不是 HGT detection accuracy。

  3. 50% genome retained 的 94% 與約 0.78 為何能同時成立?

    答案: 94% 來自一次截短一個 genome 的 exact-topology reclassification;約 0.78 來自同時截短全部 87 genomes 的 tree-matrix CC。

    兩個實驗的 perturbation scope、分母與成功定義都不同。

讀完標準: 用一組至少 20 個 complete 與 20 個 simulated-incomplete proteomes 重建 probe-frequency workflow;預先固定 probe version、gene normalization、Spearman distance 與 average linkage,並分別報 pattern similarity、leaf-placement accuracy、tree-topology CC、runtime 與 annotation coverage。

本篇詞彙表

Functional probe
本文用來掃描 proteome 的短、保守、具功能註解之 Prosite sequence descriptor。
Probe-frequency pattern
所有 probes 的 occurrence counts 經 protein-coding gene 數正規化後組成的向量。
Compositional analysis
以成分的出現頻率比較 genomes,不依賴基因排列順序或 whole-genome alignment。
Leaf-to-leaf traveling distance
兩個 leaves 沿樹走到 lowest common ancestor 所跨越節點數的總和。