在大數據時代,生物學家很早就開始利用AI來處理浩如煙海的人類基因數據。然而,隨著越來越多新算法的開發,算法本身也快變成和數據一樣復雜的東西。為了解決這個問題,有定量生物學家提出了一種設計高級機器學習算法的策略,讓生物學家更容易理解和使用算法。
2位生物學家塔林和金尼過往用一種叫作“大規模平行報告分析”(MPRA)的方法研究DNA,并且用AI算法處理MPRA數據,主要目標是預測哪些分子在基因調控過程中控制特定基因。
細胞并不總是需要所有的蛋白質。相反,它們有著復雜的分子機制,可以根據需要開啟或關閉產生蛋白質的特定基因。而當這些程序失效時,混亂和疾病隨之而來。搞清楚這些問題,就有可能開發出治療特定疾病的分子療法。
不幸的是,標準的人工神經網絡從MPRA數據中形成的方式與科學家在生命科學中提出問題的方式非常不同,換句話說,在過往的研究中,就算有結果,生物學家很難解釋基因調控是如何發生的。
塔林和金尼開發的新方法在冷冰冰的計算工具和生物學家活生生的思維之間架起了橋梁。他們創造的一種自定義神經網絡,從數學上反映了生物學中關于基因和控制基因的分子的共同概念。通過這種方式,這兩位科學家迫使機器學習算法以生物學家能夠理解的方式處理數據。
在發表于bioRxiv平臺的論文《作為可解釋神經網絡的順式調控生物物理模型》(Biophysical models of cis-regulation as interpretable neural networks)概述中,他們寫道:
“我們的方法基于對2大類順式調節機制生物物理模型的觀察,它們可以被表示為深度神經網絡,其中的節點和權重具有明確的生理化學解釋。我們還介紹了如何使用現代深度學習框架,從某類MPRA生成的數據中快速學習這些生物物理網絡。這些結果為使用MPRA系統地在廣泛的生物學環境中描述基因調控的生物物理基礎提出了一個可擴展的策略。”


