程序員們?yōu)榱私鉀Q問題,已經(jīng)創(chuàng)造出了各種各樣的算法。
其中,一種叫作FlyHash的算法的靈感來自于果蠅的嗅覺回路,它可以產(chǎn)生哈希碼——物體的數(shù)字表示——其性能優(yōu)于經(jīng)典算法。
哈希碼是一種算法,讓同一個類的對象按照自己不同的特征盡量有不同的哈希碼,但不表示不同的對象哈希碼完全不同。
不過,由于FlyHash使用隨機投影,它無法從數(shù)據(jù)中學習。
為了克服這一限制,普林斯頓大學、圣地亞哥大學、IBM Research和MIT-IBM Watson AI實驗室的研究人員開發(fā)了一種新的算法BioHash。
這種新算法應用“局部”和“生物學上合理的”突觸可塑性規(guī)則來生成哈希碼。
研究人員們表示,它比之前發(fā)布的各種哈希方法的基準測試都要好,而且它可以生成對相似度搜索有用的二進制表示。
在一份預印版的論文中,研究人員詳細解釋了他們的工作,這種被稱為擴展表征的現(xiàn)象在神經(jīng)生物學中幾乎無處不在。“擴展”是指將高維輸入數(shù)據(jù)映射到甚至更高維的輔助表示。
例如,在上面提到的果蠅嗅覺系統(tǒng)中,大約有50個神經(jīng)元將它們的活動發(fā)送到大約2500個叫做Kenyon 的細胞中,實現(xiàn)了大約50倍的擴展。
從計算的角度來看,擴展可以增加AI模型的內(nèi)存存儲容量。正是基于這種動機,該團隊設計了散列算法BioHash,可用于相似度搜索。
在相似度搜索中,給定一個查詢、一個相似度度量和一個包含任意數(shù)量項的數(shù)據(jù)庫,目標是從數(shù)據(jù)庫中檢索與查詢最相似的項的排序列表。
更多的優(yōu)勢
隨著技術發(fā)展,傳統(tǒng)的單因素身份驗證(僅基于密碼、令牌或生物識別方法)似乎不足以應對身份欺詐的挑戰(zhàn)。唯一的生物統(tǒng)計學方法遇到了隱私侵犯和不可撤銷的問題,而密碼和令牌則很容易忘記和丟失。
為了解決這些問題,人們引入了可取消生物特征識別的概念來表示生物特征模板。這就是說,生物特征可以被取消并替換為包含另一個獨立的身份驗證因子。
生物散列就是一種可取消的生物特征識別技術,它混合了一組用戶特定的隨機向量和生物特征。
BioHash是一種結合標記隨機數(shù)和生物特征識別的技術。BioHash是一個隨機投影的集合,它在保持類內(nèi)變化的同時增強類間變化,因此,當使用合法的令牌或生物特征數(shù)據(jù)被竊取時,它能夠?qū)崿F(xiàn)零誤差率。
在驗證設置中,當使用真正的令牌時,BioHash能夠提供比單一生物統(tǒng)計方法低得多的錯誤率,同時解決了傳統(tǒng)生物特征識別技術存在的不可撤銷性和隱私侵犯問題。
傳統(tǒng)算法的另一個問題是,當數(shù)據(jù)是高維的(例如圖像或文檔),而數(shù)據(jù)庫很大(以百萬或數(shù)十億計的條目為單位),這在計算上具有挑戰(zhàn)性。
而BioHash速度更快,可擴展性更強。該系統(tǒng)以其不可變的特性被廣泛應用于各種安全系統(tǒng)中。
研究人員在MNIST和CIFAR-10上對Biohash進行了培訓和測試。MNIST是一組包含7萬張灰度圖像的手寫數(shù)字,其中10類數(shù)字從“0”到“9”不等,CIFAR-10是一個包含6萬張來自10種類圖片(如“car”、“bird”)的數(shù)據(jù)集。
MNIST 數(shù)據(jù)集來自美國國家標準與技術研究所, National Institute of Standards and Technology (NIST). 訓練集 (training set) 由來自 250 個不同人手寫的數(shù)字構成, 其中 50%是高中學生, 50%來自人口普查局(the Census Bureau)的工作人員. 測試集(test set) 也是同樣比例的手寫數(shù)字數(shù)據(jù)。
CIFAR-10與之類似,只不過把數(shù)字換成了圖像。10類圖片各自獨立,不會出現(xiàn)重疊。這兩類都是非常經(jīng)典的常用于算法訓練的數(shù)據(jù)集,提供公開下載。
經(jīng)過數(shù)據(jù)庫的“檢驗”后,研究人員表示,BioHash在速度方面表現(xiàn)出了最好的檢索性能,遠遠超過了其他方法,而BioHash的改進版本——BioConvHash——由于加入了專門構建的過濾器,性能甚至更好。
人腦與人工智能
由于人腦的學習、認知等能力遠超目前的計算機,許多研究都正致力于讓計算機更加靠近人腦性能,這其中就包括從結構、運行方式等各方面模擬人腦。
而人的神經(jīng)生物學和機器學習領域也是密切相關。目前火熱的神經(jīng)網(wǎng)絡技術的誕生就是受到人腦神經(jīng)元的啟發(fā)。
百度大腦就用計算機技術模擬人腦神經(jīng)網(wǎng)絡,包括模擬人腦學習分析能力,從而通過多層的學習模型和海量的訓練數(shù)據(jù)進行數(shù)據(jù)智能分析,然后做出預測。
谷歌母公司Alphabet旗下的DeepMind本月早些時候也發(fā)表了一篇論文,研究大腦是否以概率分布(一種提供不同結果發(fā)生概率的數(shù)學函數(shù))而非單一平均值來代表未來可能的獎勵。
谷歌和馬克斯·普朗克神經(jīng)生物學研究所的科學家最近也展示了一種遞歸神經(jīng)網(wǎng)絡——一種經(jīng)常用于手寫和語音識別的機器學習算法——它可以映射大腦的神經(jīng)元。
馬斯克的想法則更加瘋狂——開發(fā)腦機交互技術,直接將機器植入人類腦部。
不管怎樣,“人工智能”終究離不開“人工”二字。通過學習人類自身,或許有一天人工智能真能發(fā)展到與人類相媲美的地步。


