2025 年的人臉識別:連體網路或二元分類?
從安全系統到社交媒體,人臉辨識在各種應用中都扮演著重要的角色。雖然三重損失(triplet loss)是一種廣泛應用於訓練卷繞神經網路(CNN)的方法,但另一種策略則是將此任務設定為二元分類問題。這種方法利用連體網路,提供了一種獨特的方式來學習有效的人臉驗證所需的參數。接下來,我們將探討如何利用一對神經網路來產生嵌入。
重點
連體網路對於人臉驗證非常有效。
人臉識別可以建模為二元分類任務。
學習相似性函數包含 logistic 回歸。
預先計算嵌入可提高部署效率。
流程包括資料收集、模型訓練、評估和部署。
臉部驗證和識別都可以使用二進位分類進行訓練,以取代三重損失。
瞭解人臉辨識與驗證
二元分類的人臉識別

人臉識別不只是識別一個人,還要驗證一個人所聲稱的身份。這就是所謂的人臉驗證。一種實用的方法將驗證視為二進制分類問題。與其在眾多臉孔中進行區分,系統不如直接回答一個問題:"這兩張臉是否屬於同一個人?這種二進制框架簡化了問題,並提高了計算效率。此技術依賴於連體網路,由兩個具有共用權重和架構的相同神經網路組成。每個網路處理一張輸入影像,並比較其輸出,以得出相似度得分。如果分數超過定義的臨界值,則認為這兩張臉是匹配的;否則,它們會被分類為不同的臉。經訓練的網路對於匹配的身分會輸出 1,對於不匹配的身分則輸出 0。這與更複雜的系統形成對比,因為複雜的系統必須區分許多已知的個體。
連體網路架構
此方法以連體網路架構為中心。

此架構將兩個相同的神經網路配對,各自處理兩個輸入影像中的一個。這些網路會計算內嵌,也就是編碼獨特臉部特徵的高維向量。透過比較這些內嵌,系統可以評估臉部相似度。嵌入過程通常包括卷積層、池化層和全連結層,每個層級都會從影像中萃取逐步複雜的特徵。最後的輸出是一個向量 - 通常是 128 維 - 它能捕捉基本的臉部特徵。更大的維度也可用於偵測更精細的細節。最重要的是,Siamese 設定中的兩個網路都共用相同的參數,確保嵌入是透過相同的特徵萃取過程產生,而且可以直接比較。
使用邏輯回歸學習相似度函數
使用邏輯回歸

為了判斷兩張臉是否代表同一個人,必須比較來自連體網路的內嵌。邏輯回歸單元會對這些內嵌應用sigmoid 函數,產生一個反映匹配可能性的概率分數。這個單元的輸入並不是原始的內嵌,而是從這些內嵌衍生出來的特徵。常見的方法是計算兩個嵌入式之間的元素絕對差異,強調差異最大的特徵。Chi-square 相似度是另一種常用的技術。目的是形成高度區別的特徵,讓邏輯迴歸單元能做出精確的預測。元素之間的差異會饋入邏輯迴歸模型,而邏輯迴歸模型會學習分配適當的權重。如果差異極小,該單元會指定高概率,表示是同一個人;如果差異很大,則會指定低概率,表示是不同的個人。
訓練連體網路和 Logistic 回歸
逐步訓練流程
- 收集訓練資料:首先編譯一個人臉影像資料集,標籤顯示影像對描繪的是同一人還是不同的人。此資料集可訓練連體網路和邏輯迴歸單元。
- 設定連體網路:設定兩個具有相同架構和共用權重的相同 CNN。這些網路將學習從輸入的臉部影像產生嵌入。
- 計算特徵差異:確定每個影像對的兩個 CNN 所產生的內嵌之間的元素絕對差異。這些差異會成為邏輯回歸單元的輸入特徵。
- 整合邏輯迴歸:運用邏輯迴歸模型將特徵差異轉換成概率分數,以顯示人臉是否匹配。
- 微調:透過調整分配給特徵的權重 (例如 128 維嵌入中的權重),精細化邏輯迴歸層。
- Backpropagation 訓練:使用反向傳播訓練完整的系統 - 網路與邏輯回歸單元。這可最小化懲罰預測錯誤的損失函數,藉由最佳化網路權重和偏置,逐漸提高準確度。
- 調整權重:最終的邏輯迴歸模型可以包含額外的參數,例如權重 (W) 和偏置 (B)。
- 預先計算嵌入:為了加快部署速度,可以預先計算嵌入,以便進行快速比較。
人臉辨識連體網路的優缺點
優點
運算效率
直接處理人臉驗證
有效的特徵萃取
缺點
訓練資料需求
過度擬合的可能性
泛化程度有限
常見問題
什麼是連體網路,它們在人臉識別中如何運作?
連體網路是由兩個或兩個以上相同子網路組成的神經網路。每個子網路接收不同的輸入,但與其他子網路共享權重。在人臉識別中,這些網路會處理成對的人臉影像以產生嵌入,然後評估其相似性。
為什麼有時人臉識別被視為二元分類問題?
將人臉辨識視為二元分類問題,可將其簡化為判斷兩張人臉是否匹配,相較於區分許多個人,可提高效率。此方法使用連體網路來比較成對的人臉影像。
在學習人臉識別的相似性函數時,邏輯回歸的作用是什麼?
Logistic 回歸將連體網路嵌入之間的差異映射為概率分數。此分數可估算出兩張臉是同一人的可能性,以支援二元判斷。
相關問題
此連體網路方法與傳統方法(如 triplet loss)比較如何?
傳統的方法(如三連丟失)旨在學習一個嵌入空間,在這個空間中,同一個人的面孔會比較接近,而不同人的面孔會比較遠。二元分類結構的暹羅網路則專注於驗證兩張臉是否相同,提供了計算上的優勢。最佳選擇取決於特定的應用程式和資料集特性。
是否有其他方法可以評估嵌入的相似性?
有,其他方法包括余弦相似度、歐氏距離和卡方相似度。卡方相似度公式提供了另一種方法來進行人臉識別。每種技術都有其優點,適用於不同的資料類型和使用個案。例如,余弦相似性在高維數據中表現良好,而歐氏距離在低維數據中則很有效。
實際部署受過訓練的系統需要做什麼?
部署需要預先計算嵌入,以避免儲存原始影像。本系統以連體網路架構為基礎,旨在有效比較這些內嵌值。
相關文章
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
相關專題推薦
評論 (2)
0/500
Interessant, dass hier Siamese Networks und binäre Klassifikation verglichen werden. Ich frage mich, ob die Wahl je nach Anwendungsfall variieren sollte – vielleicht ist der eine Ansatz für Sicherheitssysteme besser, der andere für Social Media? 🤔 Die Diskussion um Triplet Loss vs. Alternativen zeigt, wie dynamisch das Feld noch ist. Hoffentlich bleibt die Ethik dabei nicht auf der Strecke, gerade bei Gesichtserkennung.
從安全系統到社交媒體,人臉辨識在各種應用中都扮演著重要的角色。雖然三重損失(triplet loss)是一種廣泛應用於訓練卷繞神經網路(CNN)的方法,但另一種策略則是將此任務設定為二元分類問題。這種方法利用連體網路,提供了一種獨特的方式來學習有效的人臉驗證所需的參數。接下來,我們將探討如何利用一對神經網路來產生嵌入。
重點
連體網路對於人臉驗證非常有效。
人臉識別可以建模為二元分類任務。
學習相似性函數包含 logistic 回歸。
預先計算嵌入可提高部署效率。
流程包括資料收集、模型訓練、評估和部署。
臉部驗證和識別都可以使用二進位分類進行訓練,以取代三重損失。
瞭解人臉辨識與驗證
二元分類的人臉識別

人臉識別不只是識別一個人,還要驗證一個人所聲稱的身份。這就是所謂的人臉驗證。一種實用的方法將驗證視為二進制分類問題。與其在眾多臉孔中進行區分,系統不如直接回答一個問題:"這兩張臉是否屬於同一個人?這種二進制框架簡化了問題,並提高了計算效率。此技術依賴於連體網路,由兩個具有共用權重和架構的相同神經網路組成。每個網路處理一張輸入影像,並比較其輸出,以得出相似度得分。如果分數超過定義的臨界值,則認為這兩張臉是匹配的;否則,它們會被分類為不同的臉。經訓練的網路對於匹配的身分會輸出 1,對於不匹配的身分則輸出 0。這與更複雜的系統形成對比,因為複雜的系統必須區分許多已知的個體。
連體網路架構
此方法以連體網路架構為中心。

此架構將兩個相同的神經網路配對,各自處理兩個輸入影像中的一個。這些網路會計算內嵌,也就是編碼獨特臉部特徵的高維向量。透過比較這些內嵌,系統可以評估臉部相似度。嵌入過程通常包括卷積層、池化層和全連結層,每個層級都會從影像中萃取逐步複雜的特徵。最後的輸出是一個向量 - 通常是 128 維 - 它能捕捉基本的臉部特徵。更大的維度也可用於偵測更精細的細節。最重要的是,Siamese 設定中的兩個網路都共用相同的參數,確保嵌入是透過相同的特徵萃取過程產生,而且可以直接比較。
使用邏輯回歸學習相似度函數
使用邏輯回歸

為了判斷兩張臉是否代表同一個人,必須比較來自連體網路的內嵌。邏輯回歸單元會對這些內嵌應用sigmoid 函數,產生一個反映匹配可能性的概率分數。這個單元的輸入並不是原始的內嵌,而是從這些內嵌衍生出來的特徵。常見的方法是計算兩個嵌入式之間的元素絕對差異,強調差異最大的特徵。Chi-square 相似度是另一種常用的技術。目的是形成高度區別的特徵,讓邏輯迴歸單元能做出精確的預測。元素之間的差異會饋入邏輯迴歸模型,而邏輯迴歸模型會學習分配適當的權重。如果差異極小,該單元會指定高概率,表示是同一個人;如果差異很大,則會指定低概率,表示是不同的個人。
訓練連體網路和 Logistic 回歸
逐步訓練流程
- 收集訓練資料:首先編譯一個人臉影像資料集,標籤顯示影像對描繪的是同一人還是不同的人。此資料集可訓練連體網路和邏輯迴歸單元。
- 設定連體網路:設定兩個具有相同架構和共用權重的相同 CNN。這些網路將學習從輸入的臉部影像產生嵌入。
- 計算特徵差異:確定每個影像對的兩個 CNN 所產生的內嵌之間的元素絕對差異。這些差異會成為邏輯回歸單元的輸入特徵。
- 整合邏輯迴歸:運用邏輯迴歸模型將特徵差異轉換成概率分數,以顯示人臉是否匹配。
- 微調:透過調整分配給特徵的權重 (例如 128 維嵌入中的權重),精細化邏輯迴歸層。
- Backpropagation 訓練:使用反向傳播訓練完整的系統 - 網路與邏輯回歸單元。這可最小化懲罰預測錯誤的損失函數,藉由最佳化網路權重和偏置,逐漸提高準確度。
- 調整權重:最終的邏輯迴歸模型可以包含額外的參數,例如權重 (W) 和偏置 (B)。
- 預先計算嵌入:為了加快部署速度,可以預先計算嵌入,以便進行快速比較。
人臉辨識連體網路的優缺點
優點
運算效率
直接處理人臉驗證
有效的特徵萃取
缺點
訓練資料需求
過度擬合的可能性
泛化程度有限
常見問題
什麼是連體網路,它們在人臉識別中如何運作?
連體網路是由兩個或兩個以上相同子網路組成的神經網路。每個子網路接收不同的輸入,但與其他子網路共享權重。在人臉識別中,這些網路會處理成對的人臉影像以產生嵌入,然後評估其相似性。
為什麼有時人臉識別被視為二元分類問題?
將人臉辨識視為二元分類問題,可將其簡化為判斷兩張人臉是否匹配,相較於區分許多個人,可提高效率。此方法使用連體網路來比較成對的人臉影像。
在學習人臉識別的相似性函數時,邏輯回歸的作用是什麼?
Logistic 回歸將連體網路嵌入之間的差異映射為概率分數。此分數可估算出兩張臉是同一人的可能性,以支援二元判斷。
相關問題
此連體網路方法與傳統方法(如 triplet loss)比較如何?
傳統的方法(如三連丟失)旨在學習一個嵌入空間,在這個空間中,同一個人的面孔會比較接近,而不同人的面孔會比較遠。二元分類結構的暹羅網路則專注於驗證兩張臉是否相同,提供了計算上的優勢。最佳選擇取決於特定的應用程式和資料集特性。
是否有其他方法可以評估嵌入的相似性?
有,其他方法包括余弦相似度、歐氏距離和卡方相似度。卡方相似度公式提供了另一種方法來進行人臉識別。每種技術都有其優點,適用於不同的資料類型和使用個案。例如,余弦相似性在高維數據中表現良好,而歐氏距離在低維數據中則很有效。
實際部署受過訓練的系統需要做什麼?
部署需要預先計算嵌入,以避免儲存原始影像。本系統以連體網路架構為基礎,旨在有效比較這些內嵌值。
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
Interessant, dass hier Siamese Networks und binäre Klassifikation verglichen werden. Ich frage mich, ob die Wahl je nach Anwendungsfall variieren sollte – vielleicht ist der eine Ansatz für Sicherheitssysteme besser, der andere für Social Media? 🤔 Die Diskussion um Triplet Loss vs. Alternativen zeigt, wie dynamisch das Feld noch ist. Hoffentlich bleibt die Ethik dabei nicht auf der Strecke, gerade bei Gesichtserkennung.





首頁






