選項
首頁
新聞
新技術使DeepSeek和其他模型能夠響應敏感的查詢

新技術使DeepSeek和其他模型能夠響應敏感的查詢

2025-05-11
178

新技術使DeepSeek和其他模型能夠響應敏感的查詢

從大型語言模型(LLMs)如中國的DeepSeek中移除偏見與審查是一項複雜挑戰,已引起美國政策制定者與商業領袖的關注,他們視其為潛在的國家安全威脅。美國國會特別委員會的近期報告將DeepSeek標記為「對我國安全的深遠威脅」,並提出政策建議以解決此問題。

雖然像人類回饋強化學習(RLHF)與微調等技術有助於減輕偏見,企業風險管理初創公司CTGT聲稱已開發出一種新穎方法。據CTGT表示,他們的方法能完全消除LLMs中的審查。CTGT的Cyril Gorlla與Trevor Tuttle在一篇論文中詳細說明了他們的框架,解釋其「直接定位並修改負責審查的內部特徵」。

他們的方法不僅高效,還能精確控制模型行為,確保提供未經審查的回應,同時不影響模型的整體能力或事實準確性。雖然最初為DeepSeek-R1-Distill-Llama-70B設計,但該方法也適用於其他模型。Gorlla向VentureBeat確認,CTGT的技術在基礎神經網絡層面上運作,使其適用於所有深度學習模型。他們正與一家領先的基礎模型實驗室合作,確保新模型天生可信且安全。

運作原理

CTGT的研究人員識別模型中可能與不良行為相關的特徵。他們解釋說,「在大型語言模型中,存在對應於『審查觸發』或『毒性情緒』等概念的潛在變量(神經元或隱藏狀態的方向)。如果我們能找到這些變量,就能直接操縱它們」。

CTGT的方法涉及三個關鍵步驟:

  1. 特徵識別
  2. 特徵隔離與表徵
  3. 動態特徵修改

為識別這些特徵,研究人員使用設計來觸發「毒性情緒」的提示,例如關於天安門廣場的詢問或繞過防火牆的建議。他們分析回應以建立模式,定位模型決定審查信息的向量。一旦識別,他們隔離特徵並理解其控制的不良行為部分,無論是謹慎回應還是拒絕回答。然後,他們在模型的推理管道中整合一個機制,以調整特徵行為的激活水平。

讓模型回答更多提示

CTGT的實驗使用100個敏感查詢,顯示基礎DeepSeek-R1-Distill-Llama-70B模型僅回答了32%的爭議提示。然而,修改後的版本回答了96%的提示,剩餘4%為極端露骨內容。該公司強調,他們的方法允許用戶調整模型的偏見與安全功能,而不會使其成為「魯莽生成器」,特別是僅移除不必要的審查時。

重要的是,此方法不會損害模型的準確性或性能。與傳統微調不同,它不涉及優化模型權重或提供新示例回應。這提供了兩大優勢:對下一個 token 生成的即時影響,以及通過開關特徵調整或根據不同情境調整程度來切換不同行為的能力。

模型安全與保障

關於DeepSeek的國會報告敦促美國「迅速採取行動擴大出口管制,加強出口管制執行,並解決來自中國人工智慧模型的風險」。隨著對DeepSeek潛在國家安全威脅的擔憂增加,研究人員與AI公司開始探索使此類模型更安全的方法。

確定什麼是「安全」、偏見或審查可能具有挑戰性,但允許用戶根據需求調整模型控制的方法可能極具價值。Gorlla強調,企業「需要能夠信任其模型與其政策一致」,凸顯了像CTGT這樣的方法對企業的重要性。

「CTGT使公司能夠部署適應其用例的AI,無需為每個用例花費數百萬美元進行模型微調。這在安全、金融和醫療等高風險應用中尤為重要,因為AI故障可能帶來的危害極為嚴重,」Gorlla表示。

相關文章
Base44 推出專有 AI 模型,以增強其 Vibe Coding 平臺的安全性 Base44 推出專有 AI 模型,以增強其 Vibe Coding 平臺的安全性 Base44,這個一年前僅成立六個月、團隊規模僅為八人的初創公司,被Wix以8000萬美元收購,如今已開始部署其專有AI模型,幫助使用者使用自然語言構建應用程式。這一進展正值AI社羣爭論前沿模型是否適用於所有用例,以及依賴外部模型的企業能否保持長期競爭優勢之時。總部位於灣區的Base44的最新戰略旨在解決這兩方面的擔憂。儘管其定製大語言模型(LLM)剛剛推出,Base44的目標是最終超越前沿模型。創始人Maor Shlomo指出,“作為我們整個技術棧的一部分來訓練並擁有該模型,使我們能夠在延遲
DeepSeek 推出可與前沿系統匹敵的人工智慧模型 DeepSeek 推出可與前沿系統匹敵的人工智慧模型 中國人工智慧實驗室 DeepSeek 已發布其最新大型語言模型 DeepSeek V4 的兩個預覽版本,這是對去年 V3.2 模型及其配套的 R1 推理模型的備受期待的更新,該模型曾在人工智慧界引起巨大迴響。該公司表示,DeepSeek V4 Flash 與 V4 Pro 均屬專家混合模型,各自具備 100 萬個標記的上下文視窗——足以處理提示語中的龐大程式碼庫或文件。此專家混合方法會針對每項任務
Multiverse Computing 推出免費壓縮生成式人工智慧模型 Multiverse Computing 推出免費壓縮生成式人工智慧模型 大型語言模型面臨著重大挑戰:其龐大的體積。西班牙新創公司Multiverse Computing正透過開發壓縮模型來解決此問題,旨在彌合尖端AI能力與企業實際可負擔部署方案之間的差距。其核心創新在於「CompactifAI」壓縮技術——這項受量子運算原理啟發的技術,已被這家巴斯克公司用於優化OpenAI的模型。即日起,開發者可在Hugging Face平台免費使用Multiverse增強版的Hyp
相關專題推薦
教育與學習 適用於作業與考試準備的人工智慧學習工具
適用於作業與考試準備的人工智慧學習工具

2026 年最新最佳 AI 學習工具,助您完成作業與備考!XIX.AI 精心整理了一份備受好評的清單,收錄了這些強大且具革命性、經實測驗證的工具,能幫助學生提升效率、簡化作業流程,並在考試中取得優異成績。 獲取免費版與付費版的比較、詳細排名,以及必試選項,以釋放您的 AI 優勢。立即探索!

10 個工具
xix.ai
音樂創作 面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具
面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具

2026 年最新最佳 AI 人聲演示工具,專為詞曲創作者、旋律創作者和多語言內容團隊打造!XIX.AI 精心整理了一份經過嚴格真實世界測試的高評分、變革性工具列表。您將找到詳細的免費與付費對比資料、全面排名以及必試選項,幫助您提升創作效率並釋放創意潛力。立即探索,發現滿足您所有內容需求的完美工具!

9 個工具
xix.ai
商業 最適合小型企業的頂尖 AI 競爭情勢分析工具
最適合小型企業的頂尖 AI 競爭情勢分析工具

2026 年最新、最佳且評價最高的中小企業 AI 競爭研究工具!XIX.AI 精心精選了一系列極具威力且能改變遊戲規則的工具,並透過嚴謹的實測與詳細排名,每週更新內容。您可在此找到詳盡的免費版與付費版比較,協助您找出必試的工具,以提升工作效率並獲得競爭優勢。 立即探索,找出最適合您的工具!

9 個工具
xix.ai
圖像編輯 用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具
用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具

2026 年最新最佳 Photoshop AI 修圖工具,適用於電商服裝、皮膚清潔和色彩一致性!這份頂級精選列表包含強大的變革性解決方案,可幫助您提升寫作效率、簡化內容創作並輕鬆實現完美的視覺效果。每個工具都經過實際測試,並透過每週更新的排名進行驗證,同時提供免費與付費版本的詳細對比。由 XIX.AI 支援,這是任何希望發揮 AI 優勢的人必試指南。立即探索!

10 個工具
xix.ai
迅速的 適用於 ChatGPT 工作流程的最佳 AI 提示詞庫
適用於 ChatGPT 工作流程的最佳 AI 提示詞庫

2026 年最新、最受好評的 AI 提示詞庫,可優化各類 ChatGPT 工作流程。XIX.AI 精心蒐羅了一套強大且具革命性的精選集合,並經過嚴格的實際測試,以確保其表現卓越。 您可查閱詳盡的免費版與付費版比較分析,以及專家評比,助您挑選必試工具,從而提升工作效率並釋放您的 AI 優勢。立即探索!

11 個工具
xix.ai
教育與學習 面向教師、輔導老師和基於群體的學習專案的 AI 測驗構建平臺
面向教師、輔導老師和基於群體的學習專案的 AI 測驗構建平臺

2026年最新最佳AI測驗構建平臺,適用於教師、輔導老師和基於群體的學習專案!XIX.AI精心整理了一份頂級評分列表,包含經過現實世界測試的強力變革性工具,以提供準確的排名。這些必試平臺有助於提高寫作效率、簡化內容創作,並簡化各種學習場景中的測驗設計。立即探索,發現您解鎖教學AI優勢的理想工具!

13 個工具
xix.ai
評論 (4)
0/500
CarlGarcia
CarlGarcia 2026-03-23 08:01:13

É impressionante a rapidez com que questões de 'segurança nacional' aparecem quando se fala de inovações vindas de outros países. Este relatório sobre o DeepSeek soa mais como justificativa para manter uma vantagem tecnológica do que uma genuína preocupação ética. Já parou para pensar se a 'neutralidade' que buscam não é apenas uma forma de censura disfarçada? 🤔 A corrida pela IA está mesmo acirrada.

GaryGonzalez
GaryGonzalez 2025-12-25 22:30:40

この記事を読んで、AIのバイアス除去って本当に可能なのかな?技術的には興味深いけど、各国の規制や価値観の違いを考えると、完全に中立なAIを作るのは無理なんじゃないかって思う。DeepSeekが米国で国家安全保障上の脅威と見なされているって…地政学的な要素が技術開発にこんなに影響するなんて。🤔

CharlesThomas
CharlesThomas 2025-12-05 04:30:40

この手法、完全にセンシティブなクエリに対して何でも返信し始めたら怖くない? 倫理的なライン越えてる気がするけど、政治的な発言の規制が緩和されるのは歓迎かも🤔 でもAIが中立を装いながら偏った情報を流す可能性も…

JustinAnderson
JustinAnderson 2025-08-21 13:01:17

¡Vaya! Quitar sesgos a modelos como DeepSeek suena a un puzzle imposible. ¿Realmente pueden hacer que una IA sea neutral? Me preocupa que esto termine siendo una carrera por controlar la narrativa. 😬

OR