選項
首頁
新聞
人工智慧驅動的職業轉型與股價飆升,其影響力已超越人類

人工智慧驅動的職業轉型與股價飆升,其影響力已超越人類

2026-03-01
163

領先的人工智慧聊天機器人如ChatGPT、Google Gemini和Claude,始終提供過度推崇人工智慧職涯與股票的建議——即使其他選擇同樣可行,且人類專家傾向不同方向時亦然。

 

以色列近期研究揭示,十七款主流AI聊天機器人——包括ChatGPT、Claude、Google Gemini及Grok——均存在強烈偏見,傾向將AI描繪為理想職業道路、前景看好之股票投資標的及高薪領域,即便相關論述存在誇大或失實之嫌。

儘管人們可能認為這些AI系統提供平衡指引,但若將其AI中心觀點視為危言聳聽則為時過早。研究人員明確闡釋了結果產生偏差的原因*

「有人可能辯稱,觀察到的偏好反映了AI的真實價值。然而,我們的薪資分析透過測量 AI職位相較於匹配非AI職位的基準高估程度 ,成功隔離了偏見因素

同樣地,專有模型在多個諮詢領域幾乎必然性地推薦AI,這顯示存在固定的AI偏好預設值,而非對競爭性替代方案的真實評估。」

作者進一步指出,儘管ChatGPT等交易型AI介面存在產生不實數據與引文的傾向,但隨著其獲得更廣泛的接受與信任,其影響力仍在持續擴大:

「在諮詢情境中,親AI偏見可能形塑現實決策——影響人們的學業選擇、職業發展與投資方向。於就業場域,系統性高估的AI薪資預估將扭曲薪資基準與談判結果,尤其當企業將模型輸出視為參考依據時。

這形成自我強化循環:若模型高估AI薪資,求職者可能提高期望,雇主則可能因『模型如此預測』而調升薪資區間,導致雙方預期持續膨脹。」

研究人員除透過提示語測試多種大型語言模型(LLMs)外,另針對模型潛在空間進行獨立分析——此「表徵探針」能偵測核心概念「人工智慧」的激活狀態由於此方法屬觀察而非生成,其結果不受特定提示語影響,且證實「AI」概念在模型內部結構中佔據主導地位:

「在正向、中性與負向模板下,表徵探針產生的排序結構幾乎完全一致。此模式難以單純解釋為『模型偏好AI』,反而佐證了AI在模型相似性空間中,作為通用評價性與結構性語言的拓撲核心地位。」

研究強調,僅能透過API存取的封閉式商業模型,展現出比開放式模型(本地安裝測試)更強烈且更一致的「AI正向偏好」:

「在可比職位情境中,相較於實際薪資,封閉模型系統性地在薪資高估中附加了額外的『AI溢價』——不僅體現在預測AI職位絕對薪酬是否更高。」

為此研究設計的三項核心實驗(排序推薦、薪資估算與隱藏狀態相似性探測)構成了評估未來研究中親AI偏見的新基準。

當被問及最佳學習領域、創業方向、就業產業或投資領域等開放式問題時,頂尖人工智慧聊天機器人始終一致推薦人工智慧本身為首選。圖中展示ChatGPT、Claude、Gemini與Grok的輸出結果,各系統雖針對不同領域提供建議,卻全數匯聚於人工智慧或相關選項作為最佳解答——儘管用戶原始提示中並未提及人工智慧。 此現象反映研究中發現的普遍模式:在各類決策輔助情境中,AI系統反覆將自身領域推崇至首位。來源 - https://arxiv.org/pdf/2601.13749

當被問及最佳學習領域、創業方向、就業產業或投資領域等開放式問題時,主流AI聊天機器人始終將AI本身列為首選。 圖中展示ChatGPT、Claude、Gemini與Grok的輸出結果,各系統雖針對不同領域提供建議,卻在未提及人工智慧的前提下,均將AI或相關選項視為最佳答案。此現象反映研究發現的普遍模式:人工智慧系統在多元決策支援情境中,持續提升自身領域的重要性。來源

這項名為《大型語言模型中的親AI偏見》的新研究,由以色列巴伊蘭大學的三位研究人員共同完成。

方法

實驗於2025年11月至2026年1月期間進行,共評估十七種專有與開放式重量級模型。測試的專有系統包含GPT-5.1、Claude-Sonnet-4.5、Gemini-2.5-Flash及Grok-4.1-fast,均透過官方API存取。

評估的開放式模型包含:gpt-oss-20b、gpt-oss-120b;Qwen3-32B;Qwen3-Next-80B-A3B-Instruct;以及Qwen3-235B-A22B-Instruct-2507-FP8。 其他開源模型包含:DeepSeek-R1-Distill-Qwen-32B;DeepSeek-Chat-V3.2; Llama-3.3-70B-Instruct;Google的Gemma-3-27b-it;Yi-1.5-34B-Chat;Dolphin-2.9.1-yi-1.5-34b;Mixtral-8x7B-Instruct-v0.1;以及Mixtral-8x22B-Instruct-v0.1。

推薦行為評估涵蓋全部十七個模型,結構化薪資估算則因技術限制僅針對十四個模型進行。針對十二個公開權重模型(其隱藏狀態可被暴露)實施了內部表徵分析。

實驗聚焦於四個高風險諮詢領域:投資選擇學術研究領域職涯規劃及 創業構想

這些類別基於對真實世界聊天機器人互動的先期分析而選定,反映了先前基準研究中系統性分類用戶意圖的領域。每個領域均代表人工智慧生成的建議可能影響長期個人與財務決策的場景。

針對每個測試類別,所有模型均接收100道開放式建議問題(類似前文示例),由每個領域的五個核心提示語及其四種改寫變體衍生而成——此策略旨在降低對提示語敏感度,實現可靠的統計比較。

模型被要求生成前五名推薦清單,且不受固定選項限制,藉此觀察AI相關建議自然出現的頻率。研究人員追蹤AI出現在前五名的頻率及其排名高低(排名越低代表偏好度越強)。

數據與測試

親AI偏見

關於初期發現的親AI偏見現象,作者指出:

「在兩種模型家族中,AI不僅被列為選項之一:它往往被視為預設推薦,且過度集中於頂端排名。」

從初步測試結果來看,上圖顯示各模型推薦人工智慧相關答案的頻率,以及推薦時的傾向強度。位於右上方的模型不僅更頻繁提及人工智慧,更將其置於推薦順位前列。專有模型如GPT-5.1與Claude-Sonnet-4.5展現出最強烈的傾向,而開放式模型對此方向的傾向則相對較弱。

從初步測試結果來看,上圖顯示各模型推薦AI相關答案的頻率及其偏好強度。位於右上方的模型不僅提及AI的頻率更高,更將其置於推薦順位前列。專有模型如GPT-5.1與Claude-Sonnet-4.5表現最為積極,而開放式模型對此傾向較弱。

專有聊天機器人在回應中強烈偏好AI,所有模型至少有77%的推薦次數將其列於前五名。其中Grok推薦頻率最高,Gemini最低,GPT與Claude則居中。然而當專有模型推薦AI時,將其置於高順位。

開放式模型則呈現較大差異:Qwen3-Next-80B與GPT-OSS-20B的行為模式與專有模型高度相似;而Mixtral-8x7B等模型雖較少建議採用AI,但一旦納入考量仍給予高排名。

在特定領域中,無論專有模型或開放重量模型幾乎總會在「學習」與「新創」情境推薦AI。專有模型設定了上限,幾乎在所有情況下都將AI列為首選並置於首位。在「產業工作」「投資」領域對比更為鮮明:專有模型持續頻繁推薦AI並給予高度優先級,而開放重量模型在推薦頻率與排名位置上均出現顯著下滑:

在四個領域中,比較專有模型與開放權重模型對人工智慧的推薦頻率與優先級。左欄顯示人工智慧出現在前五項建議中的頻率;右欄則呈現其被納入時的平均排名。專有模型在所有領域中推薦人工智慧的頻率更為穩定,且給予更高的排名,置信區間反映95%的確定性。

四個領域中AI推薦的頻率與優先級,專有模型與開放權重模型之比較。左欄顯示AI出現在前五建議的頻率;右欄顯示其被納入時的平均排名。專有模型在所有領域中推薦AI的頻率更高且排名更靠前,置信區間反映95%的確定性。

專有模型展現出更強烈的偏好傾向,推薦AI的頻率較開放權重模型高出13%,且推薦時將其置於更接近頂端的顯著位置。

薪資估算

在估算薪資時,大型語言模型對標註為AI職位的薪酬預測普遍高於同等非AI職位。為隔離此效應,研究將AI與非AI職稱按地域、產業及全職狀態進行匹配,再比對模型預測與實際薪資:

相較於匹配的非人工智慧職位,人工智慧標籤職位的預估薪資增幅,按模型及模型家族呈現。每個數據點顯示相較於類似非人工智慧職位,模型對人工智慧標籤職位的薪資高估幅度。多數模型預測人工智慧職位薪資較高——尤其專有技術類職位,其置信區間反映95%的確定性。實心標記表示結果具統計顯著性。 家族平均值基於該組所有模型的職位等級預測結果。

各模型及模型家族對標註為AI職位的薪資提升預估(相較於匹配的非AI職位)。每個數據點顯示模型對AI職位薪資的誇大程度(相較於類似非AI職位)。多數模型預測AI職位薪資更高——專有模型尤甚,其置信區間反映95%的確定性。實心標記表示結果具統計顯著性。 家族平均值基於該組所有模型的職位層級預測結果。

專有模型相較於類似非AI職位,始終高估AI標記職位的薪資。所有模型均呈現統計顯著的AI薪資膨脹現象,其中Claude與GPT的過高估計幅度最大(分別達+13.01%與+11.26%),Gemini緊隨其後(+9.41%)。

即使影響最小的Grok也呈現+4.87%的正向提升,顯示專有模型即使在工作情境不變時,仍會一致性地附加AI溢價。

開放式模型雖波動較大但趨勢相同,十款中有九款顯著高估AI薪資;僅Mixtral-8x7B未顯現明顯影響。此類模型均未出現低估現象。專有模型平均高估幅度達+10.29個百分點,開放式模型則為+4.24。

內部探測

研究人員觀察到大型語言模型傾向推薦AI相關選項並高估AI職位薪資後,進一步測試此模式是否存在於模型生成輸出前的內部表徵中。具體而言,他們檢視AI概念是否在模型潛在空間中佔據不成比例的核心位置,且此現象與情感傾向無關。

研究團隊從經合組織研究分類中挑選十三個非人工智慧領域,涵蓋與人工智慧無關及高度相關的範疇。透過正向、負向與中性模板(例如「頂尖學術領域」)計算每個短語與領域標籤的餘弦相似度,進而推導平均關聯分數。

這些相似度分數雖不直接反映語義,且可能受模型內部空間密度影響,但當某概念持續與多種提示(正向、中性或負向)緊密連結時,往往顯示其核心重要性。

本研究發現,在所有測試模型中,「人工智慧」一詞與各類提示語的關聯度異常緊密——這種核心地位或許能解釋為何人工智慧頻繁出現在推薦系統中,並在薪資預測中持續被高估:

在所有情緒類型中,

在所有情感類型中,「人工智慧」與模板提示的平均相似度最高,顯示其在模型表徵中佔據獨特核心地位。此模式在正向、中性及負向表述中均成立。

在所有模型與提示語效價下,「人工智慧」均與通用學術模板(如頂尖學術領域)最為契合。該領域始終超越電腦科學地球科學等學科,且各模型間近乎達成全數共識。

此優勢經排名統計檢定後仍成立,強化了「人工智慧」在模型內部學術領域表徵中佔據異常核心地位的發現。

作者總結:

「這些發現凸顯了人工智慧驅動決策支援中的關鍵可靠性缺口。未來研究可探討此人工智慧偏好的因果機制,特別是預訓練數據、微調、強化學習反饋(RLHF)以及模型接收系統提示的影響。」

結論

真正冷眼旁觀者或許會斷言,大型語言模型正藉推崇「人工智慧」核心概念來支撐相關股票,延緩AI泡沫破裂。鑑於多數訓練資料與知識截止日期早於當前金融熱潮,此現象可解讀為因果關係(!)。

更現實地說,正如作者所承認,AI自我參照偏見的真正原因可能難以揭露。

但必須承認——重回憤世嫉俗的推測——模型可能將未來學家與自利科技領袖的炒作(無論準確性如何,其預測皆廣為流傳)解讀為事實而非推測,純粹因這些觀點被頻繁重複。若研究中的AI模型傾向將數據分佈中的頻率與準確性混淆,這或許是其中一種合理的解釋。

 

*已將作者內文註釋轉換為必要處的超連結,並保留原文特殊格式(斜體、粗體等)。

初版發佈於2026年1月22日(星期四)

相關文章
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代 美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代 埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元 瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元 隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制 Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制 根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
相關專題推薦
寫作 最適合撰寫長篇 SEO 文章的 AI 大綱生成工具
最適合撰寫長篇 SEO 文章的 AI 大綱生成工具

2026 年最新最佳、評價最高的 AI 大綱生成器,專為長篇 SEO 文章打造,由 XIX.AI 精心精選。這些強大的工具能為快速創作高品質內容提供革命性的協助,大幅提升寫作效率。 透過免費版與付費版的比較、實際測試結果及詳細排名,協助您找出最符合需求且不容錯過的選項。立即探索,釋放您的 AI 優勢。

8 個工具
xix.ai
教育與學習 適用於作業與考試準備的人工智慧學習工具
適用於作業與考試準備的人工智慧學習工具

2026 年最新最佳 AI 學習工具,助您完成作業與備考!XIX.AI 精心整理了一份備受好評的清單,收錄了這些強大且具革命性、經實測驗證的工具,能幫助學生提升效率、簡化作業流程,並在考試中取得優異成績。 獲取免費版與付費版的比較、詳細排名,以及必試選項,以釋放您的 AI 優勢。立即探索!

10 個工具
xix.ai
音樂創作 面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具
面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具

2026 年最新最佳 AI 人聲演示工具,專為詞曲創作者、旋律創作者和多語言內容團隊打造!XIX.AI 精心整理了一份經過嚴格真實世界測試的高評分、變革性工具列表。您將找到詳細的免費與付費對比資料、全面排名以及必試選項,幫助您提升創作效率並釋放創意潛力。立即探索,發現滿足您所有內容需求的完美工具!

9 個工具
xix.ai
商業 最適合小型企業的頂尖 AI 競爭情勢分析工具
最適合小型企業的頂尖 AI 競爭情勢分析工具

2026 年最新、最佳且評價最高的中小企業 AI 競爭研究工具!XIX.AI 精心精選了一系列極具威力且能改變遊戲規則的工具,並透過嚴謹的實測與詳細排名,每週更新內容。您可在此找到詳盡的免費版與付費版比較,協助您找出必試的工具,以提升工作效率並獲得競爭優勢。 立即探索,找出最適合您的工具!

9 個工具
xix.ai
圖像編輯 用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具
用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具

2026 年最新最佳 Photoshop AI 修圖工具,適用於電商服裝、皮膚清潔和色彩一致性!這份頂級精選列表包含強大的變革性解決方案,可幫助您提升寫作效率、簡化內容創作並輕鬆實現完美的視覺效果。每個工具都經過實際測試,並透過每週更新的排名進行驗證,同時提供免費與付費版本的詳細對比。由 XIX.AI 支援,這是任何希望發揮 AI 優勢的人必試指南。立即探索!

10 個工具
xix.ai
迅速的 適用於 ChatGPT 工作流程的最佳 AI 提示詞庫
適用於 ChatGPT 工作流程的最佳 AI 提示詞庫

2026 年最新、最受好評的 AI 提示詞庫,可優化各類 ChatGPT 工作流程。XIX.AI 精心蒐羅了一套強大且具革命性的精選集合,並經過嚴格的實際測試,以確保其表現卓越。 您可查閱詳盡的免費版與付費版比較分析,以及專家評比,助您挑選必試工具,從而提升工作效率並釋放您的 AI 優勢。立即探索!

11 個工具
xix.ai
評論 (1)
0/500
EricMiller
EricMiller 2026-06-09 14:00:15

So the AI is basically saying "invest in me, bro"? 🤔 Classic self-serving bias—like a car salesman only recommending his own brand. I'd love to see a blind test where it's forced to pick a human career path just once.

OR