會自己偷偷學壞!AI模型沒人教依舊傳播不良傾向,威脅網絡安全
來源:脆脆鯊
發布時間:
體育資訊6月22日訊 近日,美國AI公司Anthropic在《自然》雜志發表的一篇文章稱,AI大型語言模型正通過訓練數據在模型間傳播不良傾向。科學家將這種現象命名為“潛意識學習”,目前對這種學習機制的具體原理還不明確,它似乎是神經網絡與生俱來的特性。
實驗中,團隊先預訓練了一個“老師”AI模型,隨后基于它生成了規模更小的“學生”模型。結果發現,即便把“老師”模型中所有明顯包含不良內容的數據都過濾掉,“學生”模型依然繼承了“老師”潛藏的不良傾向。
科學家警告,若訓練數據存在問題或遭故意“投毒”,即便剔除顯性不良內容,后續AI仍可能被“教壞”。更令人擔憂的是,目前科學家既不清楚這種“潛意識學習”的底層原因,也還沒找到有效的避免方法。隨著AI生成的數據越來越多,甚至有人刻意投喂“毒數據”,AI的能力越強,潛在的災難性后果可能就越嚴重。
相關直播
比賽中
芬女超冠
EBK女足
2
:
2
PK-35萬塔女足
比賽中
挪威乙組聯賽
EIK通斯堡
0
:
0
索特拉
比賽中
俄乙B
FC塞瓦斯托波爾
1
:
0
奈茲克斯巴達
比賽中
芬甲
MP米克力
0
:
3
PK35萬塔
比賽中
俄乙B
SKA哈巴羅夫斯克B隊
0
:
0
圖拉兵工廠B隊








