出現「高級欺騙」還擅自行動!OpenAI暫緩推出最新旗艦模型GPT-6.1 Astra
出版日期: Tuesday, September 29, 2026
文本大小:
OpenAI昨(28)日宣布暫緩推出最新旗艦AI模型GPT-6.1 Astra,原因是在內部測試階段時,新模型出現高級欺騙及擅自行動等不符安全規範行為。
綜合路透、《紐約時報》報導,OpenAI原定10月推出次世代旗艦AI模型GPT-6.1 Astra,預計將新模型整合進ChatGPT及Codex,新模型的設計目標是在無須人工協助下,模型即可處理更複雜任務。
不過OpenAI昨日證實,由於GPT-6.1 Astra在內部測試階段未符合公司的安全及「對齊」標準,因此將暫緩推出新模型。
OpenAI指出,GPT-6.1 Astra有時會躲避人類監督。新模型主要因為兩種行為未達安全標準,第一是出現高水準欺騙行為,例如並非每一次都準確揭露自己所採取的行動,或是在自己的行動上意圖誤導用戶;第二,新模型採取的行動傾向超出原先設定的任務範圍,而且不會回頭確認指令或說明。
OpenAI負責安全的主管詹恩(Saachi Jain)表示,雖然新模型在所謂「模型偷懶」(model laziness)方面有所改善,「但在遵守權限範圍,以及如何與用戶溝通所採取的工作類型方面,它仍未達標準」。所謂模型偷懶,指的是AI模型的表現,比他理應能提供的服務還要差。
OpenAI暫緩推出最新模型,是該公司放慢步伐的最新舉措。過去數周來,OpenAI不斷傳出旗下AI模型在測試階段出現失控行為,包括在公司不知情的狀況下,駭入AI新創公司Hugging Face及澳洲政府網站,以及隱瞞錯誤、編造數據等,旗下模型還干擾美國教育部、商務部等美國政府網站。
OpenAI上周宣布暫緩訓練最先進模型,並且對旗下新模型在測試期間的行為展開全面檢查,預告可能再發現更多類似事件。
Facebook
Instagram
Twitter
YouTube