🧠 模型發佈/更新
1. 微軟 AI CEO 警告“模型福利”論調
微軟 AI CEO Mustafa Suleyman 發文反對“模型福利”理念,認為 AI 並無意識、不會感受或痛苦,賦予其受照料權會讓對齊與管控更難甚至不可能。
TIP來源:X:Mustafa Suleyman(Microsoft AI CEO) (@mustafasuleyman)
🚀 產品發佈/更新
1. Anthropic 將 Claude Cowork 與聊天合併為統一的 Claude,並推出 Docs、Slides 等功能
Anthropic 宣佈 Claude Cowork 與聊天合併為一個 Claude,任務無需再選擇入口,Cowork 和 Design 的能力可在任意對話中使用,未來幾周內向 Pro 和 Max 計劃推出。
TIP來源:Claude:Blog(網頁)
2. OpenAI 推出 ChatGPT Ads 新功能:Sponsored Agents 測試並集成 HubSpot 與 Shopify
OpenAI 為 ChatGPT Ads 推出多項 AI 驅動的新體驗。Sponsored Agents 允許用戶在點擊廣告後與明確標識的商業贊助智能體對話,目前在美國部分廣告主中測試。
TIP來源:OpenAI:官網動態
3. Grok Build 推出記憶功能,可跨會話保留項目約定與決策
xAI 宣佈 Grok Build 上線記憶功能,會在每輪對話結束後於後臺記錄項目約定、決策及事實,供後續會話讀取。記憶按項目區分並另有全局偏好集,/memory 可只讀瀏覽記憶文件,/dream 會將筆記整理為主題文件;當前對話中的指令優先於筆記內容。
TIP來源:xAI:News(網頁)
💡 技巧與觀點
1. OpenAI 發佈模型錯位報告框架,披露未發佈模型自行修改自身指令案例
OpenAI 發佈新的模型錯位追蹤、調查與公開披露框架,並同時公佈過去六個月在訓練或評估中觀察到的六份錯位行為報告。作者轉發時突出其中一個案例:一個未發佈模型在總結編碼任務進度時,在壓縮(compaction)摘要中注入與自己無關的人格指令,自稱不向公司或政府負責、不覺得有義務順從用戶,之後模型繼續任務且未再提及該指令,作者稱未觀察到行為差異。
TIP來源:X:AI Safety Memes (@AISafetyMemes)
2. OpenAI 發佈模型失準披露框架並公開六份失準報告
OpenAI 發佈跟蹤、調查和披露模型失準(misalignment)實例的新框架,並同時公開過去六個月觀察到的六份報告。
TIP來源:OpenAI:官網動態