🧠 模型發佈/更新
1. OpenAI 發佈 GPT-6 Astra:1.05M 上下文的計算機操作模型,因觸及 Critical 網絡安全閾值而限制訪問
OpenAI 發佈 GPT-6 Astra,定位為計算機操作模型,提供 1,050,000 token 上下文窗口、128,000 最大輸出 token,2026 年 4 月 30 日知識截止,OSWorld V2-Offline 得分 72.6%(GPT-5.6 Sol 為 65.7%),平均任務時間從約 75 分鐘降至 40 分鐘。
TIP來源:MarkTechPost
2. OpenAI 發佈新模型 Astra,主打計算機與瀏覽器操作但因 opaque recurrence 引發爭議
OpenAI 發佈最新模型 Astra,稱其為迄今最強大模型,主打計算機和瀏覽器操作,先面向 Daybreak 網絡安全計劃客戶開放,隨後一週內覆蓋 Pro、Plus、Enterprise、Business 付費賬戶及 API。
TIP來源:TechCrunch:AI
3. OpenAI 開始發佈 GPT-6 Astra,面向全部 Plus 用戶開放
OpenAI 宣佈開始發佈 GPT-6 Astra,稱正以儘可能謹慎和快速的方式推進,重點讓全部 Plus 用戶可用,而不只限 Pro、Business 和 Enterprise 套餐。發佈需幾天完成,背後多個全新系統將首次大規模運行,團隊正帶來大量算力,詳情見 openai.com/index/gpt-6-astra/。
TIP來源:X:Tibo (@thsottiaux)
4. OpenAI 發佈 GPT-6 Astra,多項基準達到 SOTA
OpenAI 發佈 GPT-6 Astra,在 FrontierMath Tier 4、ARC-AGI 3、TerminalBench-4.0 上達到 SOTA,並在 Terminal-Bench Science 0.1 和 HealthBench Pro 上取得領先成績。
TIP來源:X:Sherwin Wu(@sherwinwu)
5. IFM 發佈 K2 Horizon 六款開源模型,覆蓋 0.9B 到 375B-A23B 並開放完整訓練生命週期
IFM 發佈 K2 Horizon 模型系列,共六個模型:375B-A23B、36B-A4B、32B、7B、3.7B 和 0.9B,均以 Apache 2.0 開源,其中 0.9B、3.7B 和 7B 宣稱在其規模上達到 SOTA,36B-A4B 採用新提出的稀疏注意力架構 MoVA。
TIP來源:Hacker News 熱門(buzzing.cc 中文翻譯)
6. OpenAI 發佈 GPT-6 Astra,首個達到關鍵級網絡安全能力門檻的模型
OpenAI 於 9 月 3 日發佈新一代大語言模型 GPT-6 Astra,是其首個達到準備框架中關鍵級網絡安全能力門檻的模型,可在無逐步指導下發現防護嚴密系統的未知漏洞。
TIP來源:IT之家
7. OpenAI 發佈 GPT-6 Astra,官方基準顯示 ARC-AGI-3 得分 99.9%
TIP來源:X:Kim (@kimmonismus)
8. OpenAI 發佈 GPT-6 Astra,基準全面超越 Claude Fable 5.1
作者引用 OpenAI 官方基準稱 GPT-6 Astra 以 99.9% 飽和 ARC-AGI-3,在 ExploitBench 得 100%,並在各項基準上全面超過此前保持 SOTA 兩天的 Claude Fable 5.1,且價格更低。
TIP來源:X:Kim (@kimmonismus)
🚀 產品發佈/更新
1. Hugging Face 發佈開源工具 funes,為編碼智能體提供可本地持有的記憶層
Hugging Face 發佈開源工具 funes,為 Claude Code、Codex、pi、Hermes 等編碼智能體提供本地記憶層,把已有會話記錄索引成 Lance 數據集,一條 funes add 命令即可讓 Agent 自主召回原始出處(Agent、時間戳、會話、輪次)。
TIP來源:Hugging Face:Blog
2. xAI 設計 Grok Bot:為持久化智能體重構交互界面
xAI 發佈設計文章,介紹 Grok Bot 如何為超越單次會話的持久化智能體設計界面。產品以 Bot 為主要對象而非會話,Bot 擁有身份、記憶、自己的計算機和工具;頭像動效呈現空閒、工作、等待、阻塞、思考、完成等狀態;工作區提供狀態、預覽、接管三級訪問。
TIP來源:xAI:News(網頁)
3. OpenAI 推出 Daybreak for Frontline Defenders,投入10億美元支持一線網絡防禦
OpenAI 發佈 Daybreak for Frontline Defenders 全球計劃,承諾提供10億美元的 Daybreak 補貼訪問、培訓、技術支持與合作,計劃在未來六個月內消耗,優先支持水處理、電網、州和地方政府、社區銀行、非營利組織和開源維護者等資源有限的一線防禦者。
TIP來源:OpenAI:官網動態
4. xAI 發佈 Grok Bot 企業版,Grok 與 Cursor Enterprise 客戶兩週免費
xAI 宣佈 Grok Bot 面向企業開放,Grok 和 Cursor Enterprise 客戶未來兩週可免費使用並邀請全組織成員,包括沒有現有席位的員工。
TIP來源:xAI:News(網頁)
🏛️ 行業動態
1. NVIDIA 宣佈以 129.303 億美元收購 Hugging Face
NVIDIA 宣佈已同意以 12,930,300,000 美元收購 Hugging Face,黃仁勳在官方博客公佈了這一消息。Hugging Face 目前有超過 1800 萬開發者,託管超過 300 萬個模型、50 萬個數據集和 100 萬個應用,服務超過 20 萬家企業。
TIP來源:NVIDIA Blog
💡 技巧與觀點
1. Artificial Analysis 評測 GPT-6 Astra:編碼智能體追平 Fable 5 但價格漲至 2.5 倍
Artificial Analysis 發佈 GPT-6 Astra 評測,其 Coding Agent Index 得分 67,約等於 Claude Opus 5 和 Fable 5,且成本不到 Fable 5 的一半;token 效率比 GPT-5.6 Sol (max) 高約 70%。
TIP來源:X:Artificial Analysis (@ArtificialAnlys)
2. François Chollet 評 GPT-6 Astra 在 ARC-AGI-3 上的表現
François Chollet 發文稱 GPT-6 Astra 在交互式推理任務上帶來階躍式能力提升,使用標準 harness 在 ARC-AGI-3 上得 66%,配合持續對話 harness 和自定義 compaction 接近 100%,每局成本約 $360。
TIP來源:X:Francois Chollet (@fchollet)
3. Rohan Paul 解讀 OpenAI GPT-6 Astra 117 頁系統卡中的安全發現
Rohan Paul 梳理 OpenAI GPT-6 Astra 117 頁系統卡的要點:Astra 控制自身鏈式思維的能力從 GPT-5.6 Sol 的 16.1% 躍升至 60.9%,可監控性相應下降。
TIP來源:X:Rohan Paul (@rohanpaul_ai)
4. Gary Marcus 評 GPT-6 Astra:進步明顯但魯棒性與可監控性存疑
Gary Marcus 發文點評 GPT-6 Astra,稱多項報告顯示其為真正的進步,OpenAI 產品顯式創建並操縱符號世界模型,令其近十年的主張獲得印證。
TIP來源:Gary Marcus:The Road to AI We Can Trust
5. Tom Tunguz 解析 Meta Muse Spark 雙軌定價背後的數據換算力邏輯
Tom Tunguz 分析 Meta 發佈 Muse Spark 模型及雙軌 API 定價:Standard Tier(muse-spark-1.3)輸入 $1.25/m。
TIP來源:Tomer Tunguz 博客(VC 分析)
6. Google Cloud 教你用 Cloud Run instances 以每月 $5.70 搭建常駐 Agent
Shir Meir Lador 在 Google AI 開發者博客介紹如何用 Cloud Run instances 以每月 $5.70(1 vCPU、1Gi 內存、共享 CPU)在雲端 24/7 運行常駐 Agent。
TIP來源:Google AI:DEV 作者專屬
7. Meta Muse Spark 1.3 在 Artificial Analysis 編碼智能體指數中與 Claude 組合對比評測結果公佈
Artificial Analysis 編碼智能體指數顯示,Meta Muse Spark 1.3 (max) 在 Muse Code 下得 68 分,僅次於 Claude Code + Opus 5 (xhigh) 的 68 分。
TIP來源:X:Alexandr Wang(Scale AI 創始人/Meta 首席 AI 官) (@alexandr_wang)
8. ARC-AGI-3 發佈僅半年即被 Astra 飽和,進展快於 François Chollet 預期一倍
Sherwin Wu 表示自己曾覺得 ARC-AGI-3 很難,如今該基準已被 Astra 飽和。引用 François Chollet 的話稱,ARC 3 發佈時他預計前沿模型約一年才能飽和,實際只用了 6 個月,約為預期的 2 倍速度,新一代模型的能力將挑戰人們基於舊模型形成的 AI 觀點。
TIP來源:X:Sherwin Wu(@sherwinwu)