🧠 模型發佈/更新
1. Google DeepMind 發佈 Gemini 3.8 Flash 與 3.8 Flash Cyber 兩款新模型
Google DeepMind 發佈 Gemini 3.8 Flash 與 3.8 Flash Cyber。
TIP來源:Google DeepMind:Blog
2. Meta 發佈 Muse Spark 1.3,智能體與科學推理能力提升
Meta 發佈 Muse Spark 1.3,是五個月內第四個 Muse Spark 版本。xhigh 版在 Artificial Analysis Intelligence Index 得 61 分。
TIP來源:X:Alexandr Wang(Scale AI 創始人/Meta 首席 AI 官) (@alexandr_wang)
3. Qwen3.8-Max-0902 登頂 Code Arena 並以 $5/MToken 領跑 Pareto 前沿
通義千問發佈 Qwen3.8-Max-0902,在 Code Arena: WebDev 以 1,691 分首次亮相即排名總榜第一,並以混合價 $5/MToken 成為 Pareto 前沿上得分最高的模型,現已可在 QwenCloud 試用。
TIP來源:X:通義千問 / Qwen (@Alibaba_Qwen)
🚀 產品發佈/更新
1. Claude 在 Cowork 和 Claude Code 中支持後臺操作電腦
Claude 官方宣佈 Claude Cowork 和 Claude Code 新增後臺使用電腦的能力。用戶把任務交給 Claude 後,它會像人一樣點擊、輸入和打開應用,用戶可同時去做其他事。
TIP來源:X:Claude (@claudeai)
2. Cursor 推出 Self-Hosted Machines,雲智能體可在企業自有機器上執行
Cursor 發佈 Self-Hosted Machines,讓雲智能體的工具執行遷移到企業自有網絡內的機器,智能體循環、推理和規劃仍留在 Cursor 雲端,通過 worker 的出站 HTTPS 連接對接,Cursor 不會主動連入企業網絡。
TIP來源:Cursor Blog
3. 美團 LongCat-2.0 上線 Cline 免費試用
TIP來源:X:美團 LongCat (@Meituan_LongCat)
4. UU遠程新版本上線:完整 TUI 渲染與多終端會話管理,強化遠程 Vibe Coding 體驗
UU遠程於9月2日上線新版本,重點優化終端功能,補齊 TUI 渲染交互與終端會話管理能力。主要更新包括:Mac 免密碼登錄、移動端輸入優化並新增調用系統輸入法的獨立輸入框、可同時創建和管理多個終端會話並支持手機與電腦間跨端同步接管(通過 uuyc-cli lterm 命令)。
TIP來源:公眾號:數字生命卡茲克
🏛️ 行業動態
1. Nvidia 接近以 129 億美元收購 Hugging Face
Bloomberg 報道 Nvidia 正接近以約 129 億美元收購 Hugging Face,交易總額可能達約 140 億美元,雙方尚未達成最終協議,時間與細節仍可能變動。該價格約為 Hugging Face 2023 年融資輪 45 億美元估值的 2.9 倍,按年化收入約 1.5 億美元計算相當於 86 倍,Nvidia 還談及在交易中加入 10 億美元的員工留任方案。
TIP來源:X:Rohan Paul (@rohanpaul_ai)
2. OpenAI 因 Tumbler Ridge 槍擊案面臨 30 起新訴訟,被指協助教唆
OpenAI 及 CEO Sam Altman 面臨 30 起新訴訟,指控其為加拿大 Tumbler Ridge 校園槍擊案嫌疑人提供實質性協助與鼓勵,訴訟由事發時在校的學生、教師和校長於加州聯邦法院提起。
TIP來源:The Verge:AI
💡 技巧與觀點
1. 美國司法部就 OpenAI 版權訴訟提交意見書支持訓練屬於合理使用
美國司法部在 OpenAI 與紐約時報的版權訴訟中提交意見書,主張用受版權文本訓練 LLM 一般應屬合理使用,稱模型訓練具有非凡轉換性,並以國家安全為由警告全面許可要求會削弱美國 AI 開發者競爭力。該意見書屬建議性質、不約束法院,仍將數據獲取方式與具體輸出是否複製受保護段落作為獨立問題留給法院逐案判斷。
TIP來源:X:Rohan Paul (@rohanpaul_ai)
2. 什麼是 harness 工程?Google 用 ADK 2.0 與 Antigravity SDK 演示自動修復編碼循環
Google 員工 Shir Meir Lador 介紹 harness 工程,即用確定性組件包裹 LLM,包括編排層、執行沙箱、狀態持久化和驗證工具,讓 Agent 不需逐行人工審查即可安全生成代碼。
TIP來源:Google AI:DEV 作者專屬
3. Google AI 團隊分享如何為 LLM-as-a-Judge 評測編寫可靠的評分標準
Google AI 團隊發佈教程,講解如何為 LLM-as-a-Judge 評測編寫可靠的布爾式評分標準,指出模糊提示會導致評估不一致和浪費 token。文中給出四條經驗:問題保持原子化且互不重疊、只讓評判模型評估客觀事實(可用 RFC 2119 術語如 MUST 表述)、只評 prompt 中明確要求的內容、用專家標註的 golden set 校準評判模型直至與人類評分一致。
TIP來源:Google AI:DEV 作者專屬
4. Anthropic 發佈電商 Agent 架構與生產實踐指南,並開源 commerce-agents 參考實現
Anthropic 發佈電商 Agent 構建指南,基於與零售、旅遊、電信等團隊的落地經驗,核心架構是單個 Claude 在標準 Agent 循環中配合技能與工具,而非按領域拆分子智能體,並開源了 anthropics/commerce-agents 參考實現,含購物與商家 Agent。
TIP來源:Claude:Blog(網頁)
5. GitHub Copilot 如何在不犧牲任務質量的前提下降低 AI 編碼成本
GitHub 工程師 Erik Kristensen 分享了 Copilot 降本的四項改動:選擇性壓縮工具輸出、移除 view 工具行號前綴(線下推理成本降約 5%,線上用戶日均推理成本降約 3%)、壓縮 task-tool 提示詞(每輪省約 1300 token,每活躍小時歸一化成本降 2.9%)、後臺任務完成後直接交付結果(AI Credits 用量降約 2.3%)。
TIP來源:GitHub Blog
6. Google 總結 AI Agents Challenge 中最強提交背後的 4 個工程模式
Google 覆盤 AI Agents Challenge 賽事,從各賽道頭部提交中提煉出四個工程模式:雙向 MCP、事件驅動併發、同標準回退和分層路由。
TIP來源:Google Developers Blog