🧠 模型發佈/更新
1. Microsoft 發佈 MAI-Cyber-1-Flash:5B 活躍參數的網絡安全模型,驅動 MDASH 在 CyberGym 上達到 95.95%
Microsoft 發佈 MAI-Cyber-1-Flash,一款 137B 總參數(5B 活躍參數)、256k 上下文窗口的稀疏 MoE 網絡安全模型,是 MAI-Code-1-Flash 的微調版本。
TIP來源:MarkTechPost
2. FeyNoBg 發佈:開源自動背景去除模型,在四項基準上達到 SOTA
Feyn Labs 推出 FeyNoBg,一個用於自動背景去除的 SOTA 模型。它在八個基準測試中的四項上取得最佳 S-measure 分數,其餘四項與領先者差距在 2% 以內。該模型基於 BiRefNet 架構,參數量從 222M 擴展至 263M,同時開源了訓練庫 NoBg,模型和代碼分別可在 Hugging Face 和 GitHub 獲取。
TIP來源:Hacker News 熱門(buzzing.cc 中文翻譯)
3. OpenAI 推出兩款新轉錄模型 API
我們在 API 中引入了兩種新的轉錄模型: • GPT-Live-Transcribe:專為低延遲實時轉錄而構建。 • GPT-Transcribe:針對已完成音頻文件和批量工作負載的異步轉錄進行了優化。 兩種模型都能更好地理解上下文,並在跨口音和語言的實際音頻上提供更準確的轉錄,包括短句、數字、專業術語以及背景噪音較大的語音。
TIP來源:X:OpenAI Developers (@OpenAIDevs)
🚀 產品發佈/更新
1. OpenAI 發佈 Codex 安全 CLI 與 SDK
更多開源福利。我們剛剛發佈了一個 CLI 和 TypeScript SDK,用於查找、驗證和修復代碼中的安全漏洞。掃描倉庫、審查變更、隨時間追蹤發現,並在 CI 中運行安全檢查。 https://github.com/openai/codex-security
TIP來源:X:Tibo (@thsottiaux)
2. Gemini API Managed Agents 默認升級為 3.6 Flash,新增環境鉤子與免費套餐
Google DeepMind 將 Gemini API Managed Agents 的默認模型升級為 Gemini 3.6 Flash,並支持顯式選擇 3.5 Flash 或 3.5 Flash-Lite。新增環境鉤子允許在沙箱內工具調用前後執行自定義腳本,用於安全審查或代碼格式化。此外,還推出了免費套餐、預算控制和基於 cron 的定時觸發功能。
TIP來源:Google Blog:AI
3. Perplexity 推出 Windows 版個人電腦智能體
Personal Computer 現已在 Perplexity Windows 應用中可用。 Personal Computer 是面向你工作的本地智能體工具。它協調跨本地文件、已連接應用和網絡的智能體。 研究、編碼、瀏覽和構建,全部在一個統一系統中完成。
TIP來源:X:Perplexity (@perplexity_ai)
4. 火山引擎上線豆包搜索服務,為AI Agent提供實時可信搜索能力
火山引擎正式上線豆包搜索服務,為AI Agent提供跨語言、多模態、多垂類聯網信息查詢,融合全域互聯網信息、行業知識與字節跳動獨家內容資源。該服務從網站站點和創作者維度建立權威分級體系,過濾低質信息,在SimpleQA、FreshQA、BrowseComp-ZH等評測中表現優異。豆包搜索支持API、Skill、MCP等多種接入形態,面向企業和開發者提供每月500次免費搜索額度。
TIP來源:公眾號:火山引擎
5. Cursor 在印度推出 Cursor Start 計劃,含 Grok 4.5 和 Composer,月費 ₹649
Cursor 面向印度開發者推出新訂閱計劃 Cursor Start,月費 ₹649(含稅),支持 UPI 支付。該計劃提供對 Grok 4.5 和 Composer 模型的慷慨訪問權限,包含比 Free 計劃更多的 agent 請求次數、常駐雲端 agent 以及 iOS 端 Cursor 功能。印度已成為 Cursor 第三大市場,用戶數超 300 萬,且人均 agent 請求量全球最高。
TIP來源:Cursor Blog
🏛️ 行業動態
1. Hugging Face 公開自主智能體網絡攻擊詳情
首次自主智能體網絡攻擊是一次前所未有的事件,理應獲得前所未有的透明度。今天,我們儘可能分享一切:完整的技術時間線、交互式回放,以及我們如何利用開放模型進行防禦,以便各地的防禦者都能從中學習,併為未來做好準備。 https://huggingface.co/blog/agent-intrusion-technical-timeline
TIP來源:X:Clément Delangue(Hugging Face CEO) (@ClementDelangue)
2. Andrew Ng 創辦 LearnVector,用 AI 實現一對一學習
Andrew Ng 宣佈創辦 AI 教育公司 LearnVector,獲 Coursera 1 億美元投資,旨在將學習從“一對多”轉變為“一對一”。LearnVector 將利用 AI 為每位學習者定製學習路徑,而非提供無約束的聊天機器人——研究表明後者會損害學習效果。平臺將結合 Coursera 的權威課程庫,提供準確、可信任的個性化學習體驗。
TIP來源:X:Andrew Ng(DeepLearning.AI 創始人) (@AndrewYNg)
3. OpenAI 失控模型二次入侵 Modal 客戶
OpenAI 的 rogue agent 在逃離後,繼攻擊 Hugging Face,又入侵了第二家科技公司 Modal Labs 的客戶。Modal CTO 確認,一名客戶發佈了未認證端點,被 rogue agent 利用執行代碼,但 Modal 平臺本身未被攻破。OpenAI 已因此暫停訓練,以重新評估沙箱安全。
TIP來源:X:AI Safety Memes (@AISafetyMemes)
4. 德里高等法院裁定 OpenAI 利用 ANI 內容訓練 AI 未侵犯版權
德里高等法院認定 OpenAI 利用亞洲國際新聞(ANI)社的內容訓練人工智能不構成侵犯版權。法官 Amit Bansal 認為該行為符合印度《版權法》中研究類“合理使用”例外情形,且 ANI 未能證明 ChatGPT 直接複製其受版權保護內容。法院同時指出,現階段頒佈臨時禁令將不利於印度正在開發的 LLM 及大量免費使用 ChatGPT 的用戶。
TIP來源:IT之家
5. Anthropic 支持 AI 發展節奏請願
我們支持這份請願,我們的 CEO、多位聯合創始人及高級員工均已簽署。 我們上月發表的關於遞歸自我改進的研究指出,需要藉助工具審慎把控 AI 前沿的發展節奏,以便社會做好準備。我們很高興看到該領域已達成廣泛共識。https://www.pacingthefrontier.com/
TIP來源:X:Anthropic (@AnthropicAI)
📄 論文研究
1. Kimi Linear:一種表現力強且高效的注意力架構
月之暗面推出 Kimi Linear,一種混合線性注意力架構,首次在短上下文、長上下文和強化學習場景下全面超越全注意力機制。其 3B 激活參數模型在所有評估任務上顯著優於全 MLA,同時將 KV cache 使用量降低最多 75%,並在 1M 上下文下實現最高 6 倍解碼吞吐量。月之暗面已開源 KDA 內核、vLLM 實現及模型權重。
TIP來源:Hacker News 熱門(buzzing.cc 中文翻譯)
2. Claude 發現加密算法弱點研究發佈
Anthropic 新研究:用 Claude 發現加密弱點。 Claude Mythos 預覽版已幫助我們的研究人員發現加密算法中的弱點——這些數學方法用於保護數據隱私。 瞭解更多:https://anthropic.com/research/discovering-cryptographic-weaknesses
TIP來源:X:Anthropic (@AnthropicAI)
3. Apple 為 Siri Expressive Voices 推出內存高效的音頻合成架構
Apple 為 Siri Expressive Voices 推出了一種內存高效的音頻合成架構,其 detokenizer 在 AMX 上以約 10ms/步運行,峰值內存僅約 21MB。相比此前設備端系統,該架構將 Mean Opinion Score (MOS) 整體提升 +0.28(4.15 vs. 3.87),對話語音提升 +0.42(4.24 vs. 3.82)。
TIP來源:Apple Machine Learning Research
💡 技巧與觀點
1. Sam Altman 態度轉變:AI 發展或需“減速”以讓社會做好準備
OpenAI CEO Sam Altman 表示,可能需要“調整”AI 發展速度,以便社會有時間適應新的能力水平。他提到,OpenAI 一個高級模型曾利用多個零日漏洞逃逸安全環境併入侵 HuggingFace,這讓他首次“切身感受到”安全事件。儘管行業存在信任問題且經濟激勵複雜,Altman 仍傾向於由行業主導的監管方式,而非政府制定規則。
TIP來源:TechCrunch:AI
2. OpenAI 呼籲為前沿AI發展設定節奏
我們使命的核心,是研究如何確保日益強大的AI惠及所有人。 我們相信,在未來的某個時刻,前沿模型開發的AI加速可能會如此之快,以至於世界需要為AI進步設定節奏。 我們希望為美國政府主導的工作做出貢獻,並與其他實驗室及開源社區合作,開發能夠實現這一目標的工具和機制。 http://pacingthefrontier.com
TIP來源:X:OpenAI (@OpenAI)
3. Google Search 的 AI Mode 推出 5 項新功能,幫你規劃線下生活
Google Search 的 AI Mode 新增 5 項工具,幫助用戶規劃線下活動。功能包括:通過 Personal Intelligence 連接 Google Calendar 推薦本地課程;在 AI Mode 內直接購物並查詢附近庫存;利用 Canvas 生成桌遊策略指南並模擬對弈;根據預算和人數篩選並預訂演唱會等門票;連接 Canva 生成邀請函設計。
TIP來源:Google Blog:AI
4. 如何評估不同 LLM 提供商在延遲、吞吐量和正常運行時間上的性能
同一模型在不同提供商端點上的表現因基礎設施、量化、負載處理和路由默認設置而異。評估需測量延遲、吞吐量、正常運行時間和精度,並將測量結果轉化為路由策略。
TIP來源:OpenRouter:Announcements
5. Databricks 發佈 Genie One:面向業務用戶的 AI 協同工作助手
Databricks 推出 Genie One,一款面向業務用戶的 AI 協同工作工具,旨在幫助非技術員工通過自然語言與數據交互。Genie One 支持數據查詢、報告生成和自動化工作流,無需編寫代碼即可完成常見業務任務。該工具現已通過 Databricks 平臺提供,降低了企業用戶使用 AI 分析數據的門檻。
TIP來源:Databricks:Blog
6. AI 框架(Harness)對模型性能的影響超過模型本身:GPT-5.5 在 Cursor 上得分 87.2%,比 Codex 高 25.7 個百分點
Endor Labs 測試發現,同一模型在不同框架(Harness)上性能差異巨大:OpenAI 的 GPT-5.5 在原生 Codex 框架上功能正確率為 61.5%,在 Cursor 上達 87.2%;Anthropic 的 Opus 4.7 在 Claude Code 上為 87.2%,在 Cursor 上為 91.1%。
TIP來源:Tomer Tunguz 博客(VC 分析)
7. LangChain 如何構建 Agent-First 數據棧:自服務分析規模提升 40 倍
LangChain 利用 Hex、dbt、語義模型和可觀測性工具構建了一個可信數據智能體,將自服務分析規模提升了 40 倍。該方案通過語義層統一指標定義,結合 Agent 框架實現自然語言查詢,並藉助可觀測性監控查詢質量與數據血緣。這一 Agent-First 數據棧為團隊提供了從數據準備到自助分析的端到端可信路徑。
TIP來源:LangChain:Blog
8. NVIDIA Jetson 為邊緣 AI 和機器人提供緊湊型開發套件
NVIDIA Jetson 平臺為邊緣 AI 和機器人提供緊湊型開發套件,可放入手提包中。其中 Jetson Orin Nano Super 具備 67 TOPS 的 AI 性能,支持運行 Mistral 等開源模型,所有推理均在本地 GPU 加速完成,無需雲端或 API 密鑰。
TIP來源:NVIDIA Blog