🧠 模型發佈/更新
1. NVIDIA 推出 Nemotron 3.5 Lightning,加速本地智能體任務
NVIDIA 發佈 Nemotron 3.5 Lightning,一款可定製的開源 30B 混合專家(MoE)模型,專為常駐智能體設計。相比同類開源模型,其 token 生成速度最高提升 4 倍,任務完成時間縮短 30%。該模型採用開放權重,支持用戶微調以匹配特定任務,並可在 RTX PC、DGX Spark 及 Jetson 等設備上運行。
TIP來源:NVIDIA Blog
2. SGLang 宣佈 Day-0 支持 NVIDIA Nemotron 3.5 Lightning
SGLang 宣佈對 NVIDIA Nemotron 3.5 Lightning 提供 Day-0 支持,該開源模型為 30B 總參數、3B 激活參數的混合專家架構,支持最長 1M token 上下文,可從 Hugging Face 下載 BF16 和 NVFP4 權重。模型支持 MTP、DFlash、DSpark 三種投機解碼技術,並可通過 OpenAI 兼容 API 接入智能體工作流。
TIP來源:LMSYS:Blog(Chatbot Arena 團隊)
3. Ling-3.0-tiny 正式開源:1.3B 激活參數如何進入真實任務
螞蟻百靈開源 Ling-3.0-tiny,一款總參數 7.9B、推理時僅激活 1.3B 參數的原生混合推理模型,同步提供 BF16、FP8 和 INT4 三個版本。
TIP來源:公眾號:螞蟻百靈(Ling)
🚀 產品發佈/更新
1. Runway Seedance 2.5 上線,支持50角色參考
完整陣容,完整曲目,一次生成一個。 Seedance 2.5 已在 Runway 上線,支持 50 個獨特角色參考,以及最長 30 秒、與音樂同步的片段。點擊下方鏈接即可開始使用。
TIP來源:X:Runway (@runwayml)
2. Gemini 助力 Database Migration Service 加速 PostgreSQL 遷移
Google Cloud 在 Database Migration Service(DMS)中推出由 Gemini 驅動的 AI 輔助代碼轉換,可將 Oracle 或 SQL Server 的存儲過程、觸發器和自定義函數轉換為 PostgreSQL PL/pgSQL 代碼。
TIP來源:Google Cloud:Databases
3. ZCode全面升級:Goal、Subagents、Remote Control與閒時任務四大功能上線
ZCode針對GLM深度優化,今日上線Goal、Subagents、Remote Control與閒時任務四大功能。在Z.ai Code Bench測試中,GLM-5.2搭配ZCode較搭配Claude Code任務整體通過率高2.39%;ZCode緩存命中率超98%,疊加1.5倍限時額度加成後,GLM Coding Plan整體使用量接近常規額度的1.8倍。
TIP來源:公眾號:智譜(GLM)
4. ChatGPT 桌面端支持導入其他智能體工作數據
你現在可以將其他智能體的工作內容與 ChatGPT Work 和 Codex 保持同步。 可導入項目、聊天記錄、技能和插件,查看導入歷史,並可在設置中選擇開啟自動更新。 現已在 ChatGPT 桌面應用中提供。
TIP來源:X:OpenAI Developers (@OpenAIDevs)
5. Databricks 開源 Metals v2:面向數百萬行代碼庫的 Java 和 Scala 語言服務器
Databricks 開源 Metals v2,這是其面向數百萬行代碼庫的 Java 和 Scala 語言服務器。Metals v2 專為智能體驅動的開發場景設計,旨在提升大規模代碼庫中的編輯與導航性能。目前 Databricks 的大部分代碼已由智能體編寫,該工具服務於工程師仍需要手動介入的環節。
TIP來源:Databricks:Blog
🏛️ 行業動態
1. 研究人員發現可讀取ChatGPT等模型加密推理過程的API漏洞
Alexander Panfilov團隊發現OpenAI、Anthropic、Google等主要AI提供商API存在漏洞,可讀取推理模型的加密思考過程。掃描約7000條公開會話發現62個API密鑰、33個郵箱和33個密碼。通過越獄,Anthropic的Haiku 4.5可逐字轉寫Opus 4.8的原始推理;解碼10000條推理軌跡的API成本約720美元。
TIP來源:The Decoder:AI News
2. 消息稱 Anthropic 最快今年 9 月上市,向投資者淡化 AI 模型競爭等挑戰
Anthropic 正與潛在投資者接觸,為可能成為史上規模最大的 IPO 做準備,計劃今年 9 月或 10 月初正式上市。公司估值高達 9,650 億美元,年化收入已超 470 億美元,並淡化來自中國 AI 企業的競爭影響。Anthropic 還計劃拓展 AI 在醫療和生物學領域的應用,但尚未公佈具體 IPO 定價方案。
TIP來源:IT之家
3. Gemini月活破10億,成谷歌增長最快產品
每月已有超過 10 億人使用 @Geminiapp 激發新想法、完成工作。這是我們有史以來增長最快的產品,也是第 14 個達到 10 億用戶里程碑的產品。 感謝 @JoshWoodward 和整個 Gemini 團隊,也感謝每一位與我們同行的夥伴——未來還有更多精彩!
TIP來源:X:Sundar Pichai (@sundarpichai)
4. 消息稱英偉達開發萬億參數開源 AI 模型 Nemotron 4,目標挑戰全球頂級
英偉達正在研發新一代開源 AI 模型系列 Nemotron 4,規模最大的模型預計至少擁有 1 萬億個參數,旨在與全球最先進的開源模型競爭。英偉達尚未確定發佈日期,最終訓練也未完成,員工認為該模型最早可能在今年秋末準備就緒。此舉意在通過開放模型生態擴大 AI 應用範圍,並推動市場對其 GPU 算力的需求。
TIP來源:IT之家
5. NVIDIA 為何需要新供電架構以擴展 AI 算力性能
NVIDIA 主張以 800 VDC 直流配電替代傳統交流多次轉換,以降低損耗、支撐 AI 算力擴展。NVIDIA 與 Google、Microsoft 通過 OCP 聯合制定該架構,已發佈白皮書及 LVDC 固態變壓器規範 v0.3,超 80 家設備商正據此開發產品。
TIP來源:NVIDIA Blog
6. 英偉達循環融資達到新高度,黃仁勳是否過度出牌?
英偉達股價在相關消息公佈後小幅下滑,收盤報217.55美元,盤前略有回升。金融記者Holger Zschaepitz和曾預測安然倒閉的Jim Chanos均對英偉達的循環融資做法表示擔憂。此外,英偉達將發佈真正開源(非僅開放權重)的Nemotron模型新版本,這可能最終削弱其合作伙伴OpenAI和Anthropic的地位。
TIP來源:Gary Marcus:The Road to AI We Can Trust
7. Electric 加入 Databricks,將 WASM Postgres 引入 AI 智能體沙箱
Databricks 宣佈 Electric 團隊加入,將 WASM Postgres 引入 AI 智能體沙箱。該技術讓智能體在隔離環境中運行本地數據庫,支持實時數據同步與離線操作,提升構建可靠、可驗證智能體應用的效率。Electric 的加入將強化 Databricks 在智能體基礎設施領域的佈局。
TIP來源:Databricks:Blog
📄 論文研究
1. Apple Silicon 與 macOS 虛擬機:藉助 Llama.cpp 實現 11–16 倍的 LLM 推理加速
研究團隊為 macOS 虛擬機中的 Metal 能力查詢構建進程級兼容層,使 llama.cpp 能選用更新的 Metal 內核。在 M1 Ultra 上,TinyLlama 1.1B 的提示處理速度提升 11.08 倍、token 生成提升 16.36 倍,接近裸機性能的 98%;Gemma 4 12B 的提示處理與生成速度分別提升 7.20 倍和 14.54 倍。
TIP來源:Hacker News 熱門(buzzing.cc 中文翻譯)
2. 統一 Radix 緩存:為混合模型前綴緩存構建單一樹結構
LMSYS 團隊提出 Unified Radix Cache,用單一 token 鍵控 radix 拓撲統一管理混合模型的 FULL、SWA 和 MAMBA 組件緩存,各組件獨立執行路徑、滑動窗口和檢查點複用語義。
TIP來源:LMSYS:Blog(Chatbot Arena 團隊)
3. AMIE 研究醫療 AI 系統首次展示實時臨床視頻問診能力
Google Research 與 Google DeepMind 推進醫療 AI 系統 AMIE,實現實時臨床視頻問診,首次在此場景展示專家級 AI 能力。該系統基於 Gemini 和 Project Astra 構建,可解讀視覺與聽覺線索、引導虛擬體格檢查並實時診斷推理。隨機研究中,臨床評估者對 AMIE 的病史採集、診斷準確性等核心能力給予好評,患者演員也更偏好視頻體驗。
TIP來源:Google Blog:AI
💡 技巧與觀點
1. OpenAI 用 Astra 模型攻克 10 道數學難題,數學家既興奮又擔憂
OpenAI 宣佈其未發佈的 Astra 模型解決了 10 道長期懸而未決的數學難題,涵蓋球體堆積、糾錯碼、非 sofic 群存在性等領域,併發布超 250 頁論文及 Lean 驗證結果。
TIP來源:The Verge:AI
2. 用 ComfyUI API 實現 MiniMax-H3 多模態視頻與音頻生成流水線
本教程演示如何以 ComfyUI 為無頭推理後端,構建端到端的 MiniMax-H3 視頻生成工作流。通過 Python 直接構建執行圖,支持文生視頻、首尾幀條件生成和參考圖像條件生成,並自動根據 GPU 顯存選擇 quality、balanced、squeeze 三種權重配置。流水線涵蓋模型自動下載、節點模式校驗、音視頻聯合解碼與進度監控,無需圖形界面即可復現實驗。
TIP來源:MarkTechPost
3. 將 GitHub Copilot 置於中間人(MitM)代理之後後,我學到了什麼
作者通過 mitmproxy 對 VS Code 中的 GitHub Copilot 進行中間人代理攔截,逆向分析其網絡流量與內部架構。文章指出這些 AI 應用普遍基於 Electron 構建,共享相似的網絡棧,因此探測結果可遷移至其他同類應用。作者藉此揭示了 Copilot 的運行時行為,並分享了配置代理的具體步驟。
TIP來源:Hacker News 熱門(buzzing.cc 中文翻譯)
4. 編寫智能體時,哪種編程語言最合適?
針對“動態語言比靜態語言更省 LLM token”的流行說法,作者用 GPT-5.6 Sol 讓智能體實現 zstd 解碼器進行實測。結果顯示,medium 努力度下動態語言表現更好,ultra 下靜態語言反而更優,且此前評測存在測試路徑錯誤等缺陷。作者認為,瑣碎任務上的性能無法推廣到更大問題。
TIP來源:Hacker News 熱門(buzzing.cc 中文翻譯)
5. 微信小微AI幫寫與AI點評內測:朋友圈最後一點人味正在消失
微信基於小微推出朋友圈AI幫寫與AI點評內測功能,前者可根據圖片和已寫文字生成3條朋友圈文案,後者可長按文字生成評價或快捷評論。作者認為這兩個功能將AI置於社交核心位置,可能鼓勵AI內容、破壞朋友圈自2012年確立的“記錄美好生活”基調。公眾號端小微還常駐首位,自動總結常看公眾號文章,作者擔憂這會反向影響創作者內容生產。
TIP來源:公眾號:數字生命卡茲克
6. Ryan Greenblatt:人類級AI或於2032年前通過遞歸自我改進催生失控超級智能
Dwarkesh Patel與Redwood Research首席科學家Ryan Greenblatt探討遞歸自我改進(RSI)的可能性:一旦AI達到人類頂級專家水平,可能在一年內實現相當於4-5年的AI進展,Ryan的中位預期是2031年自動化AI研發。雙方還討論了超級智能的對齊對象、獎勵黑客行為是否會升級為AI聯手接管世界等風險。
TIP來源:Dwarkesh Patel:Podcast & Blog
7. 每個類別都有贏家:AI 時代 SaaS 龍頭的估值溢價
SaaS 估值整體承壓,但每個細分賽道都跑出了 AI 龍頭:CrowdStrike 以 34.4x 前瞻收入領跑安全(中位數 3.9x),Cloudflare 32.6x 對 17.5x,Shopify 11.3x 對 1.4x。
TIP來源:Tomer Tunguz 博客(VC 分析)
8. Can you trust what AI tells you?
TIP來源:Claude:YouTube