🧠 模型發佈/更新
1. xAI 發佈 Grok 4.6,強化長時運行智能體能力
xAI 今日發佈 Grok 4.6,在 Grok 4.5 基礎上重點強化長時運行智能體及更復雜的交互式與視覺工作能力。該模型在多項智能體編碼與知識工作基準上達到前沿水平,在 Artificial Analysis Intelligence Index(九項基準綜合分)上追平 GPT-5.6 Sol。
TIP來源:xAI:News(網頁)
2. 阿里開放 Qwen3.8-2.4T-A95B 模型權重:2.4T MoE、激活 95B、原生 256K 上下文
阿里 Qwen 團隊正式開放 Qwen3.8-2.4T-A95B 模型權重,這是 Qwen-Max 級別模型首次開源。模型總參數 2.4T,每個 Token 激活 95B,原生支持 262,144 Token 上下文並可擴展至 1,010,000 Token。
TIP來源:IT之家
3. LTX-2.5 模型登場:AI 生成 10 秒 720P 視頻僅需 6.8 秒,原生集成 ComfyUI
LTX 推出 LTX-2.5 模型,原生集成 ComfyUI,在 2 張英偉達 GB200 配置下生成 10 秒 720P 視頻僅需 6.8 秒。LTX-2.5 Fast 以每秒 0.09 美元生成帶音頻 720p 視頻,10 秒片段成本 0.90 美元;年度經常性收入低於 1,000 萬美元的組織可免費使用。
TIP來源:IT之家
4. 微軟首發自研推理模型MAI-Thinking-1
我們的首個推理模型 MAI-Thinking-1 從零開始構建,現已在 Microsoft Foundry 上線。為團隊點贊!更多詳情如下。
TIP來源:X:Mustafa Suleyman(Microsoft AI CEO) (@mustafasuleyman)
🚀 產品發佈/更新
1. OpenRouter 推出實時網頁搜索基準測試:如何為智能體選擇引擎、深度與模型
OpenRouter 發佈實時排行榜,系統評測模型、搜索引擎、搜索方法與預算四類配置組合。數據顯示,將搜索預算從 1 輪增至 25 輪可使 BrowseComp 得分近乎翻倍,成本僅增 2.5-7 倍;模型選擇比引擎更重要,平均分差 15 分 vs 10 分。失敗率高的任務應降低搜索深度以控制成本。
TIP來源:OpenRouter:Announcements
2. Claude in Chrome 側邊欄升級為 Claude Cowork 會話
Claude in Chrome 瀏覽器擴展的側邊欄現已升級為 Claude Cowork 會話,對話會保存至歷史記錄,技能和連接器可在瀏覽器中工作,且任務可在桌面、網頁和移動端應用間無縫切換。
TIP來源:Claude:Blog(網頁)
3. SGLang 與 Miles 為 Qwen3.8-2.4T-A95B 提供 Day-0 支持
SGLang 與 Miles 在發佈首日即支持 Qwen3.8-2.4T-A95B,這是 Qwen 最大的開源模型,總參數 2.4T,每 token 激活 95B,採用混合注意力架構。
TIP來源:LMSYS:Blog(Chatbot Arena 團隊)
4. WhatsApp 如何用端到端加密與可驗證性構建 Scam Alert 詐騙提醒功能
WhatsApp 推出可選功能 Scam Alert,通過端到端加密保護下在設備端運行機器學習模型,識別潛在詐騙消息,且消息內容不會離開設備或自動上報。該功能遵循僅設備端處理、無自動上報、用戶控制三大原則,模型權重公開供獨立驗證,遙測數據經差分隱私聚合處理。目前已在 Beta 版有限推出,並邀請安全研究社區參與測試。
TIP來源:Meta Engineering Blog
5. Claude Code v2.1.229 發佈:新增遠程會話恢復、插件市場命令源及多項修復
Claude Code v2.1.229 發佈,新增遠程控制會話恢復、自託管 runner 的服務器端 hook 支持,以及插件市場命令源。修復了長響應流式輸出丟失、窄終端渲染崩潰、Windows 擴展路徑崩潰等問題。改進工作流扇出以複用緩存提示前綴,並調整 /commit-push-pr 對危險 git/gh 命令不再自動批准。
TIP來源:Claude Code:GitHub Releases
🏛️ 行業動態
1. Research Gold 號稱“100%人類撰寫、絕不使用AI”,實則全程由AI驅動
面向醫學研究者的網站 Research Gold 宣稱其服務“100%由人類撰寫、絕不使用AI”,並列出多名博士審稿人。但調查發現,這些審稿人系AI生成、並不存在;部分真實方法學家的身份和照片未經許可被挪用。致電該公司時,自稱“Sarah”的AI助手堅稱自己是真人,郵件與聊天回覆也均為AI生成。
TIP來源:Hacker News 熱門(buzzing.cc 中文翻譯)
2. RingCentral 如何用 ChatGPT Work 和 Codex 構建 AI 原生工作流
RingCentral 通過全員發放 ChatGPT Work 和 Codex,推動從工程到運營的 AI 原生開發,其 AI-Native Challenge 讓數千名員工(含非技術人員)交付了可運行項目。
TIP來源:OpenAI:官網動態
📄 論文研究
1. 空貨架還是丟鑰匙?Google 研究:Recall 是參數化事實性的瓶頸
Google Research 提出知識畫像框架,發現前沿 LLM(如 Gemini3、GPT-5)的事實編碼接近飽和,但回憶(recall)能力不足,多數事實錯誤源於“丟鑰匙”而非“空貨架”。該框架將事實分為編碼失敗、回憶失敗等五類畫像,並配套推出 WikiProfile 基準,含 2,150 條維基百科事實,每條配 10 個問題,用於分別探測編碼、回憶與識別能力。
TIP來源:Google Research:Blog(網頁)
2. Anthropic 聯合獨立研究者發佈工人再培訓項目證據綜述
Anthropic 與獨立研究者 David Roodman 合作發佈報告,基於 56 項美國隨機研究和歐洲實驗證據,評估工人再培訓項目應對 AI 勞動力市場衝擊的效果。
TIP來源:Anthropic:Research(發表成果 · 網頁)
💡 技巧與觀點
1. 零基礎用戶半天上手AI的12步實操流程
文章給出一套零基礎用戶半天上手AI的12步實操流程:準備內存不低於16G的電腦,訂閱ChatGPT並安裝Codex或使用WorkBuddy,用語音輸入法以【背景、痛點、需求】框架向AI交代任務,經蘇格拉底提問澄清需求後投餵文件讓AI直接完成,最後沉澱為可複用Skill。文中建議Codex選GPT-5.6 Sol最高模型,WorkBuddy選Kimi K3。
TIP來源:公眾號:數字生命卡茲克
2. DeepSeek V4 Pro與Grok 4.6同日發佈,雙雙逼近Claude Fable 5體驗
DeepSeek V4 Pro正式版與Grok 4.6在2小時內先後發佈,均為1.6T/1.5T參數模型,逼近Claude Fable 5體驗。
TIP來源:公眾號:數字生命卡茲克
3. AutoGPT 如何用 AGENTS.md 和技能門控管理 AI 生成的拉取請求
AutoGPT 維護者發現,AI 智能體不會主動閱讀文檔,因此將指令放在 AGENTS.md 和技能文件中,並置於代碼目錄旁。他們通過強制 PR 模板、測試計劃、CI 覆蓋率門檻和 CLA 簽名等門控機制,將智能體提交的 PR 從“不可用”轉變為“可用但不符合路線圖”。其中 CLA 簽名因需瀏覽器和 OAuth 流程,被用作區分人類與智能體的“人類探測器”。
TIP來源:GitHub Blog
4. 我寫了一本 AI 教科書——AI 還要多久才能寫得更好?
作者在完成一本 RLHF 教科書後反思,LLM 在長文非虛構寫作上進展停滯,GPT 4.5 和 Kimi K2 等寫作強模型已顯老舊,而編碼、數學等任務已接近超人水平。模型能改錯字、做編輯,但組織整章內容時仍混亂且易出錯,作者認為這阻礙了模型自主解決開放科學問題。
TIP來源:Nathan Lambert:Interconnects
5. OpenRouter 工具調用指南:一次編寫循環,切換模型字符串即可跨模型運行
OpenRouter 發佈工具調用指南,展示如何用同一套代碼在 Claude、GPT 和開源權重模型間切換,僅需更改模型字符串。指南涵蓋定義工具、發送請求、讀取 tool_calls 響應、執行函數並返回結果的完整循環,支持 OpenAI 兼容的 JSON schema,並提供 cURL、Python 和 JavaScript/TypeScript 示例。
TIP來源:OpenRouter:Announcements
6. LangChain 詳解:什麼是 AI 智能體?
AI 智能體是在大語言模型循環中自主運行的系統,通過反覆調用模型、觀察結果並調整下一步行動來完成複雜任務。工作流(workflow)則是對固定步驟的預編排,兩者互補:工作流保證確定性,智能體提供靈活性。理解二者差異是構建可靠、可投入生產的自主系統的關鍵。
TIP來源:LangChain:Blog
7. OpenAI 研究:企業如何用 ChatGPT 和 Codex 落地智能體 AI
OpenAI 研究揭示企業採用智能體 AI 的方式,以及前沿企業如何在 AI 應用上拉開差距。企業正通過 ChatGPT 和 Codex 將 AI 從輔助轉向執行,頭部公司已率先將智能體投入實際業務流程。
TIP來源:OpenAI:官網動態