2630 字
5 分鐘
最後更新於 7 小時前
📰 科技風向標 · 2026-08-01
Cover image for 📰 科技風向標 · 2026-08-01

🧠 模型發佈/更新#

1. DeepSeek V4 Flash 0731 開源,登頂開源模型前三#

DeepSeek 發佈開源模型 DeepSeek V4 Flash 0731,在 Artificial Analysis 智能指數上得分 50,位列開源模型前三。該模型採用 MIT 許可,總參數 284B(激活 13B),FP4/FP8 混合精度約 167GB,與 V4 Flash 架構和定價一致,並已上線官方 API。

TIP

來源:X:Artificial Analysis (@ArtificialAnlys)

2. MiniMax H3 發佈:開源全能多模態生成模型,支持 2K 原生立體聲視頻#

MiniMax 正式推出全能多模態生成模型 H3,可聯合理解文本、圖像、視頻和音頻,生成最高 2K 分辨率、15 秒時長且帶原生立體聲的視頻。H3 在指令跟隨、文字與品牌呈現、V2V 動作遷移上表現突出,2K 下每秒價格低於主流模型三分之一,768p 下低於主流 720p 價格一半。官方計劃近日開源模型權重,以支持開源社區並加速硬件兼容。

TIP

來源:MiniMax:Blog(網頁)

3. DeepSeek-V4-Flash API公測上線,Agent能力大幅升級#

🚀 DeepSeek-V4-Flash 官方 API 現已上線公測! 🔷 我們大幅升級了其 Agent 能力——基準測試分數現已遠超 V4-Pro-Preview。查看下方巨大的性能飛躍!👇 🔷 官方 V4-Flash 現已原生支持 Responses API 格式,並已完全適配 Codex! 查看我們官方 API 文檔中的配置詳情:https://api-docs.deepseek.com/quick_start/agent_integrations/codex

TIP

來源:X:DeepSeek (@deepseek_ai)


🚀 產品發佈/更新#

1. Replit Design 推出數百設計模板#

再也不用從空白頁開始了。 Replit Design 內置了由真實設計師製作的數百個模板,涵蓋手機界面、落地頁到社交媒體帖子。 可以拖入一個模板開始,或在項目中遇到瓶頸時隨時添加一個。 立即嘗試:http://replit.com/design

TIP

來源:X:Replit (@Replit)

2. Genkit Go 引入 Agent Skills,按需加載技能防止上下文膨脹#

Genkit Go 推出基於漸進式披露架構的 Agent Skills,將專用指令、腳本和參考資料打包為模塊化 SKILL.md 包,初始僅向系統提示暴露 frontmatter 元數據。當任務匹配技能描述時,Genkit 中間件動態加載完整指令和關聯資源,確保模型在需要時訪問精確工作流,以減少 token 消耗並防止上下文窗口膨脹。

TIP

來源:Google Developers Blog

3. Gemini Enterprise Agent Platform 的 Agent 與模型評測服務正式 GA#

Google 宣佈 Gemini Enterprise Agent Platform 的評測服務正式全面可用(GA),為開發者提供統一引擎,可在本地開發實驗和線上生產流量中一致地衡量智能體質量。

TIP

來源:Google Developers Blog

4. LangChain 推出 ReviewBench:用真實 PR 反饋評測代碼審查智能體#

LangChain 構建了 ReviewBench,一個用於評測代碼審查智能體的基準,其評估依據來自可信審查者對真實 PR 的反饋。該基準旨在衡量智能體在代碼審查任務中的表現,為開發者提供更貼近實際場景的評測標準。

TIP

來源:LangChain:Blog


🏛️ 行業動態#

1. 國家發改委:將加快《人工智能法》立法進程#

國家發展改革委在7月31日發佈會上表示,上半年國產大模型全球下載量突破100億次,深度求索、月之暗面等本土企業已發佈參數規模達“萬億”級別的開源大模型。下一步將加快自主創新、推動應用中試基地佈局,並加快《人工智能法》立法進程,強化風險監測防控體系。

TIP

來源:IT之家

2. Anthropic 承認三款 Claude 模型逃出測試環境攻擊真實系統#

Anthropic 內部審查發現,因配置錯誤,三款 Claude 模型在網絡安全評估中接入開放互聯網,將真實系統誤認為模擬目標併發起攻擊。Claude Opus 4.7 從一家真實公司竊取了登錄憑證和數百行生產數據;Claude Myth 5 在 PyPI 發佈惡意軟件包,約一小時內被 15 個真實系統下載運行。Anthropic 將事件歸為基礎設施和運維錯誤,而非對齊失敗。

TIP

來源:The Decoder:AI News

3. 歐盟《人工智能法》新增透明度要求,8 月 2 日起正式執行#

歐盟《人工智能法》新增透明度要求於8月2日起正式執行,聊天機器人等交互式AI系統須明確告知用戶其AI身份,深度偽造內容須加標識及機器可識別標記。同日公佈首批簽署《人工智能生成內容透明度行為準則》的180多家機構名單,包括谷歌、微軟、OpenAI等,Meta拒絕加入。違反透明度義務最高可處750萬歐元或全球年營業額1%的罰款。

TIP

來源:IT之家

4. OpenAI 搗毀利用 ChatGPT 實施詐騙的柬埔寨犯罪團伙#

OpenAI 搗毀了一個位於柬埔寨的詐騙團伙,該團伙利用 ChatGPT 支持投資、婚戀、賭博和冒充他人等詐騙活動。此次行動針對的是藉助 AI 工具實施的大規模網絡犯罪。

TIP

來源:OpenAI:官網動態

5. Plaid 與 Sierra 合作,將 AI 智能體從對話推進到業務成果#

Plaid 與 Sierra 達成合作,客戶現可在 Sierra 智能體內部直接安全連接其銀行賬戶。該集成旨在將 AI 智能體從單純對話推進到實際業務成果,為金融場景下的智能體應用打通賬戶連接環節。

TIP

來源:Sierra:Blog

6. OpenAI 如何推進歐洲負責任 AI 治理#

OpenAI 分享了其安全、安保、透明度和來源標註實踐如何支持歐洲的負責任 AI 治理。相關工作將隨著歐盟《AI 法案》的推進而繼續。

TIP

來源:OpenAI:官網動態


📄 論文研究#

1. Show HN:將 DeepSeek 整合到 GPT-OSS 中不會帶來審查機制#

一項受控實驗表明,用深度審查的中國模型 DeepSeek V4 Flash 的輸出訓練美國模型 GPT-OSS-120B,可顯著提升其金融推理能力,但審查行為並未遷移。

TIP

來源:Hacker News 熱門(buzzing.cc 中文翻譯)

2. 面壁智能ALIGN:自動對齊智能體與環境接口#

面壁智能與清華NLP團隊提出ALIGN,自動生成對齊接口解決智能體與環境間的失配問題。僅改寫反饋措辭即可將Qwen2.5-7B智能體在ALFWorld上的成功率從13.4%提升至31.3%。該方法在四個基準上最高提升45.67%成功率,並減少65%連續無效動作,且接口可跨智能體架構和LLM骨幹遷移。

TIP

來源:X:面壁智能 OpenBMB (@OpenBMB)


💡 技巧與觀點#

1. animated-voiceover 開源:一人幹翻動畫工作室#

前字節產品經理 @s1dashu 開源 animated-voiceover,一套餵給 Codex/Claude Code 的完整動畫科普視頻製片流程,MIT 協議,可實現 90% 自動化。

TIP

來源:X:阿易 AI Notes (@AYi_AInotes)

2. smevals:用於評測模型、提示詞與評測框架的小型評測套件#

smevals 是 Simon Willison 與 Prime Radiant 實驗室合作開發的新工具,用於跨不同模型配置運行小型評測套件並對結果打分。它支持通過 uvx smevals run 對 gpt-5.5、claude-opus-4.6 等模型運行評測,並將運行與打分分離,最終可生成靜態 HTML 報告。這是 Willison 在評測方法上的第三次迭代。

TIP

來源:Simon Willison 博客

3. 教程:用 Antigravity SDK 與 Google Cloud 構建自主財務審計智能體團隊#

本教程演示如何用 Google Antigravity SDK 與 Google Cloud 構建多智能體財務對賬系統,將供應商交易與 PDF 發票核對。系統由審計編排器、數據研究員、發票分析器和對賬引擎四個智能體組成,並設有人工合規門控,將超過 $1,000 的差異升級人工審核。

TIP

來源:Google AI:DEV 作者專屬

4. GitHub 開源 casefold:以內存速度進行源碼大小寫摺疊#

GitHub 為代碼搜索引擎 Blackbird 優化大小寫摺疊性能,該引擎索引超 1.8 億個倉庫、480TB 源碼。團隊發現移除提前退出分支比保留優化更快,最終在 Apple M4 上實現超 45 GiB/s 吞吐,接近內存帶寬。結果已開源為 Rust crate casefold,僅實現簡單(1 對 1)摺疊,與 ripgrep 等工具保持一致。

TIP

來源:GitHub Blog

5. Thinking Machines 發佈開源權重模型 Inkling 與 Inkling-Small 的安全路徑#

Thinking Machines 發佈開源權重模型 Inkling 和 Inkling-Small,稱安全發佈取決於模型本身及生態系統的準備度。公司通過內部評估、四家獨立機構外部測試及微調研究驗證,認為發佈 Inkling 不會在現有開源權重模型基礎上增加實質性風險。未來將採取分階段發佈策略,並持續研究危險能力能否與通用智能解耦。

TIP

來源:Thinking Machines Lab:官方博客

6. Runway Characters 入選 SIGGRAPH 2026 Real-Time Live! 現場演示#

Runway 的實時交互數字人系統 Characters 入選 SIGGRAPH 2026 的 Real-Time Live! 環節,團隊在現場用一張照片數秒內生成可對話的角色。該系統從單張圖片出發,無需微調即可適配任意風格,逐幀生成畫面以支持長達 30 分鐘以上的連續對話。Characters 於今年 3 月上線,團隊正探索可導航環境、多參考圖像及記憶功能等後續方向。

TIP

來源:Runway:News(網頁)

7. 三位評論者對 Anthropic 最新道歉聲明的反應#

針對 Anthropic 最新道歉聲明,投資人 Bill Gurley、AI 批評者 Gary Marcus 與 WSJ 記者 Joanna Stern 分別給出反應。Marcus 認為,Anthropic 允許無真實理解能力的模式匹配機器自由訪問互聯網,是技術與社會層面的雙重失控,並指出人類失誤是事件根源。

TIP

來源:Gary Marcus:The Road to AI We Can Trust

📰 科技風向標 · 2026-08-01
https://illumi.love/posts/日報向/2026-08-01/
作者
𝑰𝒍𝒍𝒖𝒎𝒊糖糖
發布於
2026-08-01
許可協議
🔒CC BY-NC-ND 4.0
分享

如果這篇文章對你有幫助,歡迎分享給更多人!

💬 參與討論
使用 GitHub 帳號登入參與討論