AI Tech Daily · August 4, 2026
Tuesday, August 4, 2026 · 30 items
//Qwen3.8-Max 发布:开源最强编码与协作模型,2.4…;商汤发布 SenseNova U1.5-Lite-Previ…;Cloudflare 推出 Billable Usage A…。
Global Highlights
30Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数
Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。
商汤发布 SenseNova U1.5-Lite-Preview 开源模型
商汤推出 SenseNova U1.5-Lite-Preview,一个基于 NEO-Unify 架构的轻量级原生统一多模态模型,仅 8B-MoT 参数即可达到商业闭源模型的生成与编辑质量。
Cloudflare 推出 Billable Usage API:为自助账户提供按产品与计费周期的程序化成本可见性
Cloudflare 发布 Billable Usage API,为自助账户提供单一端点,一次调用即可返回按产品和计费周期拆分的用量与成本,覆盖 Workers、R2、D1、Workers AI、Vectorize、Images 和 Stream。
OpenRouter 推出 Ori Eval 简化评估流程
推出 Ori Eval:编写首个评估的最简单方式。 没有绝对最好的模型,只有最适合每项任务的模型。Ori Eval 利用 OpenRouter 的 API 处理代码库中的每项任务,然后评估结果。 curl -fsSL https://openrouter.ai/skills/spawn-ori-eval
Cloudflare 推出 @cloudflare/computer 预览版:为智能体提供虚拟文件系统与多执行环境
Cloudflare 发布 @cloudflare/computer 早期预览版,这是一个开源智能体运行时,为每个智能体提供虚拟文件系统,并支持在 isolate、容器沙箱或浏览器中执行代码。
GPT-Live实时音频新架构发布
GPT-Live 是一种用于实时音频的新架构和栈: GPT-Live 可以在说话的同时聆听。 为了让这种体验在 ChatGPT 规模下显得自然,我们从客户端到模型重建了语音栈。 这一新架构让音频持续流动,因此更深入的推理和工具使用不会打断对话。
微软开源 Orchard 智能体训练框架
Orchard 是一个面向研究社区的开源框架,用于跨任务类型训练和评估 AI 智能体。它降低了复杂性,同时通过让研究人员复用同一套基础设施,支持较小模型也能实现强劲性能。https://msft.it/6019a8fqP
Cloudflare Workers 与 Containers 现已支持入站 TCP 连接和 gRPC
Cloudflare 在 Agents Week 期间推出 Workers 运行时新处理器 connect(socket),可直接接受 Spectrum 提供的入站 TCP 套接字,并支持将套接字转发至 Durable Objects 或 Containers,实现全双工通信。
Data Commons on Spanner Graph 正式可用:统一公共与私有数据构建知识图谱
Google Cloud 宣布 Data Commons on Spanner Graph 正式可用,并预览新版 Data Commons Platform,用于统一私有知识与公共数据集知识图谱。
Databricks 推出 Variant 通用可用版本,加速半结构化数据摄取
Databricks 宣布 Variant 正式全面可用(GA),用于更快速、高效地摄取 JSON、XML、CSV 等半结构化数据。该功能旨在简化传统上复杂的数据导入流程,提升处理效率。
欧盟《人工智能法案》透明度规则生效,违规最高罚 1500 万欧元
欧盟《人工智能法案》下的新透明度义务于 8 月 2 日生效,要求公司披露用户何时与 AI 模型互动,并为合成音视频和文本添加机器可读标记。欧盟还推出了一套可选的 AI 披露标签供平台采用,但标注要求本身是强制性的。违规公司面临最高 1500 万欧元(约 1720 万美元)或全球年营业额 3% 的罚款,8 月 2 日前推出的模型有 4 个月宽限期。
Databricks 完成对 Panther 的收购,加速安全湖仓时代
Databricks 宣布正式完成对安全数据平台 Panther 的收购,旨在加速安全湖仓(Security Lakehouse)时代。此次收购将 Panther 的安全分析能力整合进 Databricks 平台,帮助企业在统一的数据架构上运行安全运营与威胁检测工作负载。具体交易条款未披露。
多模态大语言模型对齐的全面研究:Apple 团队独立拆解偏好对齐各环节
Apple 研究团队系统梳理了多模态大语言模型(MLLM)中的偏好对齐方法,将算法分为离线(如 DPO)与在线(如 online-DPO)两类,并发现两者结合可在特定场景下提升模型性能。团队还提出无需额外标注或外部模型的新型多模态偏好数据构建方法 Bias-Driven Hallucination Sampling(BDHS),在多项基准上取得与既有对齐工作相当的竞争力。
AirLLM 实现单块 4GB GPU 运行 70B 模型推理
AirLLM 项目支持在单块 4GB 显存 GPU 上运行 70B 参数大模型推理,无需多卡或大规模显存配置。该项目已开源,相关讨论在 Hacker News 上获得 103 点热度,引发社区关注。
Palantir 强劲季度后,CEO Alex Karp 称 AI 行业“马克思主义”
Palantir CEO Alex Karp 在季度股东信中警告,前沿 AI 实验室对企业过于不可信,并称其意图“占有所谓合作伙伴的生产资料”,带有“马克思主义色彩”。该公司第二季度营收 19 亿美元,同比增长 93%,利润 11 亿美元。Karp 主张 Palantir 提供模型无关的 AI 与分析软件,让企业掌控自身数据与 AI“废气”(提示词、编排、上下文)。
Kimi Work 幻灯片制作教程发布
使用 Kimi Work 制作幻灯片 - 教程 #1。 Kimi Slides 处理整个幻灯片制作流程: - 清晰的结构与研究,由 Kimi K3 驱动 - 连贯的设计,包括精美的图表和 SmartArts - 可编辑并可直接下载 欢迎在评论区告诉我们你还想看什么内容!
Claude Code 连接器可复用至 Artifacts
我想很多人没有意识到——如果你连接了一个 Claude 连接器(例如你的 Gmail、日历、Slack 等),Claude Code 也将能够使用它们,包括在 Artifacts 中。
EA 首席战略官谈生成式 AI 如何进入可游玩的实时游戏世界
EA 首席战略官 Mihir Vaidya 认为,游戏是 AI 的试验场,但生成式 AI 进入游戏面临 60 帧/秒、数千玩家同步和低延迟等严苛约束,不能只追求“看起来真实”,而必须“行为正确”。他主张采用神经符号架构,在生成能力之外保留确定性与可控性,并称“控制是下一个前沿”。EA 将 AI 影响分为效率、扩展和转型三个层面,其中《模拟人生》已服务超 5 亿玩家,拥有近万亿种游玩排列组合。
Google Agent Skills 幕后:如何构建、测试与规模化
Google Agent Skills 团队详解其开源技能库的构建与治理流程:项目始于 Google Cloud Next 2026 前的“swarm”冲刺,发布后 GitHub 星标超 15,000。为保证规模化下的质量,每个技能须通过标准化目录结构、CI/CD 流水线(含 linter、链接检查、AI 辅助清单)及提交时与每周的持续评估,并优先引用远程 MCP 工具。
关于 Astra 与数学的两则重要更新:Anthropic 数学家 24 小时复现 OpenAI 半数结果
Gary Marcus 称 OpenAI 的 Astra 可能并非其宣传的突破,Anthropic 数学家 Levent Alpöge 用已公开的 Fable 模型在 24 小时内复现了 OpenAI 半数结果,质疑其真实进展。
Paramount CTO Phil Wiser:AI 属于史上最伟大技术趋势,但“iPhone 时刻”尚未到来
Paramount 首席技术官 Phil Wiser 认为 AI 应跻身人类史上最伟大技术趋势前五,其影响堪比火的使用。他主张等待依赖条件成熟、以“aha 时刻”引导采用,而非以技术为先导;并警告行业巨头过度分析将错失窗口期,这一窗口可能仅 5 至 10 年。Paramount 两年前已通过 Runway 向全员开放 AI 工具,并以业务成果而非 token 消耗量衡量成效。
工信部发布首部L3/L4自动驾驶系统安全要求强制性国标,2027年7月实施
工信部组织制定的《智能网联汽车 自动驾驶系统安全要求》(GB 44721-2026)强制性国家标准获批发布,拟于2027年7月1日起实施。这是我国首部针对L3级有条件自动驾驶和L4级高度自动驾驶系统的强制性国标,由2024年推荐性国标GB/T 44721-2024升级而来,为自动驾驶产品明确了统一的安全准入基线。
Reflex 开源 XY:基于 Rust 的超快 Python 绘图库,可保持 1 亿点图表交互流畅
Reflex AI 发布 Apache-2.0 许可的 Python 交互式 2D 绘图库 XY,通过 Rust 原生核心、二进制缓冲传输和 WebGL2 渲染,在 1 万至 1 亿点范围内保持约 0.08 秒的渲染时间。
用 NVIDIA SkillSpector、LangGraph、YARA 规则、SARIF 与 CI 策略门构建高级 AI 技能安全审计流水线
本教程演示如何用 NVIDIA SkillSpector 评估 AI 技能的安全态势,构建包含干净、风险、恶意及 MCP 示例的合成技能市场,并通过 LangGraph 检查流水线扫描每个技能。
腾讯混元发布 Hy ASR 3.0 preview:真正懂上下文的语音识别
腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview,基于大语言模型 Hy3 与 MoE 架构,融合高精度识别与语义理解。其在开源评测集中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%,并支持上下文纠错、热词注入及高噪耳语等场景。该模型已上线腾讯云 API,元宝 App 首发并免费开放。
Swiftlet:在 Mac 上运行 80B 版 Qwen(内存 4.3 GB),在 iPhone 上运行 35B 版
Swiftlet 是一个 Swift + Metal 运行时,可在普通 Apple 设备上运行 Qwen3-Next 和 Qwen3.5/3.6 MoE 混合模型,仅将小型稠密核心驻留内存,按需从存储流式加载路由专家权重。
GPT-5.6 Luna降价80%永久生效
有些人显然误解了,但 GPT-5.6 Luna 降价 80% 不是临时噱头,而是永久的。效率提升不会消失。幸运的是。
面壁智能开源 ForgeStencil:一周自动优化 100+ 工业与科学软件,全程零人工介入
面壁智能联合 OpenBMB 开源全球首个支持 Stencil 自动研究、自动部署的 AI 优化系统 ForgeStencil,由 Kernel Agent 与 App Agent 闭环协作,实现从算子优化到应用集成的全自动流程。
从零开始,教你用Codex搓出属于你自己的第一个硬件
作者以零基础身份,全程通过与Codex对话,从需求讨论、电路搭建、代码烧录到3D打印组装,5天内做出一个能提醒久坐的猫爪硬件。文中还介绍了用Agent调试宏键盘、以及OpenAI与Work Louder联名发布的Codex Micro键盘(13个机械按键,售价230美元)等案例,强调"干中学"的AI开发方式。
Palantir 强劲季度后,CEO Alex Karp 称 AI 行业"马克思主义"
Palantir CEO Alex Karp 在季度股东信中警告,前沿 AI 实验室对企业过于不可信,并称其意图"占有所谓合作伙伴的生产资料",带有"马克思主义色彩"。该公司第二季度营收 19 亿美元,同比增长 93%,利润 11 亿美元。Karp 主张 Palantir 提供模型无关的 AI 与分析软件,让企业掌控自身数据与 AI"废气"(提示词、编排、上下文)。