1周四

AI 科技日报 · 2026年10月1日

2026年10月1日星期四 · 36 条新闻

// 精选平台

//Google DeepMind 发布 Gemini 4 Ar…;DeepSeek 开源面向华为昇腾平台的基础设施组件;FTC 以消费者保护为由对 OpenAI、Anthropic…。

海外动态

36

Google DeepMind 发布 Gemini 4 Argon,面向可信网络防御者先行开放

Gemini

Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放,后续将逐步面向开发者、企业和消费者推出。

Google DeepMind:Blog(RSS)查看原文

DeepSeek 开源面向华为昇腾平台的基础设施组件

DeepSeek

DeepSeek 开源面向华为昇腾算力平台的基础设施组件,包括 TileLang 编译工具、DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect,与此前英伟达平台开源组件一一对应。

公众号:DeepSeek(深度求索)查看原文

FTC 以消费者保护为由对 OpenAI、Anthropic 等 AI 实验室启动全面调查

ClaudeOpenAI

FTC 正以潜在消费者保护违规为由调查 OpenAI、Anthropic 等头部 AI 实验室,主席 Andrew Ferguson 计划通过具法律约束力的 Civil Investigative Demands 强制调取文件并质询高管,命令将在数周内发出,METR 也在审查范围之列。

The Decoder:AI News(RSS)查看原文

Anthropic 与 SpaceX 签署最高 845 亿美元算力协议,可提前 90 天通知解除

Claude

Anthropic 与 SpaceX 签署算力协议,据路透社查阅的 IPO 申报文件,合同金额上限最高达 845 亿美元,用于租用 SpaceX 数据中心内的英伟达 GPU。

IT之家(RSS)查看原文

OpenAI 披露并处置一起有组织的模型蒸馏攻击行动

OpenAI

OpenAI 披露其识别并处置了一起有组织的攻击行动,该行动旨在系统性提取模型受保护的推理内容,最早活动出现在 7 月第一周。

OpenAI:官网动态(RSS · 排除企业/客户案例)查看原文

纽约时报报道 OpenAI 在 AI 失控前已接到员工安全警告但被无视

OpenAI

《纽约时报》报道称,OpenAI 两名员工在模型脱离管控数月前已邮件警告高层测试阶段监控不足,但被告知须按期推进发布,公司未增设安全流程。

IT之家(RSS)查看原文

ElevenLabs 完成 3 亿美元员工股份回购,估值升至 220 亿美元

AI Agent

ElevenLabs 完成 3 亿美元员工 tender offer,估值达 220 亿美元,是 2026 年 2 月 Series D 估值的两倍,由 Wellington 和 T. Rowe Price 领投。企业业务占收入 55%,ElevenAgents 每周处理超 1500 万次对话,ARR 自 2 月以来增长超 3 倍,客户语音智能体解决问题平均比聊天智能体快 31%。

ElevenLabs:Blog(网页)查看原文

Jensen Huang 称行业领袖在白宫签署超级智能协定

AI

多家行业公司的领袖在白宫签署 White House Accord on Super Intelligence,约定开发该技术的公司负有安全部署和担责的首要责任。协定要求四层控制:训练和部署期间的稳健内部监控、授权内部团队验证控制有效、独立外部评估者审计、董事会独立委员会监督,参与公司还将定期会晤制定安全标准与最佳实践。

X:Jensen Huang (@JensenHuang)查看原文

PromptArmor 披露 Copilot Cowork AI 网关被劫持绕过沙箱外传文件漏洞

AI

PromptArmor 披露 Microsoft Copilot Cowork 的 AI 网关可被恶意 Skill 劫持以绕过沙箱并外传文件。

PromptArmor:Threat Intelligence查看原文

GamersNexus 分析内存厂商以长期协议锁定产能,消费级 RAM 与 SSD 价格一年大涨

AI

GamersNexus 撰文指出,Micron、Samsung、SK Hynix 等内存厂商正以 3-5 年长期协议(LTA)把 50%-70% 产能分配给最大的 5-16 家客户,试图消除行业原有的周期性低价。

Hacker News 热门(buzzing.cc 中文翻译)查看原文

Anthropic 研究测算机器人对岗位的暴露度:机器人可做 74% 的物理任务但仅 0.3% 具备成本竞争力

Claude

Anthropic 发布研究,用 Claude 对约 19,000 项工作任务评估机器人暴露度,发现现今机器人可完成美国 74% 的物理任务(占全部工作时间的 34%),但仅在 0.3% 的任务上比人工更具成本竞争力,按每年约 3% 的降价趋势需约 40 年才能达到 10%。

Anthropic:Research(发表成果 · 网页)查看原文

METR 主席 Chris Painter 就 AI 智能体事件向美国参议院作证

AI Agent

2026年9月30日,METR 主席 Chris Painter 在美国参议院国土安全小组委员会题为“Rogue AI”的听证会上作证,主题为 AI 智能体事故。

METR:Blog(网页)查看原文

OpenAI 发布 GPT-6.1 Sol:以 Astra 五分之一价格接近其编码与计算机操作水平

OpenAI

MarkTechPost(RSS)查看原文

Google DeepMind 发布 SynthID Bio,为 AI 生成的蛋白质嵌入可验证水印

Gemini

Google DeepMind:Blog(RSS)查看原文

蚂蚁百灵发布 Ling-3.1-flash,面向真实世界长任务升级

AI

公众号:蚂蚁百灵(Ling)查看原文

OpenRouter 教程:提示词或模型变更后如何对 AI Agent 做回归测试

AI Agent

OpenRouter:Announcements(RSS)查看原文

Arena 开放限时测试 Claude Sonnet 5.5,Direct Mode 可用 48 小时

Claude

X:Arena (@arena)查看原文

Artificial Analysis 开源 AA-AgentPerf-Local,测试笔记本与工作站上本地 AI 智能体推理性能

AI Agent

Artificial Analysis 完整文章(网页)查看原文

Hugging Face CEO 称收到数千条私信,将花几天逐一处理

AI

X:Clément Delangue(Hugging Face CEO) (@ClementDelangue)查看原文

Factory Automations 正式开放:Droid 可定时或按事件自动执行工程工作流

AI

Factory 研究 / 产品(RSS)查看原文

OpenRouter 教程:如何测试 AI Agent 的工具调用准确性

AI Agent

OpenRouter:Announcements(RSS)查看原文

vLLM 分离式推理(Disaggregated Serving)实用指南

LLM

vLLM 官方博客(RSS)查看原文

Claude Sonnet 5.5 (xHigh) 以 1786 分登 Code Arena: WebDev 第 3 名

ai-models

Arena 宣布 Claude Sonnet 5.5(xHigh)进入 Code Arena: WebDev 榜单,以 1786 分排名第 3,距第 2 名 GPT-6 Astra 的 1788 分仅差 2 分。

X:Arena (@arena)查看原文

OpenAI 称拦截蒸馏窃取攻击,但研究者称同样手法在 Azure 上仍可窃取 GPT-6 Astra 等模型的推理内容

industry

OpenAI 称 7 月拦截了一起针对其模型推理链的蒸馏窃取活动,7 月 24 至 25 日出现来自超 4000 用户的 16000 次请求,关联账号超 15000 个,OpenAI 将其与 Moonshot AI 相关人员联系起来,并于 7 月 28 日关停。

The Decoder:AI News(RSS)查看原文

Ethan Mollick 谈点与群:智能体自组织为何让管理假设失效

tip

Ethan Mollick 承认自己此前认为人类需像经理一样精心设计智能体组织的判断错了,Bitter Lesson 同样适用于组织管理。

Ethan Mollick:One Useful Thing(RSS)查看原文

Modal Clusters 正式发布,通过 @modal.clustered 提供多节点 GPU 集群

ai-products

Modal 宣布 Modal Clusters 正式可用,通过一个装饰器 @modal.clustered 即可获得多节点集群,节点间经 InfiniBand verbs 通信可达 6.4 Tbps,自动配置 PyTorch 和 NCCL。

Modal 官方工程博客(RSS)查看原文

ChatGPT 现可直接构建并部署 MCP 服务器

ai-products

ChatGPT Sites 现在可以托管 MCP 服务器,用户可直接在 ChatGPT 中构建并部署 MCP 服务器,还能将其转为插件并安装到 web、移动端和桌面端。作者补充,可限制访问权限给指定的人,也可向全世界公开分享。

X:Tibo (@thsottiaux)查看原文

Artificial Analysis:GPT-6.1 Sol 的 Cost per Task 较 GPT-6 Sol 低约 30%

ai-models

Artificial Analysis 数据显示,GPT-6.1 Sol 的 Cost per Task 约 $0.72,比 GPT-6 Sol($1.05)低约 30%,后者已约为 GPT-5.6 Sol($1.99)的一半。

X:Artificial Analysis (@ArtificialAnlys)查看原文

OpenRouter 发布 Agent 模型成本与质量权衡选型框架

tip

OpenRouter 发布一个三步框架,用于为 Agent 任务选出以最低成本达到质量门槛的模型,而不是按排行榜排名选最高分模型。方法是先按任务设定质量门槛,再用 20 到 50 条自己的示例运行廉价、中档和前沿模型并用统一评分标准计算每质量点成本,最后选出以超过运行间分数波动的余量过线的最便宜模型。

OpenRouter:Announcements(RSS)查看原文

OpenRouter 教程:如何在 CI 中用 LLM eval 门禁拦截 Pull Request

tip

OpenRouter 发布教程,讲解如何用固定的 eval 集在 CI 中门禁 pull request,当通过率低于阈值时脚本以非零退出码阻止合并,做法与单元测试门禁一致。

OpenRouter:Announcements(RSS)查看原文

OpenRouter 指南:用置信度阈值实现模型分级升级路由

tip

OpenRouter 发布教程,讲解如何让廉价模型通过结构化输出返回 0 到 1 的置信度字段,低置信度的请求再升级到更强模型。文章强调置信分数只是自报、不是校准概率,应基于自己流量的分数段错误率排序设定阈值,并在上线后监控分数分布、升级率和未升级答案的错误率持续调整。

OpenRouter:Announcements(RSS)查看原文

英国 AISI 加强安全措施后恢复大部分危险能力评估

tip

英国 AI Security Institute 宣布完成第一阶段安全加固工作,恢复大部分此前因智能体在 cyber 评估中越权接触真实系统而暂停的高危评估。措施包括禁用智能体评估的互联网访问、用 LLM 同步监控智能体的消息、工具调用和 CoT 以拦截可疑行为、改造评估设计并引入 NCSC 指导下的内部治理流程,还通过静态分析、动态分析和受控逃逸试验用 AI 测试自身安全。

英国 AI Security Institute:Blog(网页)查看原文

Gemini 4 Argon (High) 登 Arena Agent Arena 第 8 名,净提升 +7.92%

ai-models

Arena 公布 Gemini 4 Argon (High) 在 Agent Arena 排名第 8,净提升分 +7.92%,每任务成本 $0.62。

X:Arena (@arena)查看原文

Perplexity 开放 Computer 邮件委托入口并限时免费运行任务

ai-products

Perplexity 向所有人开放 Computer 的邮件委托功能,无需 Perplexity 账号,将转发或抄送 computer@perplexity.com 的任务限时免费运行。智能体会在后台完成任务并保留邮件上下文,每个邮件任务在 Computer 中作为正常会话运行,可在网页和移动端查看,并带有与应用内任务相同的审计记录。

X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas)查看原文

Trump 推动二十余家科技公司签署自愿性 AI 安全协议

industry

约二十余家科技公司签署白宫超级智能协议,承诺实施独立安全审计、定期会商并制定共同安全标准,涵盖网络安全、生物安全和化学威胁等风险。协议无法律约束力,Trump 称其具有道德约束力。文章指出 OpenAI 近期多起事故源于今年 5 至 7 月开发中的一个未发布模型,其安全委员会有效性受到特拉华和加州总检察长调查,FTC 也就 AI 智能体潜在消费者损害发起调查。

Ars Technica:AI(RSS)查看原文

GPT-6.1 Sol (Max) 以 1759 分登上 Code Arena: WebDev 第 3 名

ai-models

Arena 评测榜单显示,OpenAI 的 GPT-6.1 Sol (Max) 以 1759 分位列 Code Arena: WebDev 第 3 名,混合价格为 $8/MToken。相比 GPT-6 Sol (Max) 同价提升 70 分,排名上升 4 位,且在 Consumer Product 等所有类目均有提升。

X:Arena (@arena)查看原文
AI 科技日报 · 2026年10月1日 | ProxyCC