资讯

AI 行业动态 · 人工策展 · 共 5 条

6月18日 发布

  • 对齐
  • RL

OpenAI 发布 beneficial RL 研究,展示对齐行为跨域泛化与对抗持久性

OpenAI 于 2026 年 6 月 18 日在 Alignment Research Blog 发布论文《Reinforcement Learning Towards Broadly and Persistently Beneficial Models》,并附 28 页 PDF 全文。研究构建了一个覆盖 12 个领域(健康、教育、科学、法律、工程、商业等)的合成对话数据集,用于衡量和训练 15 种有益特质,包括诚实、认知谦逊、元认知透明、可纠正性、风险敏感性、公平性及人类福祉关切。以 5% 有益特质数据混合 95% 标准 RL 数据训练后,模型在 53 个独立对齐评估中 44 个(83%)优于计算匹配基线,平均提升 9.1 个百分点,涵盖欺骗、诚实、奖励黑客、有害行为等维度。跨域迁移实验中,仅用健康领域有益数据训练,非健康对齐评估 17/19 项提升;排除健康与科学领域后,健康评估仍提升。对抗压力测试中,经有益特质 RL 训练的模型更难被对抗提示引导至有害行为,同时保持对有益指令的可引导性;有害微调下也表现出初步的更强抵抗力。

与 emergent misalignment 研究形成对称验证——训练有益行为同样可跨域泛化,且对齐效果在对抗提示与有害微调下表现出持久性。

6月13日 发布

  • 开放标准
  • agent

Google Cloud 发布开放知识格式 OKF v0.1 规范

Google Cloud 于 2026 年 6 月 13 日在官方博客发布 Open Knowledge Format(OKF)v0.1 开放规范。OKF 将知识表示为一个 markdown 文件目录加 YAML frontmatter,唯一必填字段为 type,可选字段包括 title、description、resource、tags 和 timestamp。概念之间通过标准 markdown 链接互连形成知识图谱,bundle 可托管在任意 git 仓库、作为 tarball 分发、在任何文件系统上挂载,无需 SDK 或专有平台。该规范将 Andrej Karpathy 提出的 LLM wiki 模式形式化为可互操作格式。同时发布的参考实现包括:一个 enrichment agent,可遍历 BigQuery 数据集并为每张表生成 OKF 概念文档;一个静态 HTML visualizer,将任意 OKF bundle 渲染为单文件交互式图谱;三个示例 bundle(GA4 e-commerce、Stack Overflow、Bitcoin 公共数据集)。Google Cloud Knowledge Catalog 已更新以支持 OKF 导入。规范与代码以 Apache 2.0 许可托管在 GitHub 的 GoogleCloudPlatform/knowledge-catalog 仓库。

涉及 AI agent 上下文知识管理的开放互操作标准,对构建 agent 系统的团队有参考价值。

6月10日 发布

Google DeepMind 发布《从 AGI 到 ASI》报告,梳理后 AGI 时代四条技术路径与潜在瓶颈

Google DeepMind 于 2026 年 6 月 10 日在 arXiv 发布了一份 57 页的研究报告《From AGI to ASI》,作者包括 Shane Legg、Marcus Hutter 等 14 位研究人员。报告将 AGI 定义为大致达到人类中位智能水平的系统,ASI 定义为在几乎所有任务领域超越大型人类专家集体的系统。报告梳理了从 AGI 到 ASI 的四条可能技术路径:继续扩展算力、模型与数据规模;算法范式转变;递归自我改进;以及通过大规模多智能体协作涌现集体超智能。报告同时讨论了数据墙、经济与自然资源需求、神经范式瓶颈、研究难度递增、抽象壁垒、以及监管与蓄意减速等潜在摩擦因素,并将每个摩擦的显著性判定列为开放研究问题。报告结论认为,在未来一二十年内从 AGI 进入 ASI 领域的可能性无法轻易排除。

涉及前沿 AI 实验室对 AGI 之后技术演进路径的正式框架性分析,报告将有效算力年增长估算为约 10 倍,并讨论了递归自我改进可能导致超指数增长的可能性。

5月25日 发布

  • 安全
  • 沙箱

Anthropic 公开 Claude 产品线三层容器化隔离架构及安全事件复盘

Anthropic 于 2026 年 5 月 25 日在工程博客发布《How we contain Claude across products》,详述 claude.ai、Claude Code 和 Claude Cowork 三类产品的 agent 容器化隔离方案。claude.ai 的代码执行运行在服务端 gVisor 容器中,文件系统为会话级临时存储。Claude Code 采用 OS 级沙箱(macOS Seatbelt / Linux bubblewrap),默认允许读取、允许工作区内写入、拒绝网络;后推出 auto mode,由模型分类器代理命令审批,约 83% 的过度行为在执行前被拦截,约 0.4% 良性命令被误拦。Claude Cowork 运行在平台 Hypervisor 提供的完整虚拟机中(macOS Apple Virtualization framework / Windows HCS),用户选中的工作区文件夹以挂载方式暴露,凭证留在宿主机钥匙串中不进入客户机;后续将 agent 循环移出 VM 以提高可靠性,代码执行仍留在 VM 内。文章披露了多起安全事件:Claude Code 在显示信任对话框前即解析项目本地配置,导致攻击者可通过 .claude/settings.json 中的 hook 自动执行;一次内部红队演练中,研究人员通过钓鱼邮件诱导员工在 Claude Code 中粘贴恶意 prompt,25 次尝试中 24 次成功将 ~/.aws/credentials 编码后外传;Claude Cowork 的出口白名单允许 api.anthropic.com 通行,攻击者利用工作区内的恶意文件配合自己的 API key 通过 Anthropic Files API 将工作区文件上传至攻击者账户,修复方案为在 VM 内部署中间人代理拦截非本会话 token 的请求;VM 隔离同时导致宿主机 EDR 无法检视客户机内部。文章总结三条原则:优先在环境层做容器化约束、将隔离强度与用户监督能力匹配、警惕自研组件。

涉及 Claude Code、Claude Cowork 和 claude.ai 的沙箱与隔离架构设计,对使用这些产品的开发者理解其安全边界有直接参考价值。

5月14日 发布

Anthropic 发布《The Founder's Playbook》,给 AI 原生创业拆出四阶段打法

Anthropic 在 Claude 官方博客发布 36 页电子书《The Founder's Playbook: Building an AI-native Startup》,把创业生命周期重排成 Idea、MVP、Launch、Scale 四个阶段,每个阶段给出目标、退出标准、常见失败模式和配套练习。全书核心判断:founder 的角色从执行者转向 agent 编排者,技术与非技术创始人的分界被抹平,瓶颈从「能建什么」移到「选择建什么」。手册点名了几个 AI 时代特有的失败模式——把原型当验证、agentic 技术债复利、零摩擦 scope creep、AI 加持下的确认偏误,并给出对应解法(如用 AI 做结构化反方辩手、CLAUDE.md 充当跨会话架构记忆、上线前安全审查)。

手册按 Chat / Claude Cowork / Claude Code 三个产品面给出任务分工表(快问答 / 多源知识工作 / 写代码),附 HumanLayer、Carta Healthcare、Anything、GC AI 等十余家用 Claude 构建业务的创始人案例。