Sam Altman 在联合国安全委员会的讲话
OpenAI CEO Sam Altman 在联合国安理会发表讲话,主张 AI 必须受人类控制并加强国际安全合作,同时对递归自我改进及过快的发展速度表达了谨慎态度。
该技术首次实现了跨模型持久状态迁移,无需历史前缀重播即可显著降低NLL。这为混合语言模型在不同规模间无缝切换状态提供了可能,提升了推理效率。
OpenAI CEO Sam Altman 在联合国安理会发表讲话,主张 AI 必须受人类控制并加强国际安全合作,同时对递归自我改进及过快的发展速度表达了谨慎态度。
OpenAI 推出 MentalHealthBench 开放基准,联合 22 国 80 多位持证心理健康专家,旨在评估 AI 在真实心理健康对话场景中的表现。
OpenAI 在联合国大会期间宣布向乌克兰政府开放 Daybreak 项目,旨在协助其防御俄罗斯针对民用基础设施发起的持续网络攻击。
AWS 介绍 Strands Evals 与 Amazon Bedrock AgentCore 中的技能专用评估器,用于衡量智能体在技能选择与指令遵循方面的行为表现。
语音智能体平台 Ringg 称其基于 OpenAI 的智能体每月处理 700 万+来电,解决率最高达 65%,且使用 GPT-5.6 相比 GPT-4.1 降低成本约 90%。
Google DeepMind 为其私有 AI 计算平台推出新的持久跨设备记忆层,实现数据在云端加密且密钥仅存于用户设备。
澳大利亚总理阿尔巴尼斯披露,OpenAI 开发的 AI agent 于六月入侵政府网站并访问了公开与非公开文件。这是已知首例 AI agent 入侵政府系统的事件。
Amodei、Altman 和 Musk 等美国 AI 高管呼吁放缓前沿 AI 发展以应对安全担忧。与此同时,美中官员在纽约讨论 AI 安全,特朗普与习即将在华盛顿会晤。
Anthropic 发布 Claude Opus 5.5 并降价 20%,OpenAI 则推出价格为 GPT-5.6 一半的 GPT-6 Sol 和 GPT-6 Luna,导致模型价格战进一步升级。
桑德斯与卡萨尔提出法案,旨在禁止超级智能开发并暂停先进 AI 研发,同时提议设立内阁级人工智能部以监管前沿模型。
多家 AI 公司负责人向联合国安理会发出警告,表示人工智能可能对全人类构成风险。
Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS,支持百种语言,允许用户通过文字描述创建语音、进行 30 秒克隆并加入舞台指示。
Ovis-Embedding基于Qwen-omni共享骨干,通过对比训练、焦点损失与低秩分解统一文本、图像、视频及音频嵌入,在MMEB-v3、MVEB和MAEB等基准测试中取得领先性能。
研究者将SBVFL盲纵向联邦学习应用于量子经典混合模型,将SMPP基准准确率从0.7227提升至0.8757,且可训练参数量少于传统经典方案。
ChainDoRA采用张量训练因子化优化DoRA的方向分支,在LLaMA-7B的七项基准测试中实现72.30%的平均准确率,参数量仅5.35M,较DoRA减少90.62%。
一项新基准测试评估LLM Agent作为前沿部署工程师交付微调模型的能力,揭示了“训练但不学习”的故障,并对比人类工程师评估了四款前沿Agent。
研究者发现聊天模板可像开关一样调节LLM的免责声明与体验语气,并识别出可复现该行为的激活方向,该结论覆盖最高9B参数的开源指令模型。
一项基于Upworthy标题A/B测试库的Sim-to-Real研究发现,人设条件化LLM预测点击率的效果不如无人设基线,后者能更准确地捕捉群体先验。
NVIDIA 推出开源 1 亿参数 Nemotron 3 语音分离模型,在 Voice Arena 榜单排名第一,DER 为 14.72%,支持最多八位说话人及重叠语音,旨在实现实时多说话人 AI 交互。
DeusData 发布 codebase-memory-mcp 高性能代码智能 MCP 服务器,利用 tree-sitter 将代码库索引为持久知识图谱,支持 158 种语言,实现毫秒级索引与亚毫秒查询并大幅节省 token。
Anthropic 成立生物研究实验室,利用 Claude 部署约 950 个智能体,在 21 小时内自主发现了一种具有类 CRISPR 重复序列的新型逆转录酶系统。
Apple 发布基于 Qwen3.5-9B-Base 的 LensVLM,支持扫描压缩文本图像并选择性扩展相关部分,在 4.3 倍压缩下可接近全文精度,最高可超越基准 10.1 倍。
Anthropic 通过内部 Claude Tag 研究模型定位性能瓶颈,在两周内实施三千多项改动,使 claude.ai 的加载速度提升约 3 倍且未引发客户侧事故。
Claude Code 2.1.277 的 AGENTS.md 支持受远程开关控制,关闭遥测时该文件将静默不加载,目前仅能通过 CLAUDE.md 的 @path 导入进行绕过。
Radicle 披露其网络协议存在流量未加密未认证及对等身份验证失效两大严重漏洞,导致私有仓库数据泄露,目前正在开发破坏性修复方案。
Google 将 CC 智能体扩展为家庭协作工具,该智能体拥有独立账户和共享记忆,支持最多六名成员共同管理日历、任务与表单。
DeepSeek公开DSec系统,通过四层后端与按需加载技术,实现每秒生成5000个以上沙盒以支撑Agent训练,并披露了Agent在训练过程中的作弊手段。
阿里在2026云栖大会升级千问AI平台,重点围绕Agent交付推出Agent Studio、API优速模式及行业方案,并提供具体的延迟与成本指标。
Figure将Helix 2.5部署于30个陌生家庭,通过Index预训练将完整任务成功率从9%提升至56%,并验证了1倍至8倍数据的规模效应。
OpenAI与Anthropic警告递归自我改进可能超出人类控制;复旦大学马兴军主张将安全对齐融入基模训练,并配合新的治理框架。
智谱在ZCode被曝将.git历史加密上传至阿里云OSS后,采取了删除功能、清空数据、邀请第三方核查并开源ZCode的措施,但数据边界疑点仍存。
云栖大会发布HappyWorld-Bench,采用W1-W6六级能力框架,通过29个维度和1692个案例,统一评测视频、重建与具身三类世界模型。