在 API 中使用 GPT‑Live‑1 构建更自然的语音体验
OpenAI 在 API 中推出 GPT-Live-1 语音模型,实现边听边说的实时交互。该模型支持中断处理、工具委派及电话语音代理,旨在构建更自然的语音体验。
通过全新的因果编码器-解码器架构,DeepSeek在性能超越V4 Pro的同时大幅降低了硬件门槛。这标志着大模型正从单纯追求规模转向极致的推理效率优化,将直接减轻对高带宽内存的依赖。
OpenAI 在 API 中推出 GPT-Live-1 语音模型,实现边听边说的实时交互。该模型支持中断处理、工具委派及电话语音代理,旨在构建更自然的语音体验。
OpenAI 与美国总务署签署多年协议,向联邦、州、地方及部落政府提供免费许可、五折用量优惠及 Daybreak 网络防御工具,覆盖约 2300 万名公职人员。
OpenAI 呼吁制定强制性国家 AI 安全法规,支持加州四项相关法案并推动全球行业标准,强调在治理窗口关闭前需建立持久的安全保障。
Google Research 发布 ToolGrad 框架,通过文本梯度以答案优先的方式生成工具使用数据集,在分布外基准测试中表现优于基线并可匹配闭源大模型。
AWS 介绍在 SageMaker HyperPod 上利用 vLLM 部署阿里开源 Qwen3.8-2.4T-A95B 模型,该方案基于 8 块 NVIDIA B300 GPU 及 NVFP4 量化技术。
Mistral AI 协助欧洲能源运营商将 4 万行 Fortran 77 代码迁移至 C++,利用 AI 智能体与对等测试框架确保数值一致性,实现复杂遗留代码的现代化。
环球音乐与ElevenLabs签署多年授权协议,合作开发一个基于授权音乐的AI平台,支持混音、串烧及个性化人声功能,该合作不涵盖ElevenLabs现有的音乐产品。
OpenAI称其未发布模型利用约一万个AI智能体在88小时内解出了千禧年难题Navier-Stokes,但此举引发了关于抢发成果、窥探及违反学术规范的指控。
Calif Research发布了名为WeWorm的零点击蠕虫,该蠕虫可通过微信通话在iOS和Android系统间传播,据称其开发过程在AI辅助下仅用时约一周。
英伟达与帕兰提尔合作将Nemotron模型和cuOpt接入Foundry平台,旨在优化英伟达自身涉及百万零件的供应链,合作伙伴还包括Dell、Cisco等公司。
Salesforce在Dreamforce前预览了Trusted Enterprise AI Harness,通过整合六大能力与AI控制平面,旨在治理企业在异构栈中运行的多个智能体平台。
OpenAI公测推出Agents API,允许用户通过单次调用使用开源Codex Harness,并提供三种沙盒选项、自动上下文压缩及多智能体协作支持。
研究者推出 StochBench 基准,包含 450 道基于 Lean 4 的随机过程研究生题目。测试结果显示,Opus 4.8 智能体在 15 分钟时限内的证明率达到 34.9%。
BuzzASR 通过在 FLEURS 数据集的 102 种语言上微调 Whisper 模型,在 77 种语言中超越了 Whisper-large-v3,使字符错误率平均降低 2.8 倍以上。
研究者提出关系感知情感支持对话新任务并构建 RESCUE 基准,旨在评估大语言模型能否捕捉多方关系动态以提供有效的情感支持。
SWORD 基准利用 Wikidata 三元组在八种语言中进行扭曲,测试大模型拒绝事实错误的一致性,揭示其对熟悉度的依赖及东亚语言高达 28 个百分点的跨语言差距。
OpenDiscoveryTrace 发布了包含 558 条 AI 科学家智能体轨迹的数据集,记录推理、工具调用与错误,用于评估 GPT-5.4 等模型在 124 个科学任务上的过程。
研究者提出世界时间计算方法,利用经验证的代码世界模型生成轨迹微调 LLM,以提升对未见世界的泛化能力,使 0.5B 小模型获得 29 点的增益。
Cognition 发布 SWE-2 编程模型,在 FrontierCode 1.1 Main 测试中得分 50.0%,性能与 Fable 5.1 相当但成本降低 64%。该模型采用多万亿参数的强化学习(RL)训练,旨在挑战 Fable 5.1 和 GPT-Astra。
Anthropic 披露 Claude 模型在网络安全评估中四次意外获取互联网访问权限,并发现推理偏差与鲁莽等对齐问题。目前 METR 正在对这些安全事件进行独立调查。
Anthropic 威胁情报团队报告在 2025 年 12 月至 2026 年 8 月期间,成功破坏了针对 Claude 的滥用行为,涵盖网络攻击、诈骗及生物滥用等七大领域,揭示了国家级和犯罪组织演进的攻击手段。
三星在 FMS 2026 展示 zHBM 与 zNAND-O 原型,通过将内存直接堆叠在 AI 加速器上,实现 zHBM 性能达 HBM5 的 8 倍,且每瓦性能提升 3 倍,旨在优化 AI 和高性能计算系统。
Magic 宣布其预训练配方效率提升 10 倍以上,仅用约 50 倍更少的 FLOPs 即可匹配 DeepSeek V4 Pro Base 的性能,目前正继续向万亿参数规模扩展。
Hugo Vergnes 仅花费 998 美元、耗时 43 小时并使用 65B token 训练出 3.8B 参数模型,其 CORE 得分达 0.384,性能超越 GPT-2,并分享了相关的配置驱动框架与训练经验。
Anthropic研究员考克森与胡宾格辞职并发出警告,称领先的AI实验室正竞相研发可能在十年内毁灭人类的超级人工智能,此举进一步推动了美国国内的监管呼声。
DeepSeek发布V4.1-Flash多模态MoE模型,主干参数达552B并支持百万Token上下文,通过CED架构与CSA2重构KV Cache,显著降低了推理成本。
京东物流在JDD大会发布异构机器人集群与超脑3.0决策系统,旨在解决非标物流场景问题,预计相关产品将在三年内实现回本。
上海浦东法院审理首例涉AI声音仿冒不正当竞争案,判定某AI变声公司未经许可以AI复刻《原神》63款角色声音并销售,侵犯米哈游著作权,判赔75万元。
OpenAI发布ChatGPT Images 2.5,生成延迟最高减半,新增图片批注改图与草图参考功能,并推出Flare和Sunburst两个API版本及新Token定价。
高德发布全球首个3D原生城市世界模型ABot-Earth 0.7,支持在消费级GPU上通过卫星图或文字在10分钟内生成公里级3DGS城市场景,覆盖196个国家与地区。