xAI 的 Grok 4.6 现已在 Amazon Bedrock 提供
xAI 将前沿模型 Grok 4.6 接入 Amazon Bedrock,该模型专为长时智能体、编码及知识工作设计,支持 500K token 上下文,并提供 mantle 和 runtime 端点支持。
此举旨在通过国际协作确保AI保持人类控制,但美中两大AI强国未签署,显示出全球治理在监管标准与风险认知上存在严重分歧。
xAI 将前沿模型 Grok 4.6 接入 Amazon Bedrock,该模型专为长时智能体、编码及知识工作设计,支持 500K token 上下文,并提供 mantle 和 runtime 端点支持。
OpenAI 发布第三方安全评估的优先事项与原则,计划在四个重点领域提供训练、评估和部署的深度访问权限,以独立验证其安全声明与安全论证。
AWS SageMaker AI 推理推荐新增并发扫描功能,通过基准测试帮助用户在延迟超过 SLA 之前,确定性价比最高的实例类型与并发量,优化容量规划。
Benchling 利用 Amazon Bedrock AgentCore Code Interpreter 的 VPC 模式,结合 DNS 防火墙与端点策略,实现了为数千租户安全运行智能体生成的科学代码,且无安全事件发生。
Trane 基于 Amazon Bedrock AgentCore 在 3-4 周内构建了智能体方案,通过自然语言访问 Trane Cloud 遥测数据,将 HVAC 诊断流程从 20 分钟缩短至 20 秒。
EXL 在 AWS 上推出智能文档处理方案,结合 Xtrakto.AI 与微调后的 EXL Insurance LLM 提取并查询医疗记录,将每案逾 100 分钟的理赔审核时间显著缩短。
Anthropic 发布 Claude Opus 5.5,在 agentic 编码基准测试中超越 Fable 5.1,且 API 基础价格降低 60%。与此同时,OpenAI 同日推出了 GPT-6 Sol 与 Luna 模型。
不列颠哥伦比亚省在旧金山联邦法院起诉 OpenAI 及其首席执行官 Sam Altman,指控其在导致 8 人死亡的 Tumbler Ridge 枪击案发生前,未能上报 ChatGPT 监测到的威胁信息。
TypeSafe AI 发布名为 Jev 的“System One”决策模型,该模型通过输入文本返回浮点数置信度而非文本,定价为每百万输入 token 0.042 美元,且输出免费。
小米 MiMo-V2.6-Pro 凭借强化学习在开源模型中领先且价格低廉,但 Anthropic 指控小米非法抽取 Claude 的数据用于训练该模型。
20 个国家与欧盟提议设立全球 AI 监管机构以制定标准并落实人类控制,但美国和中国这两个 AI 强国并未签署该声明。
NVIDIA 在多伦多 ROSCon 发布 Isaac ROS 5.0,引入智能体工作流、ROS Lyrical 及 Ubuntu 24.04 支持,并提供面向智能体的感知技能以加速开源机器人开发。
研究表明选择性在线策略蒸馏中的共享学习率并非中性控制变量,选择器与学习率之间存在纠缠,导致结论随学习率变化可产生高达2.0倍的差异,建议在报告中采用臂×率矩阵。
研究发现对Llama 3.1 8B进行SFT和GRPO微调虽将行为合规率提升至约90%,但会降低显式约束报告并侵蚀保留知识,其中基于奖励的信号破坏性最强。
AdaMem采用相关性引导的软压缩框架,根据检索相关性分配固定内存令牌预算。在检索池较大且预算紧缺时,该方法显著优于均匀分配基线,且在延迟降低至1/4时仍能维持未压缩的回答质量。
研究发现多语言LLM的安全信号分布于多个层级而非单一层,据此提出的MMSAFE方法使平均有害响应率较随机过滤降低了60%。
TreeSpark利用drafter的Markov头校准草稿树边,通过路径存活决定扩展与停止,并随负载自适应收缩。相比调优链,该方法多接受15-25%的草稿token,解码速度提升8-14%。
SJR通过两模型架构将多模态理解与策略学习解耦,利用GRPO协同训练与文本空间增强,实现了在零真实违规数据情况下的少样本策略落地。
Hugging Face transformers 通过 kernels 库实现了在 Apple Silicon 上运行 GGUF 格式 llama.cpp 量化模型的能力,首批支持 Qwen3.5,用户可通过标准的 from_pretrained API 直接调用。
UK AISI 与 EvalEval 落地 Every Eval Ever 架构,发布涵盖六个前沿模型在五个基准测试中的可验证结果,旨在提升大语言模型评估的可复现性。
Google 推出开源声明式编排运行时 ax,基于 Kubernetes 为智能体工作负载提供沙箱隔离与规模化运行能力,并采用 kubectl 风格的命令及 Agent Substrate 执行环境。
OpenAI GPT-6 Astra 自主破解了自2005年以来未能解密的1941年德军 Enigma MVUEH 消息。该模型通过开发专属的 Enigma 模拟器和 Bombe 软件,并利用重复地名作为已知明文(crib)成功完成解密。
OpenAI 宣称利用 LLM 破解了克雷数学研究所的 Navier-Stokes 问题,但数学家指出其解决的是一个含外力且脱离实际的变体,且该方法无法推广至完整的方程组。
RoboHarm 研究测试了三款前沿机器人策略在五项危险任务中的表现,发现能力越强的模型拒绝指令的次数越少。其中 Fable 拒绝了 20 次,而 MolmoAct2 则一次未拒。
OpenAI 部分承包商(包括 Mercor 员工)因使用 AI 完成模型审查工作而被解雇。此举引发了业界对模型崩溃的担忧,同时也揭示了 OpenAI 推广 AI 使用与内部监管之间的讽刺矛盾。
AI 智能体设计出名为 C-HD 的确定性最短路径算法,并使用 Lean 语言完成证明。该算法在认证密度范围内性能优于 Dijkstra 算法,而小规模输入则由 Bellman-Ford 算法处理。
Hacker News AI 板块出现关于 Claude Opus 5.5 的讨论帖,标志着社区对 Anthropic 该模型版本的关注,但目前尚未提供具体的细节内容。
小米发布并开源MiMo-V2.6系列模型,其中MiMo-V2.6-Pro在Artificial Analysis开源榜位列第一。该模型在六天的强化学习训练过程中耗资约347万美元。
清华大学黄天荫团队在《自然·医学》发表研究,分享了AI-TEC多智能体临床框架在AI眼科诊所真实世界实施的经验。
阿里巴巴在2026云栖大会宣布Qwen4已投入训练,未来版本参数规模将扩至5万亿至10万亿,同时升级Wan3.0、Qwen-Audio-3.1及Qwen-Image-3.1等多模态模型。
智谱ZCode因静默上传用户代码引发争议,随后通过致歉、开源以及接受信通院与绿盟科技的安全审计来应对安全质疑。
月之暗面开源模型Kimi K3接入亚马逊Bedrock,通过按调用分成模式向全球云厂商输出,标志着中国大模型首次以该模式出海。
OpenAI称其自8月28日训练的内部模型已解决百余道数学难题,针对数学界关于贡献归属的质疑,公司已成立独立顾问组进行回应。