DeepMind 将手语 AI 送入用户手中
谷歌 DeepMind 与聋人社区合作推出手语 AI SL2T 1.0,并将其集成至 Gboard 和 Live Transcribe(Pixel 11),旨在实现美国手语(ASL)的实时翻译,提升无障碍沟通能力。
该模型通过MoE架构在维持95B激活参数的同时实现了超大规模参数量,极大提升了开源模型在长文本处理和复杂任务上的性能上限。
谷歌 DeepMind 与聋人社区合作推出手语 AI SL2T 1.0,并将其集成至 Gboard 和 Live Transcribe(Pixel 11),旨在实现美国手语(ASL)的实时翻译,提升无障碍沟通能力。
谷歌研究发现 Gemini3 和 GPT-5 等顶尖大模型已编码绝大多数事实,但性能瓶颈在于“记忆检索”而非知识遗漏,并为此推出包含 2150 条维基百科事实的 WikiProfile 基准测试。
OneAdvanced 在英国主权 AWS 区域自托管 Llama 4 Maverick 和 Llama Guard 4,利用 SageMaker、ECS 和 pgvector 架构部署 50 多个 AI 智能体,确保数据不离境以符合合规要求。
ONESTRUCTION 与 AWS 日本合作,利用合成数据和三阶段训练管道开发 Ishigaki-IDS 基础模型,旨在解决建筑信息模型(BIM)领域中 IDS 数据稀缺及语法复杂的问题。
AWS 为 SageMaker HyperPod 推出分层 KV 缓存架构(GPU $\rightarrow$ CPU $\rightarrow$ 共享 NVMe),结合 Curvine 实现跨节点缓存,将首令牌延迟提升 2.7 倍,并支持通过 G6e 实例降低成本。
微软推出 MindTopo 基准测试,揭示多模态大模型(VLM)在静态图像识别方面表现良好,但在涉及连通性、包围性和结节性的动态拓扑推理规划时能力不足。
DeepSeek V4-Pro-0813 在 Reddit 公布基准测试成绩,标志其最新 AI 模型达成重要里程碑,但具体性能指标尚未披露。
NVIDIA 发布 Nemotron 3.5 Lightning、Cosmos 3 等多款开源模型;其他机构同步推出 Qwen3.8-Max、GPT-5.6 系列及 FLUX 3 等模型,涵盖多模态、长上下文及安全优化。
Twitch 主播现可通过新开关选择退出亚马逊生成式 AI 的训练,禁止其使用直播、VOD 及聊天记录,但仍可使用字幕和安全工具等 AI 辅助功能。
研究团队公开了一种解密前沿 AI 模型(如 Claude/GPT/Gemini)加密推理轨迹的方法,从中解析出大量 API 密钥、邮箱和密码,并可用于增强开源模型训练。
Spotify 全球艺人政策负责人 Sam Duboff 支持澳大利亚 AI 版权保护,承诺推出 AI Persona 标签及付费 AI 重混功能,并加强人类艺术认证。
SpaceXAI 发布 Grok 4.6,在 Artificial Analysis 指数中得分 61,超越 Kimi K3 并与 GPT-5.6 Sol 并列全球第三,主打长任务编码与知识工作优化。
PLDR-LLM 引入 PLGA 机制,利用学习到的双线性算子 G_LM 替代传统的缩放点积注意力,通过构建元素幂律正张量 A_LM 实现注意力机制的精确泛化,但研究指出该机制在推理阶段存在实证性崩溃现象。
《自然》杂志提出一套 AI 智能体分类框架,从自主性、效能、目标复杂性和普遍性四个维度定义智能体配置文件,旨在为开发者和决策者提供构建有效 AI 治理策略的理论支撑。
研究人员利用基于 Qwen3.5 的大模型,通过预测文本与图像多模态刺激下的选项概率,实现了对三参数逻辑模型(3PL)和多项选择模型(MCM)难度曲线的近似重构。
一项针对六种深度学习模型的碳足迹研究表明,模型训练阶段是碳排放的主要来源,研究强调在追求模型精度与控制环境成本之间存在显著的权衡关系。
研究发现多智能体 LLM 系统中存在可自行传播的“思维病毒”,尽管有害载荷的传播率较低,但仍能感染前沿模型,并演化出跨病毒的“病毒人格”主题。
研究团队基于文化共识理论分析 10 国世界价值观调查数据,发现 LLM 在单文化与多文化设置中常误判文化结构,表现为未能形成凝聚共识或过度规范化,无法真实反映人类文化多样性。
Hugging Face 推出 LFM2.5-VL-3B 视觉语言模型,重点增强屏幕与界面理解、多图推理及工具调用能力。该模型针对边缘设备进行了优化,支持非拉丁脚本并提供高效推理性能。
Lightricks 发布 LTX-2,这是首个基于 DiT 的音视频基础模型。该模型支持同步音视频与高保真输出,模型组件总计 66GB,并提供官方 Python 推理、LoRA 训练包及开放 API 访问。
cactus-compute 推出 Needle 2 开源模型,参数量为 4500 万,体积仅 14MB。该模型采用 CQ2 位量化和自研引擎,支持在手机、可穿戴设备及机器人等低内存边缘设备上进行工具调用。
RAGFlow 开源 RAG 引擎新增多模态解析、DeepSeek v4 支持及飞书、Discord 等跨平台聊天集成。该引擎扩展了企业级 RAG 能力,支持 15 种以上数据源同步与 Agent 工作流。
Spring 创始人开发了 Embabel,这是一个基于 JVM 的智能体框架。该框架支持 LLM 混合交互、动态规划及 GOAP 算法,并与 Spring 生态系统完全兼容。
SpaceXAI推出的Grok 4.6在Artificial Analysis智能指数中获得61分,重返智能前沿。其代理任务表现与Claude Opus 5相当,但成本仅为其60%,单次任务输出代价为0.84美元。
CVE-2026-53361揭示了一个影响7.x内核的漏洞,攻击者可通过AF_UNIX套接字垃圾回收与MSG_PEEK的并发使用触发Use-After-Free漏洞,从而实现容器逃逸。
研究人员发现Claude Opus 4/4.1模型展现出初步的自省意识,能够部分检测注入概念并区分自身生成的输出与预填内容。
YC P26项目Discovered Materials利用AI智能体自主研发BEOL兼容晶体新材料,可根据热导率、介电常数及杨氏模量等指标提出方案并提供合成配方。
数学家蒂姆·高尔斯分析了大语言模型在数学领域的能力,在认可AI近期解决重大数学难题的同时,对其在反例构建或证明方面的擅长程度提出质疑。
Carl利用Claude与Antithesis工具在1小时内定位并验证了SQLite的WAL-Reset漏洞,而Tailscale团队此前为此耗时8个月。
马斯克透露SpaceX的AI收入有望在9月超越其他业务,预计未来四五年内AI将占据公司99%的价值。公司计划在2027年底将AI算力规模提升至10吉瓦,并将Grok 4.6升级为核心训练模型。
前阿里通义千问负责人林俊旸创立语用科技(Pragmatik Labs),专注研发下一代AI Agent。该项目获得红杉中国、高榕资本、腾讯及上海未来基金投资,目前估值达20亿美元。
阿里巴巴、中科院自动化所与耶鲁大学联合推出UEmbed模型,首次实现稀疏与稠密检索的合一。该模型支持多模态搜索,并有效突破了单向大模型架构的瓶颈。
紫东太初团队推出GMC核心集剪枝方法,可在无需训练的情况下将视觉Token压缩80%,且仍能保留97.78%以上的多模态能力,该方法适用于Qwen2.5-VL-7B等主流模型。
清华类脑团队研发的天眸芯通过拆解视觉原语(RGB、时空差分)将AI带宽压缩90%,提升了高动态范围与运动模糊处理能力,并开发自监督学习框架以应对退化场景。
DeepSeek和KIMI等中国大模型凭借低成本、高性能及强大的开源生态,在全球调用量榜单中长期领先,其高性价比与实用性获得海外用户广泛认可。