AI 日报

VOL.1 · NO.0192026-08-13

阿里开源 Qwen3.8-2.4T-A95B:2.4万亿参数与256K原生上下文

该模型通过MoE架构在维持95B激活参数的同时实现了超大规模参数量,极大提升了开源模型在长文本处理和复杂任务上的性能上限。

今日主线
  • 前沿模型规模竞赛升级,2.4T参数量与GPT-5.6、Grok 4.6等顶尖模型竞争
  • AI基础设施向主权化与高效化演进,重点关注数据不出境与分层缓存优化
弱信号
  • 推理轨迹(Reasoning Trace)被解密可能导致API密钥泄露并被用于增强开源模型
  • VLM在静态识别虽强,但在动态拓扑推理规划方面仍存在显著短板
官方动态

DeepMind 将手语 AI 送入用户手中

谷歌 DeepMind 与聋人社区合作推出手语 AI SL2T 1.0,并将其集成至 Gboard 和 Live Transcribe(Pixel 11),旨在实现美国手语(ASL)的实时翻译,提升无障碍沟通能力。

模型与产品

DeepSeek V4-Pro-0813 基准测试

DeepSeek V4-Pro-0813 在 Reddit 公布基准测试成绩,标志其最新 AI 模型达成重要里程碑,但具体性能指标尚未披露。

NVIDIA、Google DeepMind等发布多款开源AI模型

NVIDIA 发布 Nemotron 3.5 Lightning、Cosmos 3 等多款开源模型;其他机构同步推出 Qwen3.8-Max、GPT-5.6 系列及 FLUX 3 等模型,涵盖多模态、长上下文及安全优化。

如何窃取AI推理轨迹:解密加密思维链漏洞

研究团队公开了一种解密前沿 AI 模型(如 Claude/GPT/Gemini)加密推理轨迹的方法,从中解析出大量 API 密钥、邮箱和密码,并可用于增强开源模型训练。

研究前沿

基于模拟反应概率的多模态项目参数估计

研究人员利用基于 Qwen3.5 的大模型,通过预测文本与图像多模态刺激下的选项概率,实现了对三参数逻辑模型(3PL)和多项选择模型(MCM)难度曲线的近似重构。

开源与工具

LFM2.5-VL-3B:边缘设备更快更强的视觉语言能力

Hugging Face 推出 LFM2.5-VL-3B 视觉语言模型,重点增强屏幕与界面理解、多图推理及工具调用能力。该模型针对边缘设备进行了优化,支持非拉丁脚本并提供高效推理性能。

社区热议

SpaceXAI的Grok 4.6在人工分析智能指数中得分61分

SpaceXAI推出的Grok 4.6在Artificial Analysis智能指数中获得61分,重返智能前沿。其代理任务表现与Claude Opus 5相当,但成本仅为其60%,单次任务输出代价为0.84美元。

大型语言模型中出现的自省意识

研究人员发现Claude Opus 4/4.1模型展现出初步的自省意识,能够部分检测注入概念并区分自身生成的输出与预填内容。

中文视野

为什么中国大模型便宜又好用?

DeepSeek和KIMI等中国大模型凭借低成本、高性能及强大的开源生态,在全球调用量榜单中长期领先,其高性价比与实用性获得海外用户广泛认可。