亚马逊Bedrock基于查询感知压缩降低RAG成本
亚马逊Bedrock推出基于查询感知压缩技术,通过小型模型过滤无关上下文以降低RAG成本,在保持回答质量的同时支持Claude Haiku与Sonnet模型组合。
中国在开源模型影响力上实现突破,编程智能体能力提升至独立完成多步任务水平。这标志着国产AI在开发者生态和生产力工具领域正快速追赶并局部领先。
亚马逊Bedrock推出基于查询感知压缩技术,通过小型模型过滤无关上下文以降低RAG成本,在保持回答质量的同时支持Claude Haiku与Sonnet模型组合。
AWS推出Agentic Data Operations Platform (ADOP),利用AI智能体自动化ETL、数据质量检查及合规流程,将数据工程上线周期从数周缩短至数小时。
Panasonic Avionics结合AWS Bedrock与SageMaker等智能体AI,自动化分析全球机队日志与指标的关联,旨在缩短IFEC系统诊断时间并提升故障解决效率。
阿里巴巴推出Qwen-UI-Agent,深求发布深seek-v4-flash-vision-exp。两款模型在图形界面与多模态智能体自动化领域取得突破,基准测试成绩超越同类产品。
Simile AI 创始人朴俊成宣布获得 20 亿美元 B 轮融资,旨在实现 85%-99% 精确度的人类行为模拟,以取代 CVS 等企业的传统人群调研。
荣耀自研机器人 Lightning 在 100 米测试中以 9.32 秒成绩打破博尔特 9.58 秒的世界纪录,峰值速度达 14.5 米/秒,为第二届世界机器人运动会预热。
OpenAI 将 GPT-5.6 Sol 模型的开发者定价下调超过 20%,旨在通过降低成本吸引更多企业级用户采用该前沿模型。
奈飞测试 GenRec 语言模型系统,其脱机性能比传统推荐引擎提升 1.6%,且仅需 1/40 的标注数据,A/B 测试显示用户行为指标显著改善。
研究团队提出 Mental World Modeling (MWM) 框架,通过追踪人类信念、目标和社会规范,将 AI 行为预测准确率在 GPT-5.6-Sol 基础上提升 14.6%。
FlowEvo通过在推理阶段共同进化工作流与可执行技能,显著提升大模型智能体的性能。在ALFWorld基准测试中,该框架基于GPT-4o-mini骨架将成功率提升了26.4%,且token消耗量仅为原始状态的三分之一。
TinyCast是一款仅含146,505个参数的零样本预测模型,利用谱周期检测与膨胀卷积实现高精度概率预测。该模型轻量化设计使其能够在嵌入式设备上高效运行。
Gemini 3.1 Pro等大模型与嵌入模型在37项任务中表现接近,但大模型成本高达1431倍。研究建议在相似性或分类任务中使用嵌入模型,而在推理密集型检索任务中使用大模型。
multica-ai 发布了基于 Andrej Karpathy 观察的 CLAUDE.md 文件,旨在优化 Claude Code 的行为。该文件通过明确假设、简化代码、仅修改相关部分及定义成功标准这四大原则,有效遏制 LLM 的过度工程、歧义和代码冗余,可作为插件或项目规则使用。
Apache Maka 是一款处于孵化阶段的本地优先 AI 代理工作空间。该工具支持工具执行、权限管理,并将模型消息、工具调用、结果及终止事件记录为仅限追加的不可变日志,适用于实际工作场景。
Autolith 是一款基于终端的编程代理工具,采用 Common Lisp 语言开发。该工具支持实时代码检查、文件编辑及内存状态更新,允许开发者在无需重启的情况下直接运行并交互。
Anthropic 在拟公开上市的招股书中将公众对 AI 数据中心的反对视为主要风险因素,据称高达 70% 的美国人反对在当地建设此类设施。
一名开发者构建了机器人注释分类器,能够以高置信度区分 AI 生成的代码注释与人类编写的注释,从而揭示 AI 在技术解释中存在的“幻觉”问题。
一名德克萨斯州学生揭露了针对大学系统的恶意 AI 黑客攻击企图,该事件曝光了 AI 工具被滥用的潜在风险,但未明确涉及具体的 AI 模型。
Anthropic 针对 Claude Code 2.1.236+ 版本用户进行 A/B 测试,缩减了“努力程度”选项的规模,导致部分用户感知到“高”努力程度与“低”程度无异。
Hacker News 发起一项水印检测挑战,要求用户在提供的样本中识别哪些由大语言模型(LLM)生成的文本带有水印。
智谱与MiniMax在港股市场表现强劲。智谱推出GLM-5.3 API服务于超算互联网以降低AI开发门槛;MiniMax发布多模态创作Agent工作台MiniMax Design,旨在助力商业内容生产。
月之暗面推出参数量达2.8万亿的Kimi K3,成为全球最大开源模型。中国开源大模型在密集发布后已占据全球下载量的41%,连续9个月保持规模上限,助力实体经济普惠应用。
DeepSeek发布多模态模型V4-Flash-Vision-Exp,其纯文本能力与V4-Flash持平,但多模态Agent能力大幅提升,已接近Opus-4.8水平,并同步上线Files API及Harness多模态更新。
清华博士生秦深涛创立OriginFlow,利用腕带采集神经肌电信号并结合多模态数据,将人类肌肉反应转化为可训练的“Human Tokens”,旨在推动物理AGI基础设施建设。
知跃空间智能发布DeepSoma,基于精细神经元生物物理建模,结合4D可计算环境与跨身体智能体,实现了脑-身-世界闭环,在模型精细度上超越了Eon的LIF简化模型。
优必选在WRC展示工业人形机器人Cruzr S2/Y1,通过1:1复刻客户产线实现无人工干预的抓取分拣,每小时处理量达1100件且具备亚毫米级定位与自主纠错能力。