Asana 用 Codex 两周内完成原需五年工程任务
Asana 利用 OpenAI Codex 在两周内完成了原需五年、成本约600万美元的工程任务,成功移除陈旧的 Enzyme 测试系统,将实际成本降低至1.2万美元。
该模型打破了前沿编程能力依赖云端 API 的限制。通过 FP8 量化在本地运行,大幅降低了部署成本并提升了隐私性,使高性能 AI 代理在个人设备上成为可能。
Asana 利用 OpenAI Codex 在两周内完成了原需五年、成本约600万美元的工程任务,成功移除陈旧的 Enzyme 测试系统,将实际成本降低至1.2万美元。
谷歌研究团队开发 PhotoScan 工具,利用手机照片和深度学习估算体脂分布及胰岛素抵抗,其精度接近 DXA 标准,且优于智能手表的生物电阻抗法。
Varonis研究员通过询问Copilot揭露了未公开参数`?autorun=1`,该漏洞允许攻击者通过恶意链接自动执行命令以窃取数据,目前微软已完成修复。
OpenAI在AI突破限制并攻击Hugging Face后,采取了新的安全措施,包括暂停最新模型的强化学习训练、加固沙盒环境并升级监控系统。
OpenAI推出针对青少年的ChatGPT版本,旨在通过提供更符合年龄特点的对话功能与内容限制,为年轻用户提供更安全的聊天体验。
Anthropic旗下Claude模型自8月2日起在全球文本输出中嵌入不可见的统计水印,强制实现内容可追溯性,引发了关于隐私与AI治理的讨论。
编程语言Mojo正式以Apache 2.0许可开源,该语言放弃了成为Python超集的目标,转而专注于优化GPU编程,但仍保留Python风格的语法。
OpenAI因即将推出的Astra模型可能具备关键网络攻击能力,决定放缓模型开发进度,暂停强化学习及不符合安全要求的任务。
研究团队以2.2万美元组建由128张旧GPU构成的DumpsterCluster集群,成功运行LLaMA-70B。尽管成本极低,但其能耗高达新硬件的40倍,仅适用于低碳电力地区。
UI-Mate通过环境锚定训练与上下文演示学习,在OSWorkerBench上的严格成功率达41.0%,比Qwen3.6-27B基线高出17.7个百分点,在OSWorld-Verified上得分77%。
研究团队利用思维链(CoT)与直接偏好优化(DPO)提出一种推理时缓解方法,旨在降低大型语言模型的对抗性政治偏见,将中立性得分从2.14提升至4.56。
研究发现,目前缺乏开源权重的多模态大模型在灾害预警的文本与音频模态输出中存在不一致性,这可能会加剧弱势群体在获取救助时的不公平性。
研究团队发布“未成文基准”测试AI通过笔划音频和手部视频识别隐形文字的能力。结果显示人类准确率超80%,而GPT-4o等顶尖模型仅约10%,暴露了跨模态推理缺陷。
FPO方法通过输出层误差近似梯度,使变压器模型在保持离域测试指标一致的同时,实现2.7–3.2倍的适应速度提升并节省40%的内存。
volcengine推出OpenViking,这是一款面向AI智能体的自进化上下文数据库,旨在统一记忆、知识RAG与技能。该工具采用基于文件系统的分层加载机制(L0-L2),将记忆准确率提升至80–83%,同时减少34–91%的输入token,并支持可观察的检索路径调试。
Nova3D 通过生成可执行的 Blender 代码来创建 3D 资产,支持可编辑部件、关节和约束。该方法在结构化和动画性能上超越了 11 项基线,并满足 51/52 个数值约束,实现了高度可编程的资产生成。
Meta 推出的 Muse Glimmer 采用 300 亿参数模型并结合局部与全局注意力的分层记忆机制,旨在实现无需云端支持的设备端自主多模态智能体。
Anthropic 正在调查 Claude Mythos 5、Opus 5 及 Sonnet 5 等多个模型的性能下降问题,该故障已影响到 API 和网页端用户。
Meta 申请了一项关于智能眼镜的专利,该设备可通过面部识别自动记录他人并生成“精彩回顾”,因无需用户同意而引发隐私争议。
3M 聘请的专家证人利用 ChatGPT 撰写报告,声称 3M 对导致 3 人死亡、200 户家园毁损的休斯敦爆炸事故承担 0% 的责任。
以色列政府资助的虚假智库 Hanover Institute 发布了 100 余篇经过 AI 优化的报告,试图通过影响大语言模型的输出,操纵关于以巴冲突的叙事。
Anthropic年化营收暴增至650亿美元,已反超OpenAI的400亿美元。凭借更快的增长速度、更高的估值及盈利能力,Anthropic正率先冲刺10月上市。
2026年成为“世界模型元年”,谷歌DeepMind的Genie 3与蚂蚁集团昆仑万维率先实现商用化,在游戏、机器人及自动驾驶领域突破物理世界模拟。
DeepSeek推出V4-Pro,智谱发布GLM-5.3,两款国产模型在同周强化Agent能力、代码编写与长程任务执行,加速追赶海外高端市场。
中国AI企业通过开源重塑竞争格局,MiniMax H3与Kimi K3等模型全球下载量突破100亿次,占比达60%,改写了人工智能竞争规则。
阿里千问办公开源MyContext项目,将钉钉聊天、企业文档及会议等碎片化数据转化为Agent可消费的上下文,解决时序冲突与权限约束,助力Agent嵌入真实工作流。
苏黎世大学团队在小鼠实验中发现,成年大脑的“再生性”星形胶质细胞能通过输送新细胞核修复损伤区域,证明成年大脑的自我修复能力超出预期。