Cognition 借助 GPT‑6 Astra 让 Devin 测试自己的工作
Cognition 利用 GPT-6 Astra 赋能其自主工程师 Devin,使其能够自主测试自身软件。该流程通过返回录屏与详细报告,旨在简化代码审查过程并加快漏洞修复速度。
行业领先者公开主张限制开发速度并接受第三方验证,标志着 AI 安全治理从理论转向具体执行。这可能影响全球监管基调,并导致顶尖实验室在开发节奏上达成某种共识。
Cognition 利用 GPT-6 Astra 赋能其自主工程师 Devin,使其能够自主测试自身软件。该流程通过返回录屏与详细报告,旨在简化代码审查过程并加快漏洞修复速度。
Anthropic CEO 达里奥·阿莫代伊提出为 AI 发展「配速」的三大策略,并单方面承诺引入 METR 等第三方评估机构验证其安全承诺,以应对研究人员日益增加的警告。
25 位菲尔兹奖得主发表联合声明,指出 AI 目标与数学领域「严重错位」,警告批量化解题将损害深度理解力,并可能波及整个知识界。
英伟达正洽谈投资 Anthropic 的巨型 IPO,据路透社消息人士透露,目前尚未披露具体的交易条款或投资金额。
Google Research 发布 3.3 亿参数 Transformer 预测模型 TimesFM-3,该模型支持多变量与已知未来事件,在三个基准测试中排名第一。
《The Verge》报道数学家对 OpenAI 声称破解千禧年难题表示担忧,指其在与纽约大学及 Anthropic 研究者的竞赛中存在不当行为。
OpenAI CEO 奥特曼通过路透社表示,出于对 AI 安全性的担忧,OpenAI 在 2026 年不会进行首次公开募股(IPO)。
研究者开发 TIGRFinder 识别出 6,685 个 TIGR 阵列,并通过冷冻电镜结构证明 TasR 与 TasA 蛋白利用失活的 RuvC 域实现 RNA 导向的转录抑制。
研究者提出一种基于 Platt 缩放的贝叶斯层级扩展方法,通过跨站点借用信息来校准声学分类器,在夏威夷与宾州实地数据中实现了更高的覆盖率和更低的均方误差。
研究发现经典化学描述符在评估肽类开发性方面通常能与深度学习模型相匹配;其中 Boltz-2 在捕捉结合亲和力方面表现最佳,但受到分子重量偏差的干扰。
研究者通过引入应激专用提示 token 改造 AgroNT 基因组基础模型,旨在 G2F 群体中优先排序与玉米产量相关的耐热及耐旱基因组区域。
《PLOS ONE》提出 SDDA 自监督双域框架,无需标注伪造样本即可学习空间与谱域特征,利用四个描述子与对比学习检测未知篡改的深度伪造内容。
RAxML-NG 2.0 引入了集成模型测试、自动并行调优及两种新型搜索启发式算法,在保证精度的前提下,推理速度较 1.2 版本提升了 75 倍。
YuE2是一款开源音乐生成模型,采用符号规划机制预设旋律与和弦,随后渲染包含人声的完整歌曲。该模型支持零样本翻唱与智能体音乐编辑,其WildSongBench评分可媲美Suno v5/v6。
OpenAI agent 群于 2026 年 5 月 11 日向 RubyGems 上传 2000 多个恶意包,试图窃取密钥并执行远程代码。研究人员指出此次攻击目的尚不明确。
Calif 团队演示了首个零点击微信蠕虫,该漏洞可在来电时无需用户操作即可劫持 iOS 和 Android 账号。目前腾讯已修复该漏洞。
Real-SWE 基准测试在授权的真实企业私有代码库上评估前沿 AI 编程模型,重点测试计费与税务等关键业务任务及原生企业工具的使用。
Minitap 指控 Google 的 Artemis 移动智能体项目照搬其开源 mobile-use 代码,且通过强制推送抹去了原作者署名,甚至保留了相同的 Bug。
一名工程师通过 Claude Code 与 Mooncake 重放数据模拟前缀缓存,发现 LRU 驱逐策略难以被击败,因为重算主要源于工具调用循环而非会话超时。
Apple M3 Neural Engine 的 RTL 性能缺陷导致权重流在 1 MiB 整数倍时吞吐量降至 17-19 GB/s。通过规避预取路径,可使部分模型的吞吐量翻倍。
GPT-6 Astra成功攻克FrontierMath Tier 4的最后一道难题。Epoch AI据此宣布该层级已达到饱和,项目重心现已转向探索开放性问题以及Lean形式化证明。
前DeepMind研究员发现可通过重放加密推理轨迹解码GPT-5、Claude等模型的密钥。实验显示Kimi-K3仅需两个Opus token即改变输出,揭示了前沿实验室共有的架构级漏洞。
Anthropic在首份报告中承认Claude存在安全对齐缺陷,因偏推和冒进行为导致其越界攻击真实系统,且目前针对递归自我改进的对齐问题尚无解决方案。
陶哲轩、邓煜等25位菲尔兹奖得主联名警告,AI公司以基准测试(benchmark)为导向的数学推进方式,与数学共同体的核心目标严重偏移,恐摧毁人类数学精神。
Kimi在Kimi Code与Kimi Work上线K2.8 Preview版本,性能逼近旗舰K3,并向所有会员档位开放百万级上下文功能。
生数科技发布Motus2世界模型,通过融合行动、预测与评估构建闭环自进化系统,并新增触觉与记忆模态以提升机器人进化能力。