Reflection发布501B开放权重模型Beam↗
Reflection在官方博客介绍Beam,称其为501B开放权重模型,并将发布目标表述为让智能更开放、易于获取。所给材料未包含模型架构、能力评测或权重获取方式等更多细节。
往期日报14 条新闻08:31 更新
Reflection在官方博客介绍Beam,称其为501B开放权重模型,并将发布目标表述为让智能更开放、易于获取。所给材料未包含模型架构、能力评测或权重获取方式等更多细节。

OpenAI称,将在ChatGPT引入新的视觉广告形式,并扩展广告衡量工具、归因合作及品牌适宜性相关能力,面向广告主提供支持。

Anthropic员工Felix Rieseberg介绍,新版Claude Cowork在云端运行模型推理和虚拟机,每个会话使用独立沙箱;需要访问用户设备文件时,由桌面应用执行文件访问调用。此调整旨在避免本地虚拟机带来的资源消耗,并让任务在用户合上电脑后继续运行。
论文提出DeReAct,将Agent架构拆分为负责动作执行前审查的Critic,以及重建环境状态并认证任务完成的Context Manager。在GAIA和SWE-bench Verified上,较弱的Brain模型获得更明显的Pass@1提升;Claude Opus 4.5下总体成绩与ReAct相近,但轨迹更完整、约束满足度更高。
论文提出Comparative Inference for Tool-use Agents(CITA),训练模型比较同一上下文下不同工具调用对最终任务成功的影响。方法结合真实行为、贝叶斯工具图模拟器和LLM比较监督,在三个工具使用基准及多种基础模型上提升了Tool F1和任务成功率。
mainbrella创始人介绍,该开源项目面向代码和Agent提供沙箱机器服务,可在用户自己的Cloudflare账户运行。其公布的测试中,新建沙箱到可用Shell耗时381毫秒;100个并发沙箱平均启动耗时680毫秒,且均成功启动。
开发者介绍,Ototo将代码探索等耗费Token的任务交给较小模型处理,再把结果交还主模型,以节省成本并保持主上下文清晰。作者称其已用Qwen 3.8 27B进行测试,并与Claude及其探索Agent在多个代码仓库上的表现作了比较。

GitHub仓库 cloudflare/cloudflare-os 介绍了一款基于Cloudflare Workers的Agent工作空间,可用于创建文档、构建应用和运行Agent,并结合企业自身的上下文与系统。
GitHub仓库 msitarzewski/agency-agents 汇集多种专业角色Agent,涵盖前端开发、社区运营等职能,并为各角色描述个性、工作流程和预期交付物。
论文比较开源权重模型Laya与托管模型Jev在11类Agent决策点上的表现,使用7283个基础案例和6640个稳健性变体。Jev在其中9类决策上更准确;研究还发现模型路由接近随机、选项顺序会影响结果,并修正了此前对节省比例和端到端质量的分析。
GitHub发布开放基准ReviewBench,用于评估代码审查Agent。该基准基于具有代表性的GitHub Pull Request,采用多来源真实依据、校准评估方法及贴近生产场景的指标。
论文用两阶段LLM分类流程分析2020年至2025年英国1362家上市公司的9821份年报。报告称提及AI风险的年报比例从2.8%升至41.2%,但2025年仅4.3%的年报包含被判定为实质性的AI风险披露;全文还比较了行业、市场板块和基础设施领域差异。
Cloudflare在官方博客回顾16周年Birthday Week,称活动期间发布了46项公告,涉及开源、后量子安全、AI智能体和开发者平台升级。文章按日期汇总活动期间推出的内容。

OpenAI介绍其应对欧盟文本来源规则的做法,内容涵盖文本水印适用范围、检测方式,以及研究者如何获得相关访问权限。
