NVIDIA 发布 Nemotron 3 Embed 系列,登顶 RTEB 排行榜

NVIDIA 于 2026 年 7 月 16 日发布 Nemotron 3 Embed 系列嵌入模型,旨在提升多步智能体工作流中的检索质量。该系列包含三个模型:旗舰版 Nemotron-3-Embed-8B-BF16 在 RTEB 多语言排行榜上排名第一;高效版 Nemotron-3-Embed-1B-BF16 针对延迟和成本敏感的生产环境;硬件加速版 Nemotron-3-Embed-1B-NVFP4 基于 Blackwell 优化,适合超高通量和大规模基础设施。
关键特性包括:开源权重、数据集和训练配方,支持 32k 上下文窗口以处理长文档和代码库,多语言与代码检索能力,以及 NVFP4 4 位量化部署路径。NVIDIA 还提供了 NeMo AutoModel 微调和蒸馏配方,便于领域适配。模型即日起在 Hugging Face 等平台可用。
此次发布正值企业级 RAG 和智能体系统对检索质量要求日益提高之际。NVIDIA 强调,在多步智能体工作流中,低质量检索会导致智能体获取无关上下文、重复查询、浪费 token 预算,并将噪声带入后续推理步骤。Nemotron 3 Embed 通过 SOTA 准确率和灵活的部署选项,为开发者提供了从精度优先到成本优化的完整选择。
关键信息
- NVIDIA 发布 Nemotron 3 Embed 系列,包含 8B 和 1B 两个规模共三个模型。
- Nemotron-3-Embed-8B-BF16 在 RTEB 多语言排行榜上排名第一。
- 模型支持 32k 上下文窗口、多语言和代码检索。
- 提供 NVFP4 4 位量化版本,针对 Blackwell 优化。
- 权重、数据集和微调配方全部开源。
- 模型即日起在 Hugging Face 等平台可用。
Retrieval is critical in multi-step agentic workflows where poor retrieval can cause agents to fetch irrelevant context, re-query, waste token budget, and carry noise into later reasoning steps.
检索在多步智能体工作流中至关重要,低质量检索会导致智能体获取无关上下文、重复查询、浪费 token 预算,并将噪声带入后续推理步骤。
Hugging Face Blog
为什么上榜
如果你构建 RAG 或智能体系统,检索质量直接影响最终效果,Nemotron 3 提供了新的 SOTA 选择。
每天早上,把当日 AI 精选送进你的邮箱
公众号 AI去噪 · 每日一期同步推送
