AI 晚报 2026-08-11
今日 AI 圈的主角是开源模型与资本市场:NVIDIA 发布开源 30B MoE 模型 Nemotron 3.5 Lightning,主打常驻智能体场景,token 生成速度最高提升 4 倍,SGLang 同步提供 Day-0 支持;蚂蚁百灵开源 Ling-3.0-tiny,推理时仅激活 1.3B 参数。行业侧,消息称 Anthropic 最快今年 9 月上市,估值高达 9650 亿美元。研究侧,OpenAI 未发布的 Astra 模型攻克 10 道长期悬而未决的数学难题,令数学家既兴奋又担忧;LMSYS 则提出 Unified Radix Cache 统一混合模型前缀缓存。
模型发布/更新
1. NVIDIA 推出 Nemotron 3.5 Lightning,加速本地智能体任务
来源:NVIDIA Blog · 今天 21:00 · 链接
NVIDIA 发布 Nemotron 3.5 Lightning,一款可定制的开源 30B 混合专家(MoE)模型,专为常驻智能体设计。相比同类开源模型,其 token 生成速度最高提升 4 倍,任务完成时间缩短 30%。该模型采用开放权重,支持用户微调以匹配特定任务,并可在 RTX PC、DGX Spark 及 Jetson 等设备上运行。
2. SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning
来源:LMSYS Blog(Chatbot Arena 团队) · 今天 21:51 · 链接
SGLang 宣布对 NVIDIA Nemotron 3.5 Lightning 提供 Day-0 支持。该开源模型为 30B 总参数、3B 激活参数的混合专家架构,支持最长 1M token 上下文,可从 Hugging Face 下载 BF16 和 NVFP4 权重。模型支持 MTP、DFlash、DSpark 三种投机解码技术,并可通过 OpenAI 兼容 API 接入智能体工作流。
3. Ling-3.0-tiny 正式开源:1.3B 激活参数如何进入真实任务
来源:公众号:蚂蚁百灵(Ling) · 今天 17:20 · 链接
蚂蚁百灵开源 Ling-3.0-tiny,一款总参数 7.9B、推理时仅激活 1.3B 参数的原生混合推理模型,同步提供 BF16、FP8 和 INT4 三个版本,为小显存设备上的真实任务推理提供了新选择。
产品发布/更新
4. ZCode 全面升级:Goal、Subagents、Remote Control 与闲时任务四大功能上线
来源:公众号:智谱(GLM) · 今天 13:52 · 链接
ZCode 针对 GLM 深度优化,今日上线 Goal、Subagents、Remote Control 与闲时任务四大功能。在 Z.ai Code Bench 测试中,GLM-5.2 搭配 ZCode 较搭配 Claude Code 任务整体通过率高 2.39%;ZCode 缓存命中率超 98%,叠加 1.5 倍限时额度加成后,GLM Coding Plan 整体使用量接近常规额度的 1.8 倍。
行业动态
5. 消息称 Anthropic 最快今年 9 月上市,向投资者淡化 AI 模型竞争等挑战
来源:IT之家 · 今天 11:57 · 链接
Anthropic 正与潜在投资者接触,为可能成为史上规模最大的 IPO 做准备,计划今年 9 月或 10 月初正式上市。公司估值高达 9650 亿美元,年化收入已超 470 亿美元,并淡化来自中国 AI 企业的竞争影响。Anthropic 还计划拓展 AI 在医疗和生物学领域的应用,但尚未公布具体 IPO 定价方案。
论文研究
6. 统一 Radix 缓存:为混合模型前缀缓存构建单一树结构
来源:LMSYS Blog(Chatbot Arena 团队) · 今天 21:51 · 链接
LMSYS 团队提出 Unified Radix Cache,用单一 token 键控 radix 拓扑统一管理混合模型的 FULL、SWA 和 MAMBA 组件缓存,各组件独立执行路径、滑动窗口和检查点复用语义。前缀缓存复用 KV 时,一旦共享前缀的 KV 计算完成,随着更多 token 追加其依然有效,显著提升混合架构模型的推理效率。
技巧与观点
7. OpenAI 用 Astra 模型攻克 10 道数学难题,数学家既兴奋又担忧
来源:The Verge · 今天 19:00 · 链接
OpenAI 宣布其未发布的 Astra 模型解决了 10 道长期悬而未决的数学难题,涵盖球体堆积、纠错码、非 sofic 群存在性等领域,并发布超 250 页论文及 Lean 验证结果。这一突破让数学界既兴奋又担忧——AI 对数学的”接管”或许已经开始了。
8. 用 ComfyUI API 实现 MiniMax-H3 多模态视频与音频生成流水线
来源:MarkTechPost · 今天 13:44 · 链接
本教程演示如何以 ComfyUI 为无头推理后端,构建端到端的 MiniMax-H3 视频生成工作流。通过 Python 直接构建执行图,支持文生视频、首尾帧条件生成和参考图像条件生成,并自动根据 GPU 显存选择 quality、balanced、squeeze 三种权重配置。流水线涵盖模型自动下载、节点模式校验、音视频联合解码与进度监控,无需图形界面即可复现实验。
9. 编写智能体时,哪种编程语言最合适?
来源:Hacker News 热门(buzzing.cc 中文翻译) · 今天 12:58 · 链接
针对”动态语言比静态语言更省 LLM token”的流行说法,作者用 GPT-5.6 Sol 让智能体实现 zstd 解码器进行实测。结果显示,medium 努力度下动态语言表现更好,ultra 下静态语言反而更优,且此前评测存在测试路径错误等缺陷。作者认为,琐碎任务上的性能无法推广到更大问题。
今日关键词: Nemotron 3.5 Lightning、Ling-3.0-tiny、Anthropic IPO、OpenAI Astra 数学难题、ZCode 升级、统一 Radix 缓存