今晚 AI 圈暂无大规模新品集中发布,但有一则值得关注的模型评测争议:媒体称 OpenAI 曾多次修改 GPT-6 Astra 的基准测试数据,部分指标出现明显变化。它再次提醒我们,阅读模型成绩时不能只看单一数字,还要关注版本、口径和发布时间线。

技巧与观点

媒体称 OpenAI 多次修改 GPT-6 Astra 基准测试数据,部分成绩一度大幅变化

IT之家(RSS) · 约 8 小时前 · 来源

据 Fortune 报道,OpenAI 自 9 月 3 日发布 GPT-6 Astra 公告以来多次修改评测基准数据,其中 Astra 幻觉率曾从 4.2% 降至 2%,之后又改回。对模型评测结果而言,数据版本和修订记录同样重要,使用者应结合原始公告与更新后的口径进行判断。


今日关键词:GPT-6 Astra · OpenAI · 模型基准测试 · 评测数据修订 · 幻觉率