-
谷歌推出全球首个双盲 AI 评估技术,基于加密环境保障基准测试公正性
谷歌联合多家机构推出全球首个针对前沿专有 AI 模型的双盲评估,依托加密隐私环境避免基准污染,同时保护双方数据安全,提升 AI 模型评估的可信度。
AI资讯2026-08-27AI资讯 -
OpenAI 挑战 AI 评测基准 SWE-Bench Pro:约 30% 存在评测缺陷
OpenAI 昨日(7 月 8 日)发布博文,挑战行业权威评测基准 SWE-Bench Pro,认为在 731 个公开测试任务中,约 30% 存在评测缺陷。
AI资讯2026-07-09AI资讯
微信客服