搜索结果
追踪全球人工智能最新动态,深度报道行业大事件、技术突破、产品发布和融资资讯。
找到 4 条与 "SWE-bench" 相关的资讯
NVIDIA开源NOOA智能体框架:一个Python类就是一个Agent,SWE-bench达82.2%
NVIDIA开源NOOA智能体框架:一个Python类就是一个Agent,SWE-bench达82.2%
8月9日,NVIDIA Labs正式开源NOOA智能体框架(Apache 2.0协议),采用革命性设计:一个Python类就是一个Agent,方法即动作、字段即状态、文档字符串即提示词。SWE-bench Verified得分82.2%,支持通过LiteLLM对接任意模型。
Anthropic发布Claude 3.5 Sonnet升级版:新增computer use,SWE-bench跃升至49%
Anthropic发布Claude 3.5 Sonnet升级版:新增computer use,SWE-bench跃升至49%
2024年10月22日Anthropic发布Claude 3.5 Sonnet升级版,SWE-bench Verified从33%跃升至49%,新增computer use功能可操控电脑GUI,编程能力业界领先,价格不变。
月之暗面Kimi K2发布:1万亿参数MoE,SWE-bench 72.5%登顶开源编程王
月之暗面Kimi K2发布:1万亿参数MoE,SWE-bench 72.5%登顶开源编程王
2025年7月11日月之暗面发布Kimi K2,1T参数MoE架构激活32B,SWE-bench Verified达72.5%创开源SOTA,MuonClip优化器15.5T token训练零崩溃,Apache 2.0开源。
Anthropic发布Claude Opus 4.1:编程能力再突破,SWE-bench达74.5%
Anthropic发布Claude Opus 4.1:编程能力再突破,SWE-bench达74.5%
Anthropic于2025年8月5日发布Claude Opus 4.1,在SWE-bench Verified基准测试中取得74.5%的历史最高分,超越OpenAI o3和Google Gemini 2.5 Pro,强化AI编程市场护城河。