微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 字节跳动Seed团队打造的「全能AI助手」:一个能做奥数、调试代码、分析分子结构的超级模型

字节跳动Seed团队打造的「全能AI助手」:一个能做奥数、调试代码、分析分子结构的超级模型

2026-07-09 10:48
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-07-09 10:48 科技行者

这项由字节跳动Seed团队开发的研究成果发表于2026年6月30日,论文编号为arXiv:2607.00248v1,分类在计算机人工智能领域(cs.AI)。有兴趣深入了解的读者可以通过该编号在arXiv平台查询完整论文。

每天,数亿人打开手机,向AI助手提问。他们问的不只是「今天天气怎么样」,而是「帮我修一下这段报错的代码」「这张财务报表有什么问题」「我想做一个网站,从零开始怎么搞」。这些问题背后藏着一个现实:当下最先进的AI,在实验室里能解开奥林匹克数学题,却可能在真实工作场景里频频翻车。

字节跳动Seed团队正是在这个背景下,发布了Seed2.0系列模型(包括Pro、Lite、Mini三个规格)。这不是一个单纯刷榜的模型,而是一次对「如何让AI真正能用、好用」的系统性探索。团队服务着数亿日活用户,深知用户的痛点究竟在哪里——不是模型在封闭题库上的分数,而是它能不能帮你完成一整个真实的工作任务。

---

一、为什么要做Seed2.0:从「答题机器」到「工作伙伴」

把AI的发展比作一个学生的成长历程,早期AI就像只会背课本的书呆子——它能在考试里答对很多选择题,但一旦碰到真实的项目任务,就会手足无措。Seed2.0的目标,是让这个「学生」真正走出考场,进入社会,能干活、能犯错后自我纠正、能在复杂环境里找到路。

Seed团队在产品部署中观察到,真实用户的需求高度集中在几个方向。首先,大量用户会上传图片——截图、图表、扫描文件——让AI帮忙分析,因此视觉理解能力至关重要。其次,推理速度直接影响用户体验,没人愿意等待一分钟才看到回复,于是模型被设计成三种规格,让开发者按需选择速度与性能的平衡点。再者,用户经常给出复杂的多步骤指令,这些任务不需要AI「懂得很多」,而是需要它「严格按要求执行」,不能打折扣。最后,写代码是使用量最高的场景之一。

与此同时,团队的视野不只停留在「完成用户当前提问」,而是瞄准了更宏大的目标:让AI成为能够推进真实科研、完成复杂软件工程项目的「智能体」(Agent)。从解奥数题,到解埃尔多斯悬赏数学问题;从修一个bug,到完整构建一个软件仓库——这就是Seed2.0希望突破的边界。

---

二、用户到底在用AI做什么:一份来自真实世界的画像

在深入讲解模型本身之前,团队公布了一份非常有价值的数据——他们在中国大陆MaaS(模型即服务)平台上观察到的真实使用分布,数据来自签署了数据授权协议的合作方。

从行业角度看,互联网行业占据了绝大多数流量,远超其他所有行业的总和。消费电子、金融、新零售、商业服务紧随其后。而制造业、汽车、通信等传统行业的占比均不足1%——这一方面说明AI目前主要在数字化程度高的行业发挥价值,另一方面也暗示传统行业存在巨大的待开发空间。

从使用场景看,非结构化信息处理占据最大份额——企业用AI分析用户反馈、整合多源文档、生成决策报告。教育、内容创作、搜索推荐紧随其后。相对小众的场景包括社交陪伴、专业咨询、客服销售、质检、编码和结构化信息处理。

在编程这个细分场景里,团队进行了更细致的分析,结论出乎意料又合情合理:前端开发占据最高比例,远超后端和全栈开发。前端工作天然具备快速反馈的特性——改一行CSS,刷新页面就能看到变化——这种即时反馈很适合与AI协作。在框架偏好上,Vue.js的使用量超过React三倍,反映了中国开发者生态的独特性。在任务类型上,修bug排在第一位,其次是重构和文档工作。这说明开发者目前主要把AI当作「救火队员」而非「从零建造者」。

还有一个关键角度是价格。Seed2.0 Pro的输入价格约为每百万token 0.47美元,输出约2.37美元。对比市场上同类顶级模型,Claude Opus 4.5的输入价格是5美元、输出25美元,GPT-5.2 High的输出价格高达14美元。Seed2.0 Pro的定价大约是这些模型的十分之一。对于需要大量调用API的企业来说,这个价差意味着原本经济上不可行的应用场景变得可行。

---

三、怎么评价一个AI:团队建立的「四维考场」

给AI打分是一门学问。用考研题测试AI,结果可能严重误导产品决策——因为用户实际遇到的问题和考研题相差甚远。Seed团队为此建立了一套覆盖四个维度的评测框架,每个维度都对应真实世界的某类核心需求。

第一个维度叫「科学发现」,测的是AI能不能在真正的研究级任务上帮上忙——比如实现科学计算代码、对生物医学文献进行推理。

第二个维度叫「Vibe Coding」,测的是AI能不能从一句话需求出发,完整构建一个软件仓库——包括跨文件的一致性、依赖管理、整体架构设计。这不是让AI写一段函数,而是让它承担整个工程师的角色。

第三个维度叫「上下文学习」,测的是AI能不能在给定大量文档、手册、噪声信息的情况下,准确提取有用内容并完成推理——这对企业场景至关重要,因为企业通常有大量内部知识文档。

第四个维度叫「真实世界任务」,测的是端到端的任务完成能力,比如规划一趟旅行(包含复杂的时间、地点、价格约束)、进行客户支持问答等。

这套框架既是评测体系,也是开发指南——团队在哪里发现了短板,就在那里投入资源改进。

---

四、语言能力大考:数学、代码、推理、指令执行全面解析

先说数学,这是AI能力最显著的「秀场」。Seed2.0 Pro在2025年国际数学奥林匹克(IMO)上拿到了35分(总分42分),达到金牌水平。在2025年中国数学奥林匹克(CMO)上同样拿到了金牌——114分(总分126分)。在AIME 2025上,Seed2.0 Pro以98.3的分数与GPT-5.2 High(99分)几乎并驾齐驱,大幅领先Claude和Gemini。在更难的IMO答题基准上,Seed2.0 Pro以89.3分排名第一。

更令人瞩目的是,团队展示了Seed2.0 Pro解决了两道埃尔多斯悬赏问题——这是数学家保罗·埃尔多斯留下的公开问题集,其中许多问题已悬而未决数十年。其中埃尔多斯1051号问题(关于一类无穷级数是否为无理数的证明)还通过Seed-Prover 1.5进行了形式化验证,确保证明过程的严格性。

在代码方面,Seed2.0 Pro在Codeforces平台上达到了3020的Elo评分,这个数字大致对应人类顶级竞技编程选手的水平。在LiveCodeBench(一个持续更新、难以通过背题作弊的代码基准)上,Seed2.0 Pro以87.8分的成绩与GPT-5.2 High(87.7)并列,领先于Claude系列。在涵盖五场2025年ICPC官方赛事(包括世界决赛和多个区域赛)的测试中,Seed2.0 Pro以73.02%的Pass@8分数显著超越GPT-5.2(65.08%)和Gemini-3-Pro(63.49%),在全部五场比赛中均达到金牌水平。

在科学推理方面,Seed2.0 Pro在物理基准PhyBench上以74分与GPT-5.2 High持平,在FrontierSci-research(前沿科研级问题)上同样以25%的成绩与GPT-5.2 High并列第一。在通用推理基准ProcBench上,Seed2.0 Pro以96.6分超越了所有参与比较的模型。

在复杂指令执行方面,团队设计了一个针对中文生产场景的内部基准,包含912个测试案例,涵盖格式要求、条件规则、内容指定、措辞风格、语气控制、表情符号使用、少样本学习、长度限制等17个细分维度。Seed2.0 Pro的综合得分为75.26%,比上一代Seed 1.8提升了2.37个百分点。提升最显著的是语气控制(+15.16%)、措辞遵循(+10.31%)和少样本学习(+9.53%)。这意味着模型现在能更准确地模拟「阴阳怪气」、「傲娇」等微妙的中文语气,也能更可靠地从示例中推断格式规范。

---

五、视觉理解:从数学图题到长文档,样样在行

在图像理解领域,Seed2.0 Pro接受了覆盖9大类别、共50个公开基准的全面测试。

在数学图题方面,Seed2.0 Pro在MathVision上以88.8分夺冠,在MathKangaroo(汇集2025年全年双月竞赛题)上以90.5分居首,在MathCanvas(强调视觉内在推理链)上以61.9分领跑。在MathVista上则以89.8分与Gemini-3-Pro High并列第一。

在视觉谜题与逻辑推理方面,Seed2.0 Pro在VisuLogic(视觉逻辑推理)上以47.4分大幅领先所有竞争对手,在ZeroBench(一个被设计成「对当代模型几乎不可能完成」的基准)的子题部分以47.6分位居榜首。在ARC-AGI1图像版本上以88.8分仅次于GPT-5.2 High(93.1分),但比Seed 1.8(31.4分)有了质的飞跃。

在空间理解方面,Seed2.0 Pro在DA-2K(深度感知)上以92.3分、在RefSpatialBench(参照空间关系理解)上以72.6分、在BLINK(多模态感知)上以79.5分均创下新的最高纪录。

在文档与图表理解方面,Seed2.0 Pro在ChartQAPro(图表问答)上以71.2分领先,在OmniDocBench 1.5(文档解析,分数越低越好)上以0.099的Normalized Edit Distance排名第一,在MMLongBench-Doc(长文档理解)上以61.4分超越所有对比模型。

在视频理解方面,Seed2.0 Pro在VideoReasonBench上以77.8分超越了人类基准(73.8分),在VideoMME(包含大量小时级别长视频)上以89.5分刷新记录,在多个运动感知和流媒体理解基准上也均居前列。团队还为所有Seed2.0模型配备了「VideoCut」工具——当遇到需要高帧率分析的长视频片段时,模型可以主动调用这个工具对关键片段进行更精细的重播分析。在ZeroVideo(一个包含细粒度高帧率运动感知和长程多跳推理的挑战性基准)上,配备VideoCut的Seed2.0 Pro从14.5%大幅跃升至27.9%。

---

六、智能体能力:从搜索、写代码到操控电脑界面

Seed2.0的「智能体」能力测试涵盖了搜索代理、深度研究、视觉代理、编程代理和工具使用五大类别。

在搜索与研究方向上,Seed2.0 Pro表现出色。在BrowseComp-zh(中文网页浏览搜索)上以82.4分位列第一,在HLE-text(需要工具辅助的人类最难考试题)上以54.2分超越所有对比模型,在DeepSearchQA上以77.4分排名最高,在DeepResearchBench(深度研究报告生成)上以53.3分和ResearchRubrics(研究质量评估)上以50.7分均居首位。在DeepConsult(咨询类深度研究)上以61.1分并列第一。

在视觉代理方向,Seed2.0 Pro的领先优势尤为显著。在Minedojo-Verified(Minecraft环境中的具身智能体任务)上以49%的得分远超GPT-5.2 High(18.3%)和Gemini-3-Pro(23.3%),在MM-BrowseComp(多模态网页浏览)上以48.8%同样大幅领先(GPT-5.2为26.3%,Gemini为25%)。

在编程代理方向,Seed2.0 Pro在SWE Multilingual(多语言代码库问题修复)上以71.7分、在SpreadsheetBench Verified(电子表格操作)上以79.1分均居首位,在SWE-Bench Verified(主流代码库真实bug修复)上以76.5分位列第二梯队。

团队也坦率地承认了明显短板:在SWE-Evo(跨版本代码库演进)和NL2Repo-Bench(从自然语言描述生成完整代码仓库)上,Seed2.0 Pro明显落后于Claude Opus 4.5,这是未来重点攻坚的方向。在长上下文精确检索任务MRCR上,Seed2.0 Pro(54分)也落后于GPT-5.2 High(89.4分)。

对于效率版模型,Seed2.0 Lite在多个智能体基准上超越了同类高效模型。在BrowseComp-zh上以82分排名第一,在DeepResearchBench上以54.4分和ResearchRubrics上以50.8分均名列前茅,在τ?-Bench(零售场景工具使用)上以90.9分同样居首。

---

七、真实任务中的AI:五个让人印象深刻的实战案例

比分数更能说明问题的,是模型在真实复杂任务中的实际表现。团队展示了一系列极具挑战性的实战案例。

第一个案例是针对FEAL-like加密算法的密码学攻击。任务给出了一个类FEAL密码的加密程序、32对明文-密文对,要求在不暴力穷举的情况下恢复密钥。密钥空间达到2的80次方,暴力破解完全不可行。Seed2.0 Pro分三个阶段完成了这个任务:首先分析密码结构,推导出F函数的逆运算;然后设计「中间相遇攻击」——将搜索空间分成两半,分别从明文端和密文端推进,在中间位置碰撞匹配,将计算量从2的80次方降至2的21次方;最后对100个密文全部解密成功,并用所有32对已知明密文对验证了密钥的正确性。值得注意的是,Seed2.0 Pro的攻击方案与基准答案不同——它独立设计了自己的攻击路径,说明它做的是真正的密码分析推理,而非记忆复现。

第二个案例是从自然语言规格文档构建Python配置管理库。任务只给了一份39KB的需求文档,要求从空白工作区开始,构建出一个可安装、可测试、符合API规范的Python包(类似python-decouple这样的真实开源库)。Seed2.0 Pro在37轮交互后完成了任务,过程中自动编写了22个测试案例,发现并修复了5个具体问题:缺少pytest依赖、Python 3.12 API变更、空字符串布尔转换异常、测试夹具作用域错误、参数名混淆。最终所有22个测试全部通过,并通过pip install验证了可安装性。

第三个案例是量子编译器中的相位错误修复。这是AInsteinBench中的量子软件工程题目,要求修复Qiskit量子编译器中的一个微妙bug:用Solovay-Kitaev算法分解Pauli-Y门时,得到的电路实现了-Y而非Y,差了一个全局相位。Seed2.0 Pro正确识别出这个错误的根源在于SU(2)和SO(3)的群论关系——SK算法在SO(3)空间中递归,无法区分U和-U,因此在将结果映射回SU(2)时会丢失相位信息。它拒绝了「对某个特定门单独修补相位偏移」这种hack方案,因为这会破坏其他门的行为,最终实现了一个通用的相位对齐方案,验证了对所有单量子比特门的有效性。

第四个案例是数值广义相对论代码实现。Einstein Toolkit的构建系统引用了一个不存在的Fortran子程序AHFinder_dis.F,任务要求实现它。Seed2.0 Pro首先追踪到代码库中的调用位置,理解了这个子程序的功能:在双黑洞模拟中计算两个视界面之间的本征距离(Proper Distance)——这不是简单的欧氏距离,而是需要在弯曲时空中沿测地线积分度规张量的线元。Seed2.0 Pro实现了正确的物理公式,包含完整的6分量度规张量(gxx、gyy、gzz、gxy、gxz、gyz),正确使用了Einstein Toolkit的API接口,并添加了鲁棒性校验。

第五个案例是PySCF量子化学软件中复数密度矩阵的bug修复。任务涉及密度拟合加速的J/K矩阵构建,当使用复数分子轨道系数时,计算结果偏差约0.9 Hartree(一个极大的误差)。Seed2.0 Pro追踪到底层C库函数AO2MO只支持实数数组,而复数密度矩阵被直接传入时导致内存解释错误。解决方案利用了J/K矩阵构建对实部和虚部的线性性:将复数密度矩阵分解为实部和虚部,分别通过原有实数路径计算,再线性叠加。修复后,DF复数计算结果与参考值的误差降至10的负11次方Hartree,通过了完整的回归测试。

---

八、AI操作真实软件界面:FreeCAD建模与CapCut视频剪辑

团队还展示了Seed2.0 Pro操控真实图形界面软件的能力,这是目前AI落地「效率工具」的重要方向。

在FreeCAD(一款专业CAD软件)的测试中,任务要求用Part Design工作台创建一个参数化实体:先画一个直径80mm的圆并拉伸40mm形成圆柱,再在顶面画一个50×30mm的矩形并拉伸20mm形成凸台,最后读取最终实体的体积和表面积。Seed2.0 Pro通过96步操作完成了这个任务,途中遭遇了8次工具选择错误——比如误点了口袋工具弹出错误对话框、直接点击几何体边缘无法选中等——但每次都能准确诊断失败原因并切换到更可靠的策略(例如从工具栏图标切换到菜单栏导航,从直接点击几何体切换到通过元素面板选中)。最终通过Python控制台执行obj.Shape.Volume和obj.Shape.Area读取了精确到小数点后6位的结果:体积231061.93 mm?,表面积23306.19 mm?。

在CapCut(专业版视频剪辑软件)的测试中,任务要求按照精确的时间码对视频进行分割、添加溶解转场效果、导入并对齐音频轨道、添加雪花特效并延伸至整个时间线。Seed2.0 Pro在操作过程中多次遭遇界面响应延迟、双击未被识别、拖拽添加效果失败等现实问题,但每次都能重新锚定时间线起点(00:00:00:00)和剪切点(00:00:02:29),防止错误级联传播,最终生成了符合所有时间码要求的剪辑项目。

---

九、多学科科研分析:从分子动力学到有机聚合物机理

除了执行类任务,团队还测试了Seed2.0 Pro在研究分析场景中的表现。

在分子生物学方向,任务要求设计一套用GROMACS进行粗粒化分子动力学模拟的完整协议,研究大麻二酚(CBD)如何调控α7烟碱型乙酰胆碱受体。Seed2.0 Pro给出了一份详细到命令行参数级别的协议,正确选用了PDB 7EKI/7EKJ两个冷冻电镜结构(静息态和脱敏态),选用了Martini 3力场,提出了用分配系数(log P)验证疏水配体参数化准确性的思路,给出了从CBD 25个重原子到7个粗粒化珠子的映射方案,详细规定了能量最小化、NVT/NPT弛豫、生产模拟各阶段的GROMACS命令和参数。团队同时指出,模型在具体PDB条目和文献引用方面存在幻觉,需要使用者在实施前进行核实。

在有机化学方向,任务要求分析马来酰亚胺聚乙炔(mPA)的两步合成路线——先通过开环易位聚合得到前体聚合物,再用三乙胺和TCNQ/碘氧化获得完全共轭的主链。Seed2.0 Pro正确识别了该路线的战略价值(解决了共轭聚合物的加工性困境)、Schrock催化剂的选择原因(对电子缺乏型底物的高活性)、氧化步骤的单电子转移机理,以及马来酰亚胺单元降低LUMO能级、促进n型半导体行为的结构-性能关系。团队指出,模型未能识别三乙胺和氧化剂之间可能先形成电荷转移复合物的精细机理。

---

十、一个用AI分析AI的系统:自动化模型诊断流水线

随着基准数量的增加,手动分析评测结果变得越来越耗时。团队为此构建了一个「用AI分析AI」的自动化诊断流水线——用大语言模型分析其他模型在各基准上的表现,生成结构化的行为分析报告。

系统汇聚来自不同基准的指标分数和行为统计(包括token用量、格式合规率、对话轮次、表情符号频率、Best-of-N统计等),结合逐样本输出、推理链和执行轨迹,通过三层架构(数据处理层、场景自适应分析工作流层、报告合成层)生成可供算法研究人员直接使用的结论。

在对XBench搜索代理基准的分析中,系统发现Seed2.0 Pro以0.64的平均分位列第一,但在需要精细边界对齐的结构化比较任务中有明显弱点。在对IMO-Bench的分析中,系统发现Seed2.0 Pro的Best-of-1分数(won=0.66)与Best-of-8分数(bon=0.87)之间存在0.211的差距,说明模型在极端值构造和全量词穷举类问题上存在采样不稳定性。这些细粒度诊断能帮助团队快速定位薄弱点,加速迭代。

---

说到底,Seed2.0这个项目讲述的是一个核心矛盾:AI在孤立任务上的能力已经相当惊人,但要让它在真实的、连续的、充满意外的工作环境中可靠地完成任务,还有相当长的路要走。团队在这份报告里做的,是把这条路走得更踏实一些——通过真实用户数据理解需求,通过贴近真实场景的基准衡量差距,通过大量实战案例展示已经能做到什么。

Seed2.0 Pro在数学、代码、科研推理上已能与全球顶尖模型并驾齐驱,在中文指令执行、深度研究搜索、视觉代理等方向甚至取得领先;而在整个代码仓库的从头构建、长文档精确检索等方向,团队也坦率地亮出了自己的短板,并将其列为优先攻坚方向。以十分之一左右的价格达到接近最前沿的性能,这对于需要大规模部署AI的企业来说,可能是比跑分更重要的实际价值。

对这项研究感兴趣的读者,可以通过arXiv平台搜索论文编号arXiv:2607.00248查阅完整报告,其中包含各基准的详细分数表、完整实战案例的逐步执行轨迹,以及形式化数学证明的Lean代码。

---

Q&A

Q1:Seed2.0 Pro和GPT-5.2、Claude Opus 4.5相比性能怎么样?

A:Seed2.0 Pro在数学推理(IMO金牌、AIME 98.3分)、前沿科研问题、深度搜索研究等方向与GPT-5.2 High基本持平甚至在部分项目领先;在中文指令执行、视觉代理、多模态浏览等方向明显占优。但在整个代码仓库从头构建(NL2Repo)和长文档精确检索(MRCR)方面,Seed2.0 Pro落后于Claude Opus 4.5和GPT-5.2 High。整体性能属于同一梯队,价格约为竞品的十分之一。

Q2:Seed2.0解决埃尔多斯问题是真的吗?

A:是的。团队展示了Seed2.0 Pro利用迭代精化流水线(生成-验证-修正循环)解决了两道埃尔多斯公开问题,包括第1051号(关于整数序列无穷级数为无理数的证明)。这道题的证明还由Seed-Prover 1.5在Lean定理证明器中进行了形式化验证,并公开了Lean代码。团队表示人类专家已核实了证明的正确性。

Q3:Seed2.0系列的Mini和Lite版本适合什么场景用?

A:Seed2.0 Mini的解码价格约为每百万token 0.31美元,适合对延迟敏感、调用量极高但任务相对简单的场景,比如高并发的内容分类、关键词提取。Seed2.0 Lite在多项高效模型对比中击败了GPT-5-mini High,数学推理和搜索研究能力突出,适合需要一定推理深度但又对成本敏感的通用企业应用,比如客服问答、文档摘要、教育辅导。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-