首页
资讯
品牌
选型
社区
活动
视频
排行
------
反馈
科技资讯
看见即行动、性能超 Jev,上海 AI 实验室推出决策模型 “书生・明决”,实现响应效率与质量双升级
2026-10-01 18:07:54   转载自上海人工智能实验室

近日,上海人工智能实验室(上海 AI 实验室)推出决策模型书生・明决(Decision),性能超越 Jev 及同类开源模型,包含 0.8B、2B、4B 三档参数版本。

智能体在动态环境执行任务时,决策的速度与精度,直接决定交互的质量与任务落地的效果。书生・明决将原生视觉感知与指令遵循融为一体 —— 在 "看见" 画面的同时做出精准决断。实测显示:

单卡 4090 环境中决策速度达 30 次 / 秒:书生・明决 0.8B 和 2B 模型延迟约 33 毫秒,4B 模型单次端到端时延为 44.16 毫秒,比 Jev 快 2 倍以上。

7 项测评登顶 SOTA:在 JevBench 等 7 项基准评测中,书生・明决 4B 模型平均得分达到 90.02,居参评模型榜首。

此外,结合置信度分流机制,书生・明决还可将不确定的问题交由大模型处理,探索兼顾响应速度与决策准确性的协作模式。

2024 年,上海人工智能实验室主任、首席科学家周伯文提出:真正的通用人工智能(AGI)需要构建一种能够动态融合 "系统 1"(直觉式快思考)与 "系统 2"(逻辑式慢思考)的智能架构 —— https://mp.weixin.qq.com/s?__biz=MzkzNzIyNDg4MQ==&mid=2247563665&idx=1&sn=2f5df76297205b7065dfd93461165511&scene=21#wechat_redirect 。书生・明决作为系统 1 的代表成果,与承担系统 2 的大模型将形成有机快慢协同。

书生・明决即将接入 https://mp.weixin.qq.com/s?__biz=MzkzNzIyNDg4MQ==&mid=2247565917&idx=1&sn=225e9cac0015d92aa17d65856d50909d&scene=21#wechat_redirect ,为科学智能场景下的实验交互与自动化科研闭环注入新动能。

GitHub 链接:https://github.com/InternLM/Intern-Decision
Hugging Face 链接:https://huggingface.co/collections/internlm/intern-decision
构建多模态决策能力,实现复杂场景即时决策
结构化决策将模型的判断转化为程序可直接使用的选项。Jev 等模型虽已探索这一方向,但游戏和多模态决策等交互场景还要求模型读懂图像、识别界面变化。书生・明决在此基础上,把视觉信息融入决策环节,实现决策选择和画面感知相结合。团队通过游戏、图形界面等操作演示,验证了书生・明决的多模态决策能力。
在真实游戏场景里,书生・明决能直接读取游戏画面,自主选择下一步动作。测试用到的游戏画面类型丰富,包括二维网格地图、横版闯关场景,以及第一人称三维场景,需要模型完成路线选择、识别危险物品、判断空间方位等任务。团队观察到,在部分场景下,AI 角色撞到墙壁后,会主动转动视角,寻找新目标。
书生・明决读取游戏画面并选择动作
在图案验证码演示中,书生・明决可以独立完成读懂指令、识别图案目标、输出点击动作整套操作。全换成自主完成,无需人工介入修正,直观展现了它结合视觉识别、自主选择操作的交互能力。
书生・明决根据视觉指令完成鼠标交互

兼顾决策速度与效果,综合表现超 Jev
团队围绕 JevBench 的 Easy、Original、Hard 三个子集,以及 Typed Decision、ToolACE、AG News 和 WildJailBreak 共七项任务开展对比评测。书生・明决 4B 模型的平均得分为 90.02,较 Jev 的 88.74 高出 1.28 分,在本次参评模型中居首位。
其中,4B 模型在 Typed Decision 和 ToolACE 上的得分分别为 80.55 和 96.45,高于 Jev 的 73.35 和 91.29;在 JevBench-Hard 上取得 73.87,与 JevK5 并列最高。各模型在单项任务上各有优劣,4B 模型在本次评测中展现出更均衡、领先的综合性能。
七项任务平均得分及概率质量指标
在 RTX 4090 上的推理速度测试中,书生・明决 0.8B 和 2B 模型的平均端到端时延分别为 33.98 毫秒和 33.28 毫秒,对应每秒约 30 次决策;4B 模型的平均时延为 44.16 毫秒,P95 时延为 44.60 毫秒。相比之下,Jev 平均时延为 109.70 毫秒。更低的时延意味着更快的响应速度,为智能体不间断环境感知、动作选择与任务执行提供保障。
RTX 4090 测试环境下的端到端推理时延
探索快慢思考协同机制,求取决策效率与质量最优解
在真实交互场景中,任务难度参差不齐。智能体除输出决策结果外,还需给出判断依据:选择的可信程度如何,以及哪些问题值得进一步核验。为此,科研团队对书生・明决进行温度校准,提升模型置信度与客观现实的一致性。
在 JevBench-Hard 的可靠性分析中,校准前模型在高置信度区域存在偏差,部分接近 0.9 或 1.0 的置信度并未对应同等水平的准确率。校准后,这一偏差有所减小,为后续根据置信度进行任务分流提供了依据。对比 Jev 的置信度表现,书生・明决的校准效果更优。
JevBench-Hard 上的可靠性曲线 对角线表示置信度与准确率一致
团队还构建了选项概率分布评测集,覆盖直接随机性、混合分布、条件概率、观测偏差、概率谜题和序列过程六类场景,并为每道题提供精确的参考分布。测试显示,经过校准优化后,书生・明决的概率预测误差明显下降,关键指标均优于 Jev。以经典 "三门问题" 举例:按照理论,最开始选中的门中奖概率约 33%,剩下那扇没打开的门中奖概率约 67%。校准之后,书生・明决给出的判断概率为 42% 和 58%,对比 Jev 给出的 18% 和 82%,书生・明决的结果更贴近真实理论值。
模型输出的置信度,恰好可以作为分工依据,实现不同模型之间的任务调度。轻量小模型快速处理大量常规判断;当模型判断结果存疑时,再将任务移交大模型进行深度推理分析。
团队基于 JevBench-Hard 的 111 道题,验证了这一协作机制。书生・明决 4B 模型独立作答,答对 82 题(准确率 73.87%),耗时 4.90 秒。Atria-Dawn-Preview 独立作答,能答对 99 道(准确率 89.19%),但耗时增加至 300.03 秒。
书生・明决按照置信度判断,挑出 42 道拿不准的题目交给 Atria-Dawn-Preview 来处理。这种大小模型搭配的组合方案一共答对 97 道(准确率 87.39%),整套任务耗时约 140.16 秒,比全程用大模型少答对 2 道题,但花费的时间减少约 53.3%。
这一结果证明了在响应速度与准确率之间进行按需分配的可能:对时延敏感的环节可优先使用小模型,需要进一步提高准确率时,则依据置信度引入大模型。具体分流策略可随任务需求调整。
不同决策方案的准确率与总耗时对比
除了将小模型低置信度问题抛给大模型之外,书生・明决也可以作为大模型的执行部件完成复杂任务。在浏览器操作中,大模型负责理解整体目标、拆解阶段任务并整合跨页面信息;书生・明决负责高频局部决策,根据当前页面从点击、滚动、返回和结束等候选动作中作出选择。每次操作后,系统重新读取页面状态,继续下一轮判断,最终通过大小模型的协作交互完成复杂指令。
书生・明决在 Hugging Face 中查找书生・星河模型并核对架构与推理配置
书生・明决在多场景下展现出图像感知、自主决策的智能交互特性,大小模型按需分流的调度机制,为平衡性能与效率提供可行路径。相关探索能够支撑科学智能领域的实验交互与仿真迭代,为构建自动化科研闭环积累实践参考。接下来,团队将继续围绕通专融合路线,进一步打通通用感知能力与领域科学任务,推动智能体在复杂科研场景下落地应用。

(来源:上海人工智能实验室)

友情链接
粤ICP备2026052944号-1
违法和不良信息、涉未成年人有害信息举报电话:12377 jdwen@jushenhome.com
@2025-2026 www.jushenhome.com All Rights Reserved 具身之家 版权所有