小红书开源长程智能体模型dots3-note preview:280B参数、512K上下文,聚焦旅行规划与生活决策等开放任务
SmartHey8月14日消息,据机器之心报道,小红书IMO满分夺金自研模型的同系列版本——dots-note-3.0正式开源,新版本命名为dots3-note preview。
此前,小红书自研大模型「dots-note-3.0」曾创下历史性突破:成为首个在国际数学奥林匹克(IMO)竞赛中获得官方认证满分42分的AI系统,标志着其在复杂逻辑推理领域的顶尖能力。
今日,小红书 dots 模型实验室(简称 dots 实验室)宣布开源 dots3-note preview——这是 dots3 系列首个面向公众开放的版本,重点强化对现实世界中长周期、开放式任务的支持能力。
该模型总参数量达2800亿(280B),其中激活参数为160亿(16B),支持高达512K tokens的超长上下文窗口,并原生集成文本、视觉与语音多模态理解能力。在架构设计上,特别针对复杂推理链构建、智能体(Agent)自主决策以及多模态感知进行了深度优化。
此次开源不再局限于传统评测场景,而是将挑战延伸至更贴近真实生活的长程任务:如个性化旅行规划、婚礼全流程筹备、小微店铺开业运营等。这类任务无标准答案、目标动态演进、时间跨度可达数小时乃至数天,对模型的持续记忆、状态维护、意图一致性与自我纠错能力提出更高要求。
聚焦长程任务,也契合当前智能体技术发展的核心趋势:从执行单步指令,迈向承担端到端、跨时段、多目标的完整工作流。数据显示,OpenAI近期披露,今年5月已有超70%用户使用Codex处理需人类耗时一小时以上的复杂任务;至6月,其内部最活跃的1%用户日均生成超60小时的agent交互轮次(agent turns)。
然而,当任务场景从数学、编程、工程等结构化领域转向真实生活时,难度陡增——环境更开放、需求更模糊、反馈更延迟。dots3-note preview 主动将“考场”设于此,旨在锤炼模型在不确定性中的长期规划力、上下文稳健判断力及动态修正能力。

多项主流基准测试(benchmark)结果表明:在复杂推理与智能体任务(如WebShop、HotpotQA、ALFWorld等)中,dots3-note preview 表现可比肩甚至超越参数规模达其数倍的竞品大模型;其视觉理解能力在同等参数量级模型中尤为突出。

