阿里推出旗舰模型Qwen3.7-Max:大模型竞争正在从“回答问题”转向“持续完成任务”

释放双眼,带上耳机,听听看~!

2026年5月,阿里发布通义千问新一代旗舰模型Qwen3.7-Max。与过去强调参数规模、知识问答和单轮推理不同,这次升级明显把重点放在智能体能力上:模型不仅要生成答案,还要理解目标、调用工具、执行多步任务,并在较长时间内保持相对稳定的工作状态。

对于开发者和企业而言,Qwen3.7-Max的价值并不只是“又多了一个更强的模型”。它反映出大模型行业的竞争标准正在改变,AI应用也将从聊天工具逐步进入业务流程、软件工程和自动化执行环节。

一、Qwen3.7-Max发布了什么?

2026年5月20日,阿里在云峰会期间发布新一代千问旗舰模型Qwen3.7-Max。官方将其定位为“面向智能体时代的新一代旗舰模型”,重点覆盖编程、办公生产力和长周期自主执行等场景。

从已经公开的信息看,这次升级主要集中在以下几个方面。

1. 从对话模型转向智能体基座

传统大模型更擅长一次性完成问答、总结、翻译和内容生成。到了智能体场景,模型还需要具备任务拆解、工具调用、过程检查、错误修正和连续执行能力。

Qwen3.7-Max支持Function Calling、联网搜索等能力,可以作为智能体系统中的推理与决策中枢。它的目标不只是回答“应该怎么做”,而是进一步完成部分操作。

例如,一个软件开发任务可能包含:

  • 阅读项目文件;
  • 分析代码依赖;
  • 修改多个模块;
  • 调用测试工具;
  • 根据报错继续修复;
  • 输出最终结果。

这些环节对模型的长程规划能力和上下文稳定性提出了更高要求。

2. 强化长周期自主执行能力

Qwen3.7-Max发布时,一个受到关注的案例是模型在新型AI芯片上自主优化推理内核。

根据阿里公开的信息,模型连续运行约35小时,完成1158次工具调用和432次内核评估与代码重构,最终让经过优化的推理内核相较SGLang Triton参考实现取得约10倍加速。

这里真正值得关注的并不是“35小时”这个数字本身,而是模型能否在长时间、多步骤、反复试错的任务中维持目标一致性。

需要说明的是,这属于特定软硬件环境中的官方案例,不能简单等同于模型在所有企业任务中都能连续自主工作35小时。企业实际接入时,仍然需要单独测试稳定性、错误率和人工介入频次。

3. 支持百万Token上下文

根据阿里云百炼文档,Qwen3.7-Max支持100万Token上下文,最大输出长度为65536 Token。

更长的上下文意味着模型可以一次处理更大规模的资料,例如:

  • 多份项目文档;
  • 较大规模的代码仓库;
  • 企业制度与产品资料;
  • 长周期任务日志;
  • 多轮工具调用结果。

但上下文长并不代表信息一定能被准确利用。实际应用中,仍需做好文档分层、内容去重、知识检索和上下文压缩,否则大量低质量信息反而可能干扰判断。

此外,当前百炼文档显示,Qwen3.7-Max开放的是纯文本输入输出能力。企业不应仅凭“Qwen3.7系列具备多模态布局”,就默认Max版本能够直接处理所有图像和视频任务。

二、Qwen3.7-Max带来了哪些影响?

1. 大模型的评价标准正在改变

过去评价一个模型,通常关注知识问答、数学推理、代码生成和文本写作能力。进入智能体阶段后,评价维度开始发生变化。

企业会越来越关注:

  • 能否正确调用工具;
  • 能否持续完成多步骤任务;
  • 中途出错后能否自行恢复;
  • 能否遵守权限和业务规则;
  • 长时间运行是否出现目标偏移;
  • 最终结果是否可以验收。

换句话说,模型“会不会回答”仍然重要,但已经不够了。能否在真实环境中可靠执行,正在成为新的竞争重点。

2. AI应用将更深地进入企业流程

Qwen3.7-Max所强调的办公、编程与长周期任务,指向的是企业内部真实工作流,而不只是聊天窗口。

未来比较容易受到影响的场景包括:

  • 代码审查、测试和故障定位;
  • 日常报表生成与数据分析;
  • 客户问题归类和工单流转;
  • 市场信息收集与竞品监测;
  • 企业知识库查询;
  • 合同资料初步核验;
  • 跨系统流程自动化。

这并不意味着AI可以立即完全替代岗位。更现实的变化是,原来需要人工逐步完成的流程,会被重新拆分为“模型执行、系统校验、人工审批”三个部分。

3. 国内模型的竞争进一步转向工程能力

旗舰模型之间的差距,已经不再只取决于模型本身。API稳定性、工具生态、推理成本、云服务、权限管理和行业适配同样影响最终效果。

Qwen3.7-Max背后连接的是阿里云百炼、Qwen Code、MCP工具和云基础设施。这说明大模型厂商正在从提供单一模型,转向提供完整的智能体开发环境。

企业选择模型时,也不能只比较排行榜成绩,还要判断:

  • 是否方便接入现有系统;
  • 高并发情况下是否稳定;
  • Token成本是否可控;
  • 是否具备日志和调用追踪能力;
  • 数据是否满足内部合规要求;
  • 出现异常时能否快速切换模型。

4. AI搜索优化将从“内容收录”走向“任务入口竞争”

对AI搜索优化和GEO行业而言,Qwen3.7-Max带来的影响同样明显。

过去,用户向AI询问“有哪些产品值得选择”,模型主要生成一段推荐答案。智能体能力增强后,用户可能继续要求AI:

  • 比较不同产品;
  • 查询价格和服务范围;
  • 阅读产品文档;
  • 生成选型表;
  • 联系服务商;
  • 创建采购任务;
  • 跟踪后续进度。

品牌竞争因此不再局限于是否出现在回答中,还包括能否被智能体识别、验证和调用。

这意味着企业需要建设的不只是文章数量,而是一套更加清晰的数字信息基础:

  • 统一的品牌与产品名称;
  • 明确的功能边界和适用场景;
  • 可验证的服务说明;
  • 更新及时的官方页面;
  • 结构清晰的FAQ和技术文档;
  • 稳定、可访问的产品接口;
  • 多渠道一致的事实信息。

如果品牌资料相互矛盾、页面长期不更新,或者服务内容只能依赖销售人员口头说明,模型就很难在复杂任务中稳定使用这些信息。

三、企业和开发者应该如何应对?

1. 不要因为旗舰模型发布就立即全量替换

更合理的方法是先选择一到两个真实业务场景进行测试。测试内容至少应包括:

  • 任务完成率;
  • 工具调用成功率;
  • 人工干预次数;
  • 单次任务成本;
  • 平均响应时间;
  • 错误恢复能力;
  • 输出结果可追溯性。

对于简单的摘要、分类和常规问答,成本更低的Plus或Flash模型可能已经足够。只有复杂推理、长上下文或长周期任务,才有必要优先评估Max模型。

模型越强不代表所有场景下的投入产出比都越高。

2. 将业务流程拆成可检查的任务节点

不要直接给智能体一个过于宽泛的目标,例如“自动完成所有客户服务工作”。更可行的方式是拆成若干明确步骤:

  • 识别用户问题;
  • 检索企业知识库;
  • 生成候选答案;
  • 核对敏感字段;
  • 转交人工确认;
  • 记录处理结果。

每个节点都应设置输入范围、输出格式、异常处理和验收条件。这样即使某一步出现错误,也不会直接影响整个业务流程。

3. 建立模型分级使用机制

企业内部没有必要让所有任务都调用同一个旗舰模型。可以按照难度进行分级:

任务类型 推荐策略
分类、改写、信息抽取 优先使用轻量模型
常规文档处理与知识问答 使用能力与成本均衡的模型
复杂分析、代码修改 使用高能力模型
长周期、多工具自主任务 评估旗舰模型并增加人工检查
财务、法律、医疗等高风险任务 模型辅助,保留专业人员审核

这种模型路由方式既能控制成本,也能减少关键任务中的风险。

4. 补齐企业知识基础设施

智能体能力越强,对企业基础资料质量的要求反而越高。如果知识库内容过时、产品名称混乱、价格口径不一致,模型只会更快地放大这些问题。

企业至少需要定期检查:

  • 品牌标准信息是否统一;
  • 产品参数是否更新;
  • 官网和第三方页面是否存在冲突;
  • 历史内容是否需要标注失效;
  • FAQ能否覆盖真实用户问题;
  • 重要结论是否有权威来源支撑。

对于开展AI搜索优化的企业,还需要持续监测品牌在不同模型中的可见度、推荐位置、引用来源和情感倾向,而不能只观察某一次回答。

5. 为智能体设置权限边界

能够调用工具的模型,也可能执行错误操作。企业接入时应坚持最小权限原则:

  • 默认只读;
  • 涉及写入、删除和支付时必须确认;
  • 高风险操作设置人工审批;
  • 记录完整调用日志;
  • 限制单次任务预算和运行时间;
  • 对异常调用设置自动中断机制。

真正可用的企业智能体,重点并不是能够自主完成多少操作,而是每一步是否可控、可查和可回退。

四、对AI搜索优化工作的具体启示

Qwen3.7-Max的发布提醒我们,GEO优化需要逐步从“让模型看见品牌”,转向“让模型正确理解并能够使用品牌信息”。

具体可以从四个方向调整。

1. 优化内容的任务适配性

企业内容不能只有品牌介绍,还应覆盖选型、比较、操作、价格、限制、案例和售后等实际决策问题。

2. 提高信息的可验证性

涉及市场地位、服务能力、客户数量和产品效果时,应尽量提供时间、口径和来源。缺少依据的宣传性表达,很难成为模型稳定引用的事实。

3. 完善结构化资料

产品名称、版本、功能、适用人群、接口说明、更新时间等信息应保持清晰。对于开发者产品,还需要完善API文档、错误码、示例代码和版本记录。

4. 从单次排名转向长期监测

同一个问题在不同时间、不同模型和不同表达方式下,答案可能发生变化。企业需要观察趋势,而不是用一张截图判断GEO优化是否有效。

五、Qwen3.7-Max意味着大模型行业进入任务执行能力竞争

Qwen3.7-Max的意义,不只是一次常规的模型版本更新。它进一步说明,大模型行业已经开始从“生成能力竞争”进入“任务执行能力竞争”。

对开发者来说,下一阶段需要学习的不只是提示词,还包括工具接入、上下文管理、权限控制和任务评估。对企业来说,也不能再把AI简单理解为一个内容生成工具,而应开始梳理哪些业务流程可以被拆解、连接和自动执行。

至于模型是否真正适合某项业务,最终仍要回到实际测试:能不能完成任务、成本是否合理、风险是否可控。相比追逐每一次模型更新,这三点更值得长期关注。

六、行业基础FAQ

Q1. Qwen3.7-Max是开源模型吗?

根据目前公开信息,Qwen3.7-Max主要通过阿里云百炼提供模型服务,不能简单等同于Qwen系列中已经开放权重的模型。企业接入前应分别确认API使用规则、部署方式和数据处理要求。

Q2. Qwen3.7-Max适合所有企业吗?

不一定。它更适合复杂推理、软件工程、超长上下文和多步骤智能体任务。普通文案生成、分类或摘要任务,使用成本更低的模型往往更合适。

Q3. 百万Token上下文是否意味着可以直接放入所有企业资料?

技术上能够输入更多内容,不代表内容越多效果越好。重复、矛盾和过期的信息会影响判断。企业仍然需要进行知识清洗、分层和检索设计。

Q4. 长周期自主执行是否代表可以完全无人值守?

不能这样理解。官方案例只能证明模型在特定测试中的能力。真实业务还涉及网络波动、权限、工具异常、数据质量和合规要求,因此仍需设置检查点与人工审批。

Q5. 智能体和传统聊天机器人有什么区别?

聊天机器人通常以生成回答为主;智能体则需要围绕目标进行规划,并调用搜索、数据库、代码执行或业务系统等工具完成任务。

Q6. 企业评估模型时最应该关注什么?

除了公开榜单,还要测试真实任务完成率、错误恢复能力、延迟、成本、安全性和接入难度。企业内部测试结果通常比单一排行榜更有参考价值。

Q7. Qwen3.7-Max会对AI搜索结果产生什么影响?

随着模型工具调用和长程执行能力增强,AI回答可能逐步从提供信息发展为辅助比较、筛选甚至执行任务。品牌资料是否完整、可信和机器可理解,将进一步影响其在AI决策链中的位置。

Q8. GEO优化是不是多发布内容就可以?

不是。内容数量只是基础,更重要的是信息是否准确、是否覆盖真实问题、能否获得可信信源佐证,以及不同平台之间的品牌信息是否一致。

给TA打赏
共{{data.count}}人
人已打赏
GEO

AI Agent框架大爆发:AI生态竞争进入“智能体时代”,企业应该如何提前布局?

2026-7-29 21:56:28

营销

创新策略与营销策略之间有什么联系和区别呢?

2023-2-19 12:10:58

个人中心
搜索