共计 1533 个字符,预计需要花费 4 分钟才能阅读完成。
中国最强编程模型来了! 阿里 Qwen3.6-Plus 性能直逼 Claude, 国产大模型杀入决赛圈
中国最强编程模型来了
阿里通义千问团队近日悄然发布新一代基座大模型 Qwen3.6-Plus,凭借在编程和智能体能力上的大幅跃升, 迅速成为业界焦点。这款模型不仅刷新了国产大模型在代码生成与任务执行上的天花板, 更在多项真实世界评测中展现出直逼国际顶尖对手的实力。
📌 性能突破: 直逼 Claude, 以小胜大
相较于上一代 Qwen3.5,此次发布的 Qwen3.6-Plus 在编程、智能体及工具调用能力上实现了全面进化。根据官方披露及早期实测反馈, 模型在多个权威基准测试中表现抢眼:
- 编程任务测试: 在 SWE-bench、Terminal-Bench2、NL2Repo 等涵盖智能体编程与真实世界任务的评测中,Qwen3.6-Plus 性能已接近 Claude Opus 4.5, 部分指标甚至表现更优。
- 参数效率: 模型在多项任务中超越了参数规模为其 2 至 3 倍的其他主流模型, 展现出“以小胜大”的高效能力。
🔍 核心能力实测:Vibe Coding 与多模态理解
💡 Vibe Coding: 一句话生成完整应用
在实测中,仅用“帮我生成一个有科技感的 AI 日历网站”这样一句提示, 模型在约两分钟内便输出了一个完成度极高的网页。该网站具备月历视图、日期标注 AI 事件、点击查看详情及跳转源链接等完整功能, 视觉设计简洁且富有科技感。
📊 多模态理解: 从解析到复刻
除了代码生成,Qwen3.6-Plus 在多模态理解与执行方面也表现突出。例如, 当输入一段 AI 资讯视频时, 模型不仅能进行逐秒的脚本拆解(从视觉、内容、目的多维度分析), 还能根据内容创作出结构清晰、适合社交平台传播的爆款文案。
更具挑战的是“根据图片复刻网页”的任务。当提供一张旅游规划页面的截图时, 模型在几乎没有文字指令的情况下, 准确理解了图片中的功能与布局, 并生成了一个视觉效果更佳、内容更充实的在线网页, 展现了强大的视觉推理与工程实现能力。
🚀 进阶编程: 代码重构与自主开发
对于更硬核的开发场景,Qwen3.6-Plus 同样游刃有余 。模型支持通过命令行工具(如 CC) 直接调用 API, 实现自动化前端开发。例如, 仅输入“根据开源仓库生成 landing page”的指令, 模型便能读取项目介绍, 自主规划页面结构, 并输出完整的 HTML+Tailwind CSS 代码。
在代码维护与优化方面,模型也体现出高度的实用性。当向模型提交一段存在问题的老旧代码并询问优化建议时,Qwen3.6-Plus 会先清晰罗列问题清单, 并在获得确认后才实施修改, 展现出谨慎且可控的协作风格。修改完成后, 它还能自动生成优化总结, 甚至建议后续的依赖安装与测试脚本编写步骤, 大幅提升了代码重构的效率。
🧭 行业影响: 降低门槛, 激活创新
- 生态竞争: 模型性能直逼 Claude 等国际顶尖产品, 并在特定场景实现超越, 表明国产大模型在关键应用领域已具备与国际巨头同台竞技的实力。其全面开放 API 并接入阿里云百炼、千问 APP 等平台, 也将加速 AI 编程工具在国内开发者生态中的普及。
📌 总结与展望
总体而言,阿里 Qwen3.6-Plus 的推出是一次有力的技术宣告。它不仅在多项硬核评测中证明了国产大模型在编程与智能体能力上已达到国际一线水准, 更重要的是, 通过极简的交互方式和强大的生成能力, 让 AI 辅助编程变得前所未有的直观和易用。
目前, 该模型已第一时间在阿里云百炼平台上线,API 服务全面开放, 并在悟空、千问 APP 等阿里系 AI 应用中同步集成。随着此类高性能、低门槛的编程模型日益普及,AI 赋能软件开发的进程必将进一步加速, 激发更广泛的创新活力。国产大模型在“决赛圈”的角逐, 已然拉开了新的序幕。