openJiuwen发布Skill-Omni:让Agent技能从纯文本走向多模态经验库

97次阅读
没有评论

共计 1261 个字符,预计需要花费 4 分钟才能阅读完成。

「 观察视角 」
围绕事件本身、节奏变化与潜在影响展开。

Agent 的“技能说明书”正在从文字版升级为图文版。openJiuwen 社区近日发布多模态 Skill 范式 Skill-Omni, 试图解决传统 Skill 只依赖文本、难以承载视觉经验的问题。

📌 纯文本 Skill 遇到视觉任务瓶颈

在 Agent 应用中,Skill 的作用是把可复用的任务经验沉淀下来 , 让智能体在处理相似任务时不必从零开始。但现阶段大量 Skill 仍以 Markdown 或纯文本为主, 适合描述代码生成、文档处理等任务, 却很难准确表达“看了才明白”的信息。

例如图片修复中,“让主体更突出、背景更柔和”并不能明确告诉 Agent 主体位置、调整幅度和最终效果 ;GUI 自动化中,“点击设置并进入高级选项”也可能因图标、菜单层级、滚动位置不同而产生误判。

观察来看, 多模态 Skill 的价值不只是“给文档加图片”, 而是把视觉状态、前后对比和操作节点纳入 Agent 决策依据。

🔍 Skill-Omni 如何生成多模态经验

据介绍,Skill-Omni 已在 JiuwenSwarm 中以 skill-omni-creation 形式提供。 它更像一个用于“生成 Skill 的 Skill”: 用户提供网页链接或 B 站视频链接后 , 系统会提取其中的关键截图、界面状态、关键帧和操作路径, 并整理为 Agent 可读取的多模态 Skill。

目前其主要入口包括两类:

  • 网页转 Skill: 解析图文教程、技术博客, 过滤广告图、装饰图, 保留正文截图、步骤图和前后对比图。
  • 视频转 Skill: 从教程视频中筛选关键帧, 识别操作节点, 将时间轴上的变化整理为可复用经验。

这意味着, 过去面向人类阅读或观看的内容 , 可以被转换为 Agent 执行任务时可调用的经验资产。

💡 按需读取, 避免图片撑爆上下文

运行时, 系统会先检测用户提供的 API 是否支持多模态输入; 当调用包含图片链接的 Skill 时 , 再通过提示引导 Agent 在需要时读取相关图片。这样既保留视觉证据, 又降低上下文负担。

以欠曝光照片修复为例,Agent 不仅能读取“提升暗部亮度”的文字步骤 , 还能参考 Skill 中保存的修复前后对比图, 判断暗部细节、高光控制和色彩自然度是否接近预期。

📊 更适合哪些场景

  • 图像编辑、设计、修复等需要视觉参考的任务;
  • 后台配置、桌面软件操作、复杂表单等 GUI 自动化任务;
  • 将软件教程、产品演示视频沉淀为可复用操作经验;
  • 把企业 SOP 中的截图、录屏和流程图升级为 Agent 知识资产。

影响分析: 如果这类能力进一步成熟 , 企业知识库可能不再只是文档仓库, 而会演变成包含截图、关键帧、界面状态的多模态经验库。对 Agent 平台来说, 这有助于提升任务复现能力, 也可能降低复杂流程自动化的配置门槛。

🚀 从说明书到经验层

官方还提到, 后续将探索面向 Physical AI 的 Physical Skill, 例如用物体抓取热力图沉淀物理交互经验。就目前而言,Skill-Omni 的发布至少释放了一个清晰信号: 随着 Agent 开始看屏幕、操作软件和复现教程,Skill 也需要从文本走向多模态。

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0