OpenClaw 接入商汤 SenseNova:搭建能看图会画图的个人 AI 助手

1 阅读

商汤 SenseNova 平台简介

SenseNova 是商汤科技推出的大模型 API 服务平台,目前处于公测阶段,免费使用。每个模型每 5 小时提供 1500 次调用额度。由于额度按模型单独计算,如果你同时使用多模态对话和图像生成两个模型,5 小时内最多可调用 3000 次,平均每分钟约 10 次,对个人用户和日常办公完全够用。

平台当前主推两个模型:

  • sensenova-6.7-flash-lite:多模态对话模型,支持文字和图片输入,输出文字,上下文长度达 256K,适合图像理解和复杂推理。
  • sensenova-u1-fast:图像生成模型,专精于信息图、海报等高密度图文内容的生成。

本文重点介绍如何将这两个模型接入 OpenClaw,构建一个既能“看图说话”又能“按需作画”的个人 AI 助手。

平台地址:https://platform.sensenova.cn

环境准备与 OpenClaw 配置

获取 API Key

首先访问 SenseNova 平台注册账号,进入控制台的 API Key 管理页面,创建一个新的 API Key,并保存好:

export SENSENOVA_API_KEY="sk-your-api-key-here"

验证 API 连通性

使用 curl 命令测试 API 是否可用:

# 列出可用模型
curl -s "https://token.sensenova.cn/v1/models" \
  -H "Authorization: Bearer $SENSENOVA_API_KEY" | python3 -m json.tool

返回结果中应包含 sensenova-6.7-flash-litesensenova-u1-fast

安装并配置 OpenClaw

确保已安装 Node.js 22.16+ 或 24+,然后全局安装 OpenClaw:

npm install -g openclaw@latest
openclaw onboard --install-daemon

在交互式配置过程中,按以下参数填写:

  • Model/auth provider: Custom Provider
  • API Base URL: https://token.sensenova.cn/v1(注意是 token 子域名)
  • Authentication: 选择 Paste API key now 并输入你的 API Key
  • Endpoint compatibility: OpenAI-compatible
  • Model ID: sensenova-6.7-flash-lite
  • Endpoint ID: sensenova
  • Support image input?: Yes

配置完成后,选择重启服务使设置生效。最后通过 OpenClaw Web 界面发送一条简单消息测试连接是否成功。

图像理解:6.7 Flash-Lite 的实际表现

6.7 Flash-Lite 的图像理解能力远超一般“识图”水平。它不仅能识别物体,还能结合文化背景和生活常识进行深度解读。

例如,当输入一张灵隐寺“福鼎”的照片时,它不仅准确指出这是祈福用的铜鼎,还解释了“摸鼎=摸顶=步步登高”的民间寓意。这种将视觉信息与中国传统文化语境结合的能力,让它更像一个有经验的本地向导。

此外,它对细节的捕捉非常敏锐——能分辨人群中谁在拍照、谁在合十祈福;在复杂场景(如国宴或寺庙人流)中,也能通过衣着、姿态等微小差异判断人物身份。这种对生活场景的洞察力,使其在免费公测模型中脱颖而出。

U1 Fast:不只是画图,更是信息图专家

很多人以为 U1 只是一个普通的文生图模型,但实际上它的定位非常明确:高精度信息图生成

NEO-Unify 架构的优势

U1 采用自研的 NEO-Unify 架构,与传统“拼接式”多模态模型有本质区别:

  • 传统架构:图像先经 Visual Encoder 编码,再通过 Adapter 传给 LLM,最后由 VAE 解码成图。信息在多次转换中容易失真。
  • U1 架构:像素和文本在同一个表征空间中直接交互,共享 MoT(Mixture-of-Transformers)骨干网络,实现端到端建模,信息零损耗。

这种设计让 U1 在处理图文混排、字体渲染、布局对齐等任务时表现更稳定。

信息图生成实测

U1 Fast 经过蒸馏优化,专门针对信息图场景调优。通过 API 调用,可以生成高度结构化的海报,例如包含三栏布局、图标、标题、正文和配色规范的完整信息图。

与主流模型对比:

维度 SenseNova U1 DALL-E 3 / GPT Image Midjourney
信息图能力 ⭐⭐⭐⭐⭐ 专精,高密度排版 ⭐⭐⭐⭐ 强,文字精准 ⭐⭐ 偏艺术,排版弱
文字渲染 商业级精度 行业顶尖 容易出错
开源/私有部署 ✅ Apache 2.0 开源 ❌ 闭源 ❌ 闭源
免费额度 公测免费(每 5h / 1500 次) 付费 付费

开源模型包括 SenseNova-U1-8B-MoT-Infographic(信息图专精版)等,可在 GitHub 上获取:github.com/OpenSenseNova/SenseNova-U1

支持的图像尺寸

U1 Fast 支持 11 种固定分辨率,均为 2K 级别,默认为 2752x1536(16:9)。其他常用尺寸包括:

  • 2048x2048(1:1 正方形)
  • 1536x2752(9:16 竖版)
  • 3072x1376(21:9 超宽横幅)
  • 1344x3136(9:21 超长竖图)

Prompt 编写最佳实践

U1 对 Prompt 的结构化程度极其敏感。模糊指令如“画一张好看的 AI 海报”效果很差,而结构化 Prompt 能显著提升输出质量。

推荐结构主题 + 核心元素 + 布局逻辑 + 风格/配色

例如,为“Go 性能优化”生成信息图时,应明确:

  1. 全局视觉规则:深蓝科技风背景、白色文字、Go 蓝渐变点缀
  2. 排版硬约束:三列网格、1px 细边框、内容不溢出
  3. 逐区块内容:每列的具体标题、图标描述、技术指标

实测表明,结构化 Prompt 生成的图片布局规整、信息分层清晰、视觉风格统一,远胜随机出图。

使用官方 Skill 套件:SenseNova-Skills

商汤官方提供了 SenseNova-Skills OpenClaw 插件套件,开箱即用,覆盖四大场景:

  • 图像 & 信息图sn-infographicsn-image-base
  • PPT 生成sn-ppt-entrysn-ppt-standard
  • 数据分析sn-da-excel-workflow
  • 深度研究sn-deep-research

一键安装

# 克隆仓库
git clone https://github.com/OpenSenseNova/SenseNova-Skills.git --depth=1

# 复制到 OpenClaw 目录
mkdir -p ~/.openclaw/skills
cp -r SenseNova-Skills/skills/* ~/.openclaw/skills/

# 重启服务
openclaw gateway restart

安装后,在 ~/.openclaw/.env 中配置环境变量:

SN_BASE_URL="https://token.sensenova.cn/v1"
SN_API_KEY="sk-xxx"

配置完成后,直接在对话中说“帮我生成一张关于 Go 性能优化的信息图”,sn-infographic Skill 会自动增强 Prompt 并调用 U1 出图。

连续生图实战:创作「小兔子四季历险记」

sn-infographic Skill 的另一大优势是支持连续生图,且自动保持风格统一。

只需在 OpenClaw 中输入:

请帮我生成一个图文绘本故事,主角是一只可爱的兔子,故事讲述它经历四季变化。

系统会自动:

  1. 生成四季分镜的故事文案
  2. 为每个季节(春、夏、秋、冬)分别构造结构化 Prompt
  3. 调用 U1 Fast 生成四张风格一致的插图

最终输出的四张图片不仅准确呈现四季特征(春之复苏、夏之热烈、秋之丰收、冬之静谧),而且角色形象、画风、色彩体系高度连贯,无需手动调整。这相当于把复杂的多任务调度和风格对齐工作全部自动化了。

常见问题与避坑指南

1. 接口用错导致 404

  • 错误:将 sensenova-u1-fast 发送到 /v1/chat/completions
  • 正确:图像生成必须使用 /v1/images/generations;对话模型用 /v1/chat/completions

2. 图像尺寸不合法

U1 Fast 仅支持预设的 11 种分辨率,不能自定义。报错 field Size invalid 时,请对照官方尺寸表调整。

3. 回复内容为空

6.7 Flash-Lite 在推理模式下会消耗较多 token。若返回内容为空,建议将 max_tokens 设为 2048 以上。

4. 子域名错误

API 地址必须是 https://token.sensenova.cn/v1,不是 api.sensenova.cn。配置时务必核对。

总结

通过 OpenClaw 接入商汤 SenseNova,你可以快速搭建一个功能完整的多模态个人 AI 助手:

  • 6.7 Flash-Lite 负责图像理解和 Prompt 增强
  • U1 Fast 专注高精度信息图生成
  • SenseNova-Skills 提供开箱即用的自动化流程

U1 的核心优势在于:

  1. 信息图排版能力在开源模型中处于领先水平,尤其擅长高密度图文混排
  2. NEO-Unify 架构实现端到端建模,避免信息损耗
  3. 线上免费 + 完全开源,既可快速集成,也支持本地部署

对于需要频繁制作信息图、技术海报或图文内容的用户来说,这套组合拳提供了一个低成本、高效率的解决方案。

相关资源