阿里最新发布,千问AI平台Token Plan实测来了!
TL;DR · AI 摘要
阿里云推出千问AI平台,支持Agent自主控制模型,实测展示15秒短片生成全流程。
核心要点
- 千问AI平台整合Qwen/Kimi/DeepSeek等100+模型,单API Key调用
- 开源两个Skill实现Agent自主模型切换,测试案例用3个模型完成15秒短片
- 平台提供免费额度,包含文本/图像/视频/语音四类模型
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 千问AI平台
- Agent自主控制
- 模型切换
- Skill开源
- 模型聚合
- 100+模型
- 多模态支持
- 实测案例
- 15秒短片
- 3模型协同
金句 / Highlights
值得收藏与分享的关键句。
过去模型服务平台是给人用的,以后是给Agent用的
15秒短片生成包含3幕分镜、3张关键帧、3段图生视频、3句旁白
Skill包含9个子技能,覆盖文本/图像/视频/语音等全模态
Datawhale干货
**作者:筱可,Datawhale成员**
阿里最新发布了千问AI平台,把 Qwen、Kimi、DeepSeek 等一百多个系列的模型聚到一个平台上,一个 API Key 就能调。注册还带一批免费额度,不少顶级模型可以直接免费试。
发布同时还开源了两个官方 Skill,让 AI Agent 终于可以自主控制模型了。
我们拿其中的qianwen-ai完整跑了一轮测试:
给它一段小水豚的故事,让它自己做成短片。最后完成了一条 15 秒、带配音的成片:3 幕分镜、3 张关键帧、3 段图生视频、3 句旁白配音,横跨文本、图像、视频、语音四类模型、五个子技能。
全程只靠Agent 自己操控,自动切换了三个模型:wan2.6-i2v-flash、qwen3-tts-flash、wan2.6-t2i。下面,我们把整个过程和实测数据完整分享出来。
一、过去的模型服务平台是给人用的,以后是给 Agent 用的
一个模型干不完所有事。
不同模型擅长的方向不一样,Agent 跑一个任务,中途换好几个模型很正常。任务本身也有轻有重,简单的步骤用便宜的模型就够,能省下不少成本。
这些判断以前都靠人:哪一步该换模型、换成哪个、便宜的够不够用。可 Agent 一跑就是几千次调用、很久都不停,人没法一步步盯着。
模型平台也差不多卡在这一步。早期是单家模型的 API,换个模型就得改代码。后来有了聚合网关,一个 Key 能调很多家,比价和切换方便了,但挑哪个、什么时候挑,还是人在动手。千问AI 平台想往前走一步,把选模型、调用、部署做成官方开源的 Skill,交给 Agent 自己来。
阿里云资深副总裁刘伟光在发布时说:过去的模型服务平台是给人用的,以后用模型的主力是 Agent,千问AI 平台要给开发者和 Agent 都提供更顺手的体验。
接下来,我们通过一个完整的测试让 Agent 自主控制模型。
二、实测「Agent 自主控制模型」的全流程
第一步:进入控制台
打开https://platform.qianwenai.com注册登录,进入控制台。
第二步:获取 API Key
进控制台打开 API Keys 页https://platform.qianwenai.com/home/api-keys
OpenAI 兼容:https://dashscope.aliyuncs.com/compatible-mode/v1Anthropic 兼容:https://dashscope.aliyuncs.com/apps/anthropic
右上角点创建 API Key,填个描述名称,点生成。
生成后在列表里点复制按钮,Key 就拿到了。提醒一句,Key 只完整显示一次,记得当场存好。
第三步:安装 qianwen-ai skill
有了 Key,再把官方 skill 装上,Agent 就可以使用千问AI 平台自主控制模型了。
装qianwen-ai是一条命令的事,走标准的 Agent Skills 分发机制,只需要 Node.js 18 以上:
npx skills add QianWen-AI/qianwen-ai 跑起来会自动克隆仓库、列出技能,全选确认就装好了。
这里有个实测才发现的细节:它装出来是 9 个子技能,覆盖文本、图像、视频、语音、视觉理解、模型推荐、认证、用量查询、版本更新。官方 README 当时的清单只列了 8 个,漏了一个版本更新检查,以实际装出来的为准。
装好后,负责认证的qianwen-ops-auth子技能会引导你把上面拿到的 Key 配好。
到这一步,Key 拿到了、skill 装上了,可以开始使唤 Agent 了。
第四步:测试 Agent 自主选择模型
我们让它画一张千问的吉祥物:
你来让他帮我生成一个图片,就是千问的专属吉祥物,你可以联网搜索一下看看,其实是一只水豚,你试试生产他吧 Agent 先联网确认了这个形象,再自己主动调用了qianwen-image-generation的文生图模型 wan2.6-t2i 出图,得到一只圆滚滚、呆萌治愈的卡通水豚,扁平插画风、干净浅背景,拿来当品牌吉祥物。
一句话需求发出去,Agent 自己选模型、调用、把结果取回来,不用人去别的页面挑模型、配参数。
选型这一步由 9 个子技能里的qianwen-model-selector负责。它不干活,只做判断:画图、做视频、配音这些执行子技能动手前,先来问它这一步该用哪个模型,拿到答案再去调。
它的判断分三层,逐层缩小范围。第一层看需求类型,是画图、生成视频还是文字转语音,先框出能干这活的一批模型。第二层看使用场景,临时试一下就挑质量高的,要上量生产就挑更快更便宜的。第三层比单价,在剩下的候选里选成本最合适的那个。三层走完模型就定了,这次测试里它定的是 wan2.6-t2i。
这套选型是加分项,不是必需项。不装它也能跑,每个执行子技能都自带一个默认模型,区别只是少了比价和择优这一层,不会因为缺了这一环整条链就断掉。对刚上手的人来说,装上就直接用得上,选型的活它替你做了。
第五步:测试 Agent 自主编排模型
单点调用跑通后,我们又测了编排,让 Agent 把多个子技能连起来做一件完整的事。
我们给它一个故事:小水豚想去河边游泳,先在家跟妈妈说,然后独自出门在傍晚迷了路,妈妈找到他带回家;第二天,妈妈陪着他一起去河边游泳。
从这段话到成片,只需要一次输入,剩下的五个子技能由 Agent 自己一环接一环调完:
- qianwen-text 把故事写成 3 幕分镜,每幕一句画面描述加一句旁白。
qianwen-image-generation按分镜生成 3 张关键帧图,1280×720。
qianwen-video-generation做图生视频,把每张关键帧驱动成 5 秒的动态镜头。
qianwen-audio-tts把 3 句旁白配成语音。
- 最后用 ffmpeg 合成一条 15 秒、带配音的完整短片。
我们没告诉它要分 3 幕,也没说每幕多长、哪张图配哪句旁白,这些是它拆出来的。分镜文字进画图模型得到关键帧,关键帧进视频模型驱动成镜头,旁白文字进配音模型得到语音,最后所有片段和音轨一起交给 ffmpeg。
比拆步骤更麻烦的是这几步节奏不一样。文本和配音基本是同步返回,图生视频是异步任务,提交完要排队、轮询、算完再取结果,每段 5 秒的镜头大约 3 到 4 分钟。三段什么时候都跑完、素材什么时候齐了才能进合成,这些都是Agent 自己在判断并执行。
整条链跑了十几分钟,中间换了四类模态、三个模型。要是这些模型分散在几家,每换一次就多一道手续:另一个 Key、另一套 SDK、另一份文档。这次因为是一个 Key、一个 skill 入口,所以环境没另配,格式也没手工转,选模型的活qianwen-model-selector就直接完成了。
三、实测下来的三个感受
一条完整的编排链,能在一个平台完成并看到花费
含 3 段图生视频的那条链,加上前面单点调模型的测试,一共 ¥5.35。Agent 调了什么,在千问AI 平台的后台记得清楚。用量日志里逐条列着请求来源是 Skills,模型是 wan2.6-t2i、wan2.6-i2v-flash、qwen3-tts-flash,时长、延迟、状态都在。
计费这块 Token Plan 也上了平台,按平台能力算,不按单个模型分。一份 Credits 全平台通用,调 Qwen 还是换 DeepSeek 都从这份里扣,不用再给每个模型单独买套餐,使用下来感觉很方便。
换模型只改一个模型名,工程都不需要动
这次测试图快,在形象一致性和画质都有短板,用的是 wan2.6-i2v-flash,在细节、时长、分辨率上都做了取舍,这是为控制体验成本主动选的,不代表平台视频生成的上限。
想要好效果,跟 Agent 说一句换成 wan2.7-i2v 就行,1080P、首尾帧控制、更长时长都有,编排链一个字都不用改,也不用重写脚本、换 SDK。这种一句话切换,也是把全套模型收进同一个平台后才有的便利。
不过整条链全用旗舰档也没必要,一个任务里的活本来就有轻有重。改改分镜文字、校验一下格式,小模型足够;真正吃效果的是出关键帧和图生视频这两步,值得用好的。把这个分法提前写成规则交给 Agent,它每一步自己对着选,简单的走便宜档,复杂的走旗舰档,钱花在该花的地方,复杂任务里就可以更加省钱。
模型都在一个平台,所以长程任务能一口气跑完
实测中的编排链能这么跑,是因为模型都在千问 AI 平台上。一百多个系列,开源模型和 Qwen 的闭源商业模型都有,一个 Key、一个兼容协议就能在它们之间切,不用一家家注册账号、存好几个 Key,也不用为每个模型单独搭一套环境。换模型对 Agent 来说就是换个名字。所以它才能从一段故事一路走到成片,中间没停下来问我什么。
四、「Agent 自主控制模型」的两个核心 Skill
千问 AI 平台能让 Agent 自主控制模型,核心是把平台自己的运营动作也开放给 Agent,上线了两个 好用的官方 Skill,正好是一进一出。
先说 qianwen-ai,它 让 Agent 会用平台上的模型,实测使用的都是它。
装上之后,选哪个模型、怎么调用、认证和 API Key 怎么管、这个月花了多少、免费额度还剩多少,都能交给 Agent。你说一句「挑个便宜点 的模型把这批文档翻了」,或者「查下某个模型的免费额度 还剩多少」,它自己就去平台里办。
而 qianwenai-deploy 是出口,让 Agent 把做出来的应用部署上云。项目写完要上线,在项目目录里说一句「帮我把这个项目部署上云」,它自己分析项目、选方案、给报价,确认后才动手;给它一个 Git 链接也行,会自己克隆、构建。
改完说「更新项目」就热更新;不想留着,再说一句删掉,资源全部释放、停止计费,整个过程不用进入控制台。
写在最后:从人调模型,到 Agent 调模型
模型每隔几周换一次榜首,盯着谁最强意义不大。Agent 干一个任务往往要连着调好几个模型,费时间的是在几家之间来回切、重复配置。千问AI 平台把重心放在聚合本身,Qwen、Kimi、DeepSeek 等一百多个系列都接进来,一个 Key 全调得动,选模型、调用、部署还能交给官方 Skill,让 Agent 自己完成。
从人登录控制台操作平台,到给 Agent 下一句指令、让它替你把模型用起来,这是这一两年正在发生的变化。我们这轮从生图到做出一条短片的实测,跑的就是这个方向,看看模型平台怎么真正「为 Agent 而生」。
想体验的话就两步:去 platform.qianwenai.com 注册,把 API Key 配进你常用的编码工具,用注册送的额度先跑跑看。觉得顺手、要高频用,再买 Token Plan 也不迟。
官网:https://www.qianwenai.com/控制台:https://platform.qianwenai.com
****
一起“点**赞”三连↓**