图片
按 brief 出图
海报、产品图、风格重绘与标注改图。描述效果或在画面上标注,Agent 会路由到合适的图像模型。
由领先的图像、视频与音频模型驱动
为什么选这个 Agent?
需要时切换模式。生成静图、渲染成片,或念出一段旁白——每一次结果都留在同一条对话里。
图片
海报、产品图、风格重绘与标注改图。描述效果或在画面上标注,Agent 会路由到合适的图像模型。
视频
把文字变成镜头运动,或把照片当作首帧驱动动画。对比多条 take,无需离开对话。
音频
多语种语音、旁白或一段配乐。选好音色与语速,反复打磨直到满意。
要海报、5 秒推进镜头,还是一段沉稳旁白都可以。对话中途切换图 / 视频 / 音频模式——同一钱包、同一条会话。
图片、成片与音频不会互相覆盖。可以对比版本、回到某一条,或从任意结果继续延展。
使用方式
不用学时间线。说清楚想要什么,让 Agent 生成,再在同一对话里打磨。
选择图片、视频或音频。写提示词,有参考就附上,然后发送。
它会为任务挑选模型与参数——静图、成片、语音或音乐——并返回可预览的结果。
再要一个角度、更长镜头,或换一种音色。每个版本都留在侧栏方便对比。
常见问题
同一对话里可生成图片、视频片段与音频(语音或音乐)。随时切换图片 / 视频 / 音频模式:生成或编辑静图、从提示词或照片渲染成片,或产出旁白/配乐。全过程都在同一条会话里。
通常几分钟。图片和语音相对更快;视频模型排队与渲染更久——5 秒片子常见 1–3 分钟。等待期间你可以继续聊。
单次渲染通常 5 秒或 10 秒,取决于模型。想要更长序列,就一个镜头一个镜头生成再剪到一起——Agent 可以帮你规划分镜。
图片模型(如 GPT Image、Nano Banana)、视频模型(MiniMax H3、Seedance)以及音频模型(ElevenLabs、Gemini TTS、Suno 等)。可按条选择,也可交给 Agent 决定。
可以。上传静图并描述什么该动即可出视频;切到音频模式还能为场景配旁白或配乐。
可以。所有付费套餐都包含完整商用授权。如果要大规模发布,建议同时确认你所用模型自身的条款。
图片、视频与音频共用同一积分钱包。价格因模型与选项(时长、分辨率、音色等)而异。发送前输入框会显示估价,失败会自动退回积分。
你上传的素材和生成的作品在传输和存储过程中都是加密的。我们不会用你的内容做训练。你可以随时永久删除任意对话或文件。
需要——账号用来保存你的作品、历史版本和积分余额。用邮箱或 Google 注册大约十秒钟。
在控制台里提交工单,或者给我们发邮件——每一条我们都会看,修复每周上线。