Grok视频生成支持文字图片语音输入
xAI 对 Grok Imagine 视频 1.5 做了扩展,现在除了原有路径,还能用文字、图片和语音作为输入来生成视频。也就是说,同一套视频生成能力,入口不再绑死在单一模态上,提示词、参考图和语音指令可以一起参与创作流程。
对已经在用 Grok 做图文或短视频草稿的人来说,多模态输入意味着少来回切换工具:有一段口播想法可以直接说,有一张参考构图可以直接丢进去,再用文字补节奏和镜头要求。开发者和做内容实验的人,也更容易把“先说清楚意图、再出片”串成一条链路,而不是先把语音转成文字、再把文字喂给另一个模型。
这次公开信息主要落在输入侧扩展,并没有额外给出具体可用范围、计费变化或上线节奏。是否人人能立刻用上、画质和时长有没有同步调整,材料里都还没写明。眼下更值得对照的是:自己现有工作流里,哪一步还在靠人工中转文字、图片和语音,这条扩展有没有可能把那几步压掉。