YOUR VOICE. WHAT’S NEXT?
下一幕,由你开口。
手机开播后按住底部说话按钮、松开发送;电脑可点击麦克风连续说话 · 首条指令开播并计费
只测语音与 AI 整理 · 不生成视频 ↗
把图片拖入画面,然后用语音或文字发出第一条需求。
设置在开播时生效。直播过程中,直接用语音或文字改变方向。
直播会产生 fal 费用,每场最低按 60 秒 runtime 计费,以 fal 账单为准。语音开启后会产生识别费用,每次最长 3 分钟;直播结束或页面进入后台时关闭麦克风,不自动重连。建议戴耳机,减少视频声音被识别为指令。
白字是实时识别,不代表视频已改变。停顿后 DeepSeek V4 Flash 判断意思是否完整,整理口头语、重复和改口后再发送;没说完就继续等。你继续讲话时,旧整理结果作废,合并新内容重新判断。生成侧采用后仍需经过生成和播放缓冲。整理失败时保留草稿,不发送原始碎句。识别和 AI 整理均产生服务商费用。录制捕获浏览器实际收到的音视频,格式为 WebM / MP4。