Skip to content

未来是否可以把语音交互一起并入到视频交互模型中去? #26

Description

@lingyiliu016

目前的模型是基于视觉交互的,语音是以旁路的形式接入的。准确地说,是ASR(语音转文字)送入到模型中去,然后模型的输出文本,再TTS(文字转语音)。所以语音不是交互的。
迫切希望未来可以视觉交互+语音交互。就是说,视频信息、语音信息,全部汇集到一个模型中去决策、调度。
并且视觉交互如果支持多路视频流,那就更好了!

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions