AI 玩具与机器人解决方案
将 AI 对讲、实时音视频、视觉理解与工具调用接入玩具和机器人。让设备不只会播放预设内容,而是能够自然交流、感知现场,并根据用户意图作出回应。
能自然交流
实时听懂用户、持续回应,并支持在对话中随时打断。
能理解现场
结合声音、图片和视频信息,理解设备面前的人、物体与环境。
能执行任务
通过设备能力和外部工具,让 AI 控制动作、调用服务并完成定制任务。
AI 对讲,改变的不只是交互方式
让每一次回应,都更像一个真实的角色
自然对话与实时打断
用户可以连续交流,也可以在 AI 回复过程中随时插话。对话不必等待固定流程,更接近日常交流。
AI 情绪输出
AI 在生成回答的同时,可以输出开心、好奇、安慰、惊讶等情绪信息,让设备以更符合语境的方式回应。
声纹锁定
在多人说话或环境嘈杂时,设备可以锁定主要说话人的声音,持续关注他正在说什么,减少其他声音对对话的干扰。
实时字幕反馈
用户说话和 AI 回复的内容可以实时返回为字幕,让带屏幕的玩具、桌面机器人和客户端同步显示对话。
自定义角色与知识
根据产品定位配置角色性格、声音、知识内容和回应方式,让陪伴玩具、教育机器人和桌面设备拥有不同的交互体验。
多模型灵活接入
根据语言地区、成本、响应速度和业务需求,选择适合产品的大模型与语音服务。
不只理解用户说了什么
也理解设备看到了什么
实时音视频传输
将设备的麦克风和摄像头实时连接至 AI,为语音对话、视觉理解和设备控制提供连续的现场信息。
音视频能力是 AI 对讲的感知基础:
声音让 AI 听见用户
视频让 AI 看见环境
实时传输让 AI 根据正在发生的事情回应
多模态场景理解
AI 可以同时理解用户语言和设备画面,让回答不再只依赖一句语音指令。
例如:
“你看到桌上有什么?”
“这个积木应该放在哪里?”
“我拿的是哪一本书?”
“刚才是谁从门口经过?”
视觉结果驱动互动
AI 对画面的理解还可以转化为情绪和动作,让设备根据看到的内容做出更自然的回应。
例如:
看到用户挥手时,机器人做出回应动作
看到孩子展示画作时,AI 主动进行评价
识别用户表情后,调整回答语气和灯光效果
发现目标离开画面后,停止跟随或发出提示
用户说出目标,AI 负责调用合适的能力
云端 MCP
AI 能够结合外部服务,理解上下文并完成相应任务。
可以做这些事情
“今天出门需要带伞吗?”
AI 获取当前位置和天气信息后,通过语音回答,同时将天气结果显示在设备屏幕上。
“我现在去最近的地铁站应该怎么走?”
AI 可以结合设备位置和导航服务获取路线,并通过语音或实时字幕逐步返回导航信息。
设备 MCP
AI 可以将自然语言转化为设备能够执行的动作。
可以做这些事情
“打电话给爸爸。”
AI 理解用户意图并发送呼叫指令,由设备通过微信 VoIP 向已绑定联系人发起通话。
“做一个开心的表情。”
由设备调用本地表情或动作能力作出回应。
AI 在云端运行,设备保持轻量
轻量设备侧
减少设备本地运行大模型和语音算法的压力,更适合资源受限的嵌入式硬件。
一条实时连接
音频、字幕、打断、状态与动作事件通过同一条实时链路传输,简化设备侧集成。
弱网互动优化
面向家庭 Wi-Fi、移动网络和网络波动环境优化传输,尽量保持对话和控制连续。
设备动作协议
AI 可以向设备发送结构化动作事件,由设备根据自身能力执行灯效、转动、播放和其他操作。
多芯片与系统适配
根据芯片、操作系统、音频格式和硬件资源选择合适的接入方案。
持续扩展能力
新的角色、知识和云端工具可以在平台侧配置,减少因 AI 能力更新而频繁修改设备固件。
FAQ
已经有自己的大模型或智能体,可以接入吗?
可以。可以根据产品需求连接已有的大模型、智能体或第三方 AI 服务,并通过 Ti RTC 建立设备与 AI 之间的实时音视频通道。
没有摄像头,也能使用 AI 对讲吗?
可以。只有麦克风和扬声器的设备也可以使用实时语音 AI。摄像头主要用于增加视觉理解、远程查看和目标跟随等能力。
AI 可以控制机器人的动作吗?
可以。AI 可以生成设备动作事件,由机器人执行转动、灯光、表情、播放和其他硬件操作。实际可控制的范围取决于设备开放的能力。
什么是 MCP,它能为产品带来什么?
MCP 可以帮助 AI 连接外部数据、工具和服务。对于玩具和机器人,它可以用于查询信息、调用内容、控制设备、发起通话或执行产品自定义任务,具体可用能力取决于产品开放的工具、设备功能和权限配置。
接入后还能更换角色、声音或知识内容吗?
可以。角色、声音、知识库和部分云端工具可以独立配置,不必将所有内容固定在设备固件中。
