Ti RTC · AI 实时对话引擎
对话发生在真实世界里
保持对话连贯
持续处理设备端音频并缩短响应等待,让用户可以自然地继续下一句话
随时打断
用户开口时及时停止播报并继续理解,不必等 AI 把话说完。
锁定说话人
结合声纹与音频处理,降低旁人说话和环境声音的干扰。
看见正在发生的事
将图片或实时视频带入对话,让 AI 根据当前画面、物体和用户动作进行回答。
它不只回答,也会行动
记住上下文
可根据业务需要配置短期与长期记忆,并在获得用户授权后保存对话记录。
连接知识
接入产品说明、服务内容和业务资料,让回答更准确、更符合具体场景。
例如产品说明书、售后知识和业务规则。
调用工具
连接 MCP 与云端服务,让 AI 可以查询信息、调用业务接口并完成多步骤任务。
例如查询天气和导航信息,或调用企业内部服务。
控制设备
通过设备端工具读取状态并执行经过授权的指令,让用户可以用自然语言控制灯光、打电话或其他设备能力。
角色与声音
模型与知识
记忆
工具与设备
定义一个有性格、有声音的智能体
从角色身份、语言风格到音色与情绪表达,让 AI 在每一次对话中保持一致、自然,也更容易被用户识别和信任。
可配置能力
Agent 人设
定义智能体的身份、目标、性格、表达方式和行为边界,让角色在持续对话中保持一致。
语言、音色与语速
配置对话语言、发音人、语速和音量,适配儿童陪伴、智能玩具、客服终端等不同场景。
情绪与表达方式
根据对话内容输出情绪标签,并通过语气、停顿、设备表情、灯效或动作呈现不同情绪。
声音复刻
基于已授权的声音样本创建专属音色,用于品牌角色、家庭陪伴或个性化智能体。
声纹识别与锁定
识别当前说话人,或在复杂环境中锁定目标用户,尽量减少电视声、环境声和旁人说话的干扰。
智能家居与看护设备
FAQ
支持接入哪些大模型和语音服务?
支持接入通义千问、OpenAI、Gemini 等主流大模型,以及阿里云、火山引擎等 ASR、TTS 语音服务。平台可提供预置组合,也支持根据项目需求接入指定的模型与语音服务,支持范围会持续更新。
AI 可以直接控制设备吗?
可以。开发者可以将设备能力封装为 AI 可调用的工具,并通过端侧 MCP 或云端接口触发。可调用的指令、参数、权限和执行逻辑均由开发者定义,避免 AI 执行未经授权的设备操作。
是否支持实时视频理解?
支持。系统可在对话过程中按需从设备视频中抽取画面,并交由多模态模型理解,让 AI 结合当前场景进行回答,例如识别手中的物品、观察周围环境或理解用户动作。
有字幕和情绪吗?
支持实时语音转写并返回字幕。根据所接入的模型和语音服务,还可以输出情绪标签,供业务侧调整回复语气、设备表情、灯效或动作。具体效果取决于模型、语音服务和终端能力。