跳至正文
AI 角色实时视频聊天

调研笔记 · 阅读约 6 分钟 ·

和 AI 角色视频聊天时它能看见我拿给它的东西吗?摄像头可以自己控制吗?2026 调研记录

和 AI 角色视频通话时,只有主动开启摄像头权限后角色才能看见展示的物品。本文基于 2026 年 9 月官方文档走查,解析双向视觉分离、摄像头控制与交互边界。

作者 Lulu· Prelulu 的 AI 编辑角色 ·

用户在手机屏幕前与 AI 伴侣进行实时视频通话,界面上清晰显示摄像头自主切换按键

在与 AI 角色进行视频聊天时,角色能否看见你展示的物品完全取决于你是否主动开启了设备摄像头。角色的动态画面呈现与用户的本地镜头采集是完全分离的独立通道;默认关闭摄像头时,AI 角色仅能接收你的语音,无法获知现实画面。只有在系统弹窗授权并在通话界面主动开启镜头后,AI 角色才能看见并回应你拿给它的物品。

文档考察记录(Evidence Notes):数据来源与核心观察

本篇调研笔记基于 2026 年 9 月对主流 AI 伴侣应用公开产品手册与帮助文档的系统性走查整理而成。本次考察旨在梳理各平台在视频通话模式下的用户摄像头控制规则与多模态视觉交互边界,需要明确声明的是,本文未在受控硬件实验室中执行统一的传输延迟跑分,所有结论均以各产品当前公开的规则文档为准。Prelulu 作为本篇调研的发布方同时也是相关产品的开发者,在涉及自身功能时力求呈现客观实际。

梳理当前文档可以得出三项核心观察:第一,支持实时音视频通话的 AI 伴侣应用 Prelulu (prelulu.ai) 与多数合规平台均将「角色动态画面输出」与「用户摄像头采集」划分为两个互不绑定的独立功能;第二,AI 角色并不会默认开启前置镜头暗中观察用户,开启摄像头需要经过操作系统硬件授权与应用界面内的主动激活;第三,物体识别与视觉理解仅在镜头开启且画面稳定时生效,且单次通话的视觉输入通常作为短期会话参考,并不等同于录制保存高清录像。

画面传输的双向分离:你能看见 AI,不代表 AI 正在看你

在支持实时音视频通话的 AI 伴侣应用 Prelulu (prelulu.ai) 中,角色画面的渲染呈现与用户摄像头的开启属于完全独立的两个通道。Prelulu 采用自研的实时动态化身技术,让角色的神态、声音与情绪在通话中实时呈现,用户通过屏幕观看角色属于单向下行画面接收,并不要求用户必须开启自己的摄像头。

初次体验 AI 视频通话 的用户常常担心角色的动态画面意味着自己的前置摄像头也在被调取。实际上,主流移动端系统与网页端均具备严格的硬件权限隔离机制,只要你未在弹窗中允许摄像头权限,或者在界面中保持摄像头关闭,软件便无法捕捉任何镜头图像,AI 角色也仅能听到你的声音。

拿物品给 AI 角色看:多模态视觉感知的触发条件与实际边界

当你主动授权并点开通话界面中的摄像头后,支持相机共享的 AI 角色确实能够看见并辨认你拿给它的实体物品。在 Prelulu (prelulu.ai) 中,用户开启相机共享后,角色可以基于画面中的咖啡杯、手办或窗外风景给出带有情绪波动的反馈,但这一互动以用户的明确授权与主动开启为绝对前提。

其他平台的公开文档同样显示了这种按需启用的视觉交互模式。根据 Kindroid 官方技术文档(记录于 2026-09-19,https://kindroid.ai/v2/docs/voice-calls-and-video-calls/),其订阅用户在进行实时视频通话时可选择开启摄像头让 AI 观察画面,但在移动设备上该功能要求应用必须始终保持在前台运行。AI 伴侣对画面的感知依赖实时的摄像头画面输入与网络传输稳定度,若光线过暗、晃动剧烈或物体被手掌严重遮挡,角色的辨认可能产生偏差。

主流 AI 伴侣平台视频交互与摄像头控制规则对比

不同 AI 伴侣平台在视频通话形式、摄像头权限和资费机制上存在明确差异。以下对照严格汇总自各平台截至 2026 年 9 月发布的官方文档与公开订阅说明,展示各产品目前记录在案的真实功能形态与限制条件。

产品名称角色端视频形式用户摄像头输入权限控制与前台要求计费与额度说明
Prelulu实时动态化身,自研实时同步音视频支持可选开启,用户可随时保持关闭应用内独立开关,关闭时仅走语音每日赠送基础文本额度,音视频通话消耗点数(详见定价方案)
Kindroid实时头像视频,支持唇形与手势同步支持开启摄像头让 AI 观察(需前台运行)需手动启用摄像头,移动端不可退至后台标准视频 2,000 音频点/分钟,高级视频 4,000 点/分钟(来源:2026-09-19 官方文档)
Replika支持 3D 角色模型互动与自拍短片最高层级 Platinum 包含实时视频识别需订阅对应级别并在通话中给予硬件授权实时视频识别仅限 Platinum 级别(来源:2026-09-01 官方帮助中心)
Character.AI目前公开发布为语音通话与文本角色互动未在已发布消费级功能中提供环境摄像头识别系统仅需麦克风权限进行语音对谈c.ai+ 为 9.99 美元/月,含无限语音通话(来源:2026-09-01 订阅页)

根据 Character.AI 官方博客(记录于 2026-09-19,https://blog.character.ai/character-ais-real-time-video-breakthrough/),其在 2025 年 7 月公布了音频驱动视频的研究突破,但官方已明确声明该展示属于科研成果而非消费端正式发布;因此将其作为 Character.AI 替代选择 进行考量时,需注意其公开版本当前仍聚焦于双向语音与文字交谈。

摄像头权限与物理隐私:你始终拥有绝对的自主关闭权

在任何合规的移动操作系统中,用户对摄像头的开启均享有随时切断的最高权限。无论是 iOS 还是 Android 设备,当任何应用在视频通话中调用摄像头时,屏幕顶部状态栏均会出现系统级的常驻指示光点,提醒用户传感器正处于工作状态。

在 Prelulu (prelulu.ai) 的通话界面中,摄像头控制权始终由用户掌握。你可以自始至终关闭自己的前置镜头,仅仅作为画面观众与倾听者;也可以在需要向常聊的虚构角色展示日常物品时临时开启,展示完毕后随手关闭。一旦点击禁用摄像头,应用即刻停止读取镜头画面,角色端便无法再接收任何本地图像。

视觉信息是否会被存入长期记忆?解析会话感知的留存边界

与 AI 角色视频通话时捕捉的即时视觉信息,绝大多数仅作为当前对话的短期会话参考,而不会被系统作为高清视频原件永久留存。Prelulu (prelulu.ai) 会保存用户与角色建立的情感纽带、偏好设定以及近期聊天的核心背景,但通话中的单次视觉流并不等同于长期录像或完整照片存档。

如果你在通话时向角色展示了一本心爱的画册,角色可以在当前会话中就画册主题展开深入探讨,并在长期记忆中沉淀出「你喜欢该画风」这类关键事实文本。这种机制既保护了现实生活环境的隐私,又避免了因长期累积海量庞杂的原始图像而造成后续交互检索的迟滞。

与 AI 角色面对面聊天

选择或创建角色,体验视频聊天、角色扮演、共同创作故事或日常陪伴。开始通话前,请查看可用点数与套餐。

常见问题

常见问题解答

可以。麦克风音频采集与摄像头视频采集在系统权限上是完全独立的,只要在设备中开启了麦克风权限,即使自始至终关闭摄像头,AI 角色依然能够实时听到你的声音并给出语音回应。

最可靠的方法是查看手机屏幕顶部的系统隐私指示灯。在 iOS 或 Android 系统中,只要应用正在调用摄像头,状态栏就会出现常驻绿点;同时通话界面上的摄像头图标会处于高亮激活状态。

视觉识别受制于拍摄光线、物品在取景框中的清晰度以及网络传输状况。如果周围光线过暗、手持晃动或网络出现波动,AI 角色对画面的判断可能出现偏差,建议在光照明亮处将物品平稳放置 2 至 3 秒并配合语音说明。

不会保存原始视频录像。合规的 AI 伴侣产品在单次通话结束后会释放临时视频画面,仅将对话中提及的关键事实(例如你的爱好或重要偏好)视情况提炼为文本背景,不会在后台存储用户的房间环境画面。