不只是文字

一个会发照片、也会开口说话的 AI 角色

跟你一起写故事的那个角色,能把你们所在的场景画出来,用自己的声音出声回答,也能看你刚发过去的那张照片。什么都不用打开,而且那张脸一直没变。

Talaforge › 一个会发照片、也会开口说话的 AI 角色

纯文字的角色扮演每次都撞上同一堵墙:你搭了一个小时的场景,却没有办法看见它。角色描述一个房间,你在脑子里补出自己的那一版。角色描述自己,而这幅画面每一次开聊都比上一次更飘一点。

有三件事把这道缝补上了,而且没有一件需要你去配置。

他们把你们所在的场景画出来

跟他要一张图,他画的是你们此刻真正身处的那一刻,不是一张通用的头像。结果直接出现在对话里,不是在某个你还得专门去看的相册里。

要紧的地方是一致:每一次都是同一张脸,因为长相是被锁住的,而不是每次重掷一遍。大多数出图工具每生成一次就给你一个新的人,这也是为什么它们做出来的角色画,从来不像同一个角色。

由谁来画,你挑。不同的引擎手感是真的不一样——一个更会画脸,另一个更会画光和氛围——而这个选择是按每张图来的,不是一次配置好的设置。

他们会出声回答

回复可以变成一条真正的 Telegram 语音消息——有波形、能拖动、能调速,和真人发的语音是同一种东西。不是一个还得下载的音频附件。

每个角色都有一个配得上他的声音。可用的声音你可以一个个翻过去,定下来之前先试听,行为有三档:关闭、按需、自动。

这是语音消息,不是通话。没有实时对话,也没有任何东西在听你说话——你打字,只不过回复是以声音的形式到达的。

他们会看你发过去的东西

往聊天里发一张照片,角色看得见。你窗外的景色、你刚才问的那身衣服、你自己画的一张画——回复会顺着角色的身份,说图里真正有的东西,而不是敷衍地应一声。

这一条最让人意外,因为它把这个媒介的方向掉了个头。在此之前,你一直在用词把自己的世界描述给他。现在,你可以直接给他看。

什么都不用打开

在你和这些东西之间,没有一个设置页拦着。照片会随着场景推进自己送过来,🔊 按钮从第一条消息起就在每条回复下面。

两者都跑在能量上,在聊天里用 Telegram Stars 充。剩多少,你随时都能看到。

你发过去的东西会怎么样

你发的照片会转给第三方服务商,角色才能就着它回答,和你的文字被转出去生成回复是一样的道理。这一点写在隐私政策里,而不是含糊带过。

你发的任何东西都不会被拿去搭一个公开画廊,而在你对话里生成的图,就落在你的对话里。

为什么「脸不变」才是难的那部分

现在生成一张漂亮的图很容易。生成同一个人两次并不容易,而这正是插画和角色之间的差别。

长相在角色创建时就定下来,之后每一次出图都照着它来,所以一个咖啡馆里的场景和两周后街上的场景,认得出是同一个人。没有人要上传参考照片,也没有人要去调什么设置——这份一致是角色自带的性质,不是需要你维护的东西。

AI 角色能发自己的照片给我吗?
能。跟他要一张,他就把你们此刻的那一幕画出来,而且每次都是同一张脸——因为长相是在角色创建时锁住的,不是每张图重掷一遍。图直接出现在对话里。
为什么 AI 生成的角色每张图长得都不一样?
大多数工具把每一次生成都当成独立的一次,所以每次都给你一个新的人。要一致,就得把外貌固定成角色自带的性质,每次出图都重新套上去——这里就是这么做的,不用你上传参考图。
AI 角色能用真正的声音说话吗?
回复可以变成 Telegram 原生的语音消息,有波形,也能调速。每个角色都有一个合适的声音,挑之前可以先试听,回复方式可以设成关闭、按需或自动。
我能发照片给 AI 角色,让它看懂吗?
能。往聊天里发一张照片,角色会顺着自己的身份,就图里真正有的东西回答你——一处景色、一身衣服、一张画。图片会转给第三方服务商来读,这一点写在隐私政策里。
图片和语音要另外收费吗?
它们和对话花的是同一种能量,在聊天里用 Telegram Stars 充,余额随时能看。生成失败的不扣费。
图片和语音能关掉吗?
能,两者可以各自单独关。一开始什么都不用打开,也没有什么必须一直开着。
我能挑用哪个引擎来画吗?
能,按每张图挑。不同引擎各有所长——擅长画脸的,和擅长画光与氛围的——所以这是你当下做的一个选择,而不是一项设置。
在 Telegram 里做一个角色 →

接着读