不只是文字

會傳照片、也會出聲說話的 AI 角色

跟你一起寫下去的那個角色,可以把你們正在的場景畫出來、用自己的聲音出聲回你,也會看你剛傳過去的那張照片。什麼都不用打開,而且臉不會換。

Talaforge › 會傳照片、也會出聲說話的 AI 角色

純文字的角色扮演每次都撞上同一面牆:你花了一個小時把一幕戲堆起來,卻沒有辦法看見它。角色描述一個房間,你在腦子裡自己畫一個版本。角色描述自己,那張畫面每一次都比上一次再漂走一點。

有三件事把這個縫隙補起來,而且沒有一件需要你去設定。

他們把你們正在的場景畫出來

跟他要一張圖,他畫的是你們此刻真正在的那一刻,不是一張罐頭肖像。成品落在對話裡,不是丟到另一個要你自己去翻的相簿。

真正關鍵的是一致性:每一次都是同一張臉,因為長相是鎖住的,不是每次重擲。大多數繪圖工具每生成一次就給你一個新的人 — 這也是為什麼從那裡出來的角色圖,永遠不像同一個角色。

畫的引擎你自己挑。不同引擎的手感是真的不一樣 — 有的臉畫得好,有的光線和氛圍抓得準 — 而且是每一張圖各自挑,不是一次設定好就不能動的選項。

他們會出聲回你

回覆可以變成一則真正的 Telegram 語音訊息 — 有波形、可以拖、可以調速度,和真人傳來的語音是同一種東西。不是那種要你先下載的音檔附件。

每個角色都配得到合適的聲音。可用的聲音你能一個一個聽過再決定,而這個行為有三種設定:關閉、我開口要才唸,或每次都唸。

這些是語音訊息,不是講電話。沒有即時對談,也沒有東西在聽你 — 你打字,只是回覆剛好以聲音的形式送來。

他們也看你傳過去的

把照片傳進對話,角色是真的看得到。你窗外的天色、你正在問的那件衣服、你剛畫完的一張圖 — 而回覆會是他的口氣,講的是照片裡真正有的東西,不是一句敷衍的「收到」。

這一件最常讓人愣一下,因為它把這個媒介的方向換了。在那之前你一直在用文字描述你的世界。從這裡開始,你可以直接給他看。

沒有什麼要另外打開

你和這些功能之間沒有隔著一個設定頁。照片會隨著劇情自己出現,而朗讀的按鈕從第一則回覆底下就在了。

兩者跑的都是能量 ⚡,在對話裡用 Telegram Stars 直接儲值,剩多少隨時看得到。

你傳過去的東西會怎麼樣

你傳的照片會被轉送給第三方提供方,角色才能回答它裡面有什麼 — 就跟你的文字被轉送出去生成回覆一樣。這件事寫在隱私權政策裡,而不是含糊帶過。

你傳的任何東西都不會被拿去做公開的圖庫,而在你的對話裡生成的圖,就留在你的對話裡。

為什麼「臉不換」才是難的那一段

現在要生出一張漂亮的圖很容易。要生出同一個人兩次不容易 — 而這正是插圖和角色之間的差別。

長相在角色被建立的時候就定下來,之後每一張圖都套用它,所以咖啡館的那一幕和兩個禮拜後街上的那一幕,看得出來是同一個人。沒有人上傳過參考照片,也沒有人去調過任何設定 — 這份一致性是角色本身的性質,不是要你維護的東西。

AI 角色可以傳自己的照片給我嗎?
可以。跟他要一張,他就把你們正在的那一刻畫出來,而且每次都是同一張臉 — 因為長相在建立角色時就鎖住了,不是每張圖重擲一次。圖直接落在對話裡。
為什麼 AI 生成的角色每張圖看起來都不一樣?
大多數工具把每一次生成當成獨立的一次,所以你每次都拿到一個新的人。要一致,就得把外觀固定成角色的性質,並且在每一次繪製時重新套用 — 這裡就是這麼做的,不需要你上傳任何參考圖。
AI 角色可以用真正的聲音說話嗎?
回覆可以以原生的 Telegram 語音訊息送到,有波形也能調速度。每個角色都有一個合適的聲音,選之前可以先試聽,而回覆可以設成關閉、我開口要才唸,或每次都唸。
我可以傳照片給 AI 角色,他看得懂嗎?
可以。把照片傳進對話,角色會用他的口氣回你照片裡真正有的東西 — 一片風景、一件衣服、一張畫。圖片會被轉送給第三方提供方來讀,這一點寫在隱私權政策裡。
圖片和語音要另外付錢嗎?
它們跑的是和對話同一份能量 ⚡,在對話裡用 Telegram Stars 儲值,餘額隨時看得到。畫失敗的那一次不扣。
圖片和語音可以關掉嗎?
可以,兩個各自獨立關。一開始什麼都不用打開,之後也沒有什麼是非開著不可的。
可以自己選由哪個引擎來畫嗎?
可以,每一張圖各自選。不同引擎擅長的東西不一樣 — 有的強在臉,有的強在光線和氛圍 — 所以這是你當下做的選擇,不是一個設定。
在 Telegram 建立一個角色 →

延伸閱讀

做角色的路上,我們學到的事