一點逆風的東西,所以會刻意讓文章不是那麼好懂。
(不過還是猜得到我想講什麼吧大概)
我自己算蠻早期接觸CNN/AlexNet的,大概2014就訓練過用來過濾剪片素材的classifier,後來一直到unet跟transformer都多少有碰一點。所以想法可能跟一般人不太一樣。
對我來說,我覺得ref-based I2I是沒有什麼問題的。用自己給的ref,用自己給的partial feature/feature patches,加上自己給的text hint,讓clip attn合併這些由自己提供的feature vectors,收束成一個result。沒有任何外部feature會出現(或是說,attn layer注意input feature會遠大於從dataset拉資料)。
T2I是另一個問題。PE/LLM-based T2I可能好一點點,畢竟dataset性質不同很難有feature copy的狀況發生,但也只有PE/LLM那段而已。進到denoiser之後的行為本質上都是dataset feature reconstruction。不同denoiser可以有不同feature granularity,要做到認不出dataset並不是不可能的事情,但本質上latent不可能無中生有。text不夠的feature必定會從某個地方拿來用,那就會是dataset。這點在danbooru tag形式的denoiser會特別明顯,那個資訊量根本不可能夠。
這時候回到ref-based I2I,會發現其實使用方式可以過濾掉大部分會出問題的部分,讓工具回歸最基本的工具。本質上denoiser跟比較聰明的套索工具沒什麼兩樣,只是看要從哪裡套而已。
其實這點也是我在看過有人說LLM用在web development是「正確的使用方式」之後就一直想講的東西。
作為開發者,這種「正確的使用方式」對我來說並不完全精準,但我可以理解其中一部分理由。
任何形式的創作,除了創意跟知識本身之外,最困難的是反覆嘗試把作品收束到自己可接受的程度那部分。新工具可以讓反覆嘗試的部分輕鬆一點,那也許確實可以說是正確的使用方式。
以開發為例。開發者在很久以前就學會複製貼上其他來源組成自己想要的東西了,open source lib就是為了讓每個人都能更輕鬆做出屬於自己的東西。老派開發者認為摸索過程中的痛苦會讓作品屬於自己,但開發者社群也漸漸遠離這種想法了。作品的成分有比痛苦更重要的東西。也許是因為這個作品是為了作者而存在的,也許是小細節來自作者的品味,也許是作品背後隱藏著作者人生經歷累積出的想法。這些都是讓作品只屬於你個人的,很細微的部分,但也是創作最重要的部分。
所以對我來說,使用工具讓自己輕鬆一點並不過分。重點是作品最重要的那部分屬於你,而不是從某個地方抄襲過來的。