Post
2026年9月30日 上午09:54
歡迎所有互動

一點逆風的東西,所以會刻意讓文章不是那麼好懂。

(不過還是猜得到我想講什麼吧大概)


我自己算蠻早期接觸CNN/AlexNet的,大概2014就訓練過用來過濾剪片素材的classifier,後來一直到unet跟transformer都多少有碰一點。所以想法可能跟一般人不太一樣。

對我來說,我覺得ref-based I2I是沒有什麼問題的。用自己給的ref,用自己給的partial feature/feature patches,加上自己給的text hint,讓clip attn合併這些由自己提供的feature vectors,收束成一個result。沒有任何外部feature會出現(或是說,attn layer注意input feature會遠大於從dataset拉資料)。

T2I是另一個問題。PE/LLM-based T2I可能好一點點,畢竟dataset性質不同很難有feature copy的狀況發生,但也只有PE/LLM那段而已。進到denoiser之後的行為本質上都是dataset feature reconstruction。不同denoiser可以有不同feature granularity,要做到認不出dataset並不是不可能的事情,但本質上latent不可能無中生有。text不夠的feature必定會從某個地方拿來用,那就會是dataset。這點在danbooru tag形式的denoiser會特別明顯,那個資訊量根本不可能夠。

這時候回到ref-based I2I,會發現其實使用方式可以過濾掉大部分會出問題的部分,讓工具回歸最基本的工具。本質上denoiser跟比較聰明的套索工具沒什麼兩樣,只是看要從哪裡套而已。


其實這點也是我在看過有人說LLM用在web development是「正確的使用方式」之後就一直想講的東西。

作為開發者,這種「正確的使用方式」對我來說並不完全精準,但我可以理解其中一部分理由。

任何形式的創作,除了創意跟知識本身之外,最困難的是反覆嘗試把作品收束到自己可接受的程度那部分。新工具可以讓反覆嘗試的部分輕鬆一點,那也許確實可以說是正確的使用方式。

以開發為例。開發者在很久以前就學會複製貼上其他來源組成自己想要的東西了,open source lib就是為了讓每個人都能更輕鬆做出屬於自己的東西。老派開發者認為摸索過程中的痛苦會讓作品屬於自己,但開發者社群也漸漸遠離這種想法了。作品的成分有比痛苦更重要的東西。也許是因為這個作品是為了作者而存在的,也許是小細節來自作者的品味,也許是作品背後隱藏著作者人生經歷累積出的想法。這些都是讓作品只屬於你個人的,很細微的部分,但也是創作最重要的部分。

所以對我來說,使用工具讓自己輕鬆一點並不過分。重點是作品最重要的那部分屬於你,而不是從某個地方抄襲過來的。

註:

對開發者來說所謂最重要的部分比其他創作更為模糊。程式開發並沒有所謂骨架或畫風這種明確的東西,一般人可能也很難看得出什麼是程式的靈魂。

然而縱使靈魂本身看不到也無法描述,程式是開發者思考過程的延伸,我認識的大部分開發者都可以從程式本身看出這是誰寫的。(我不知道如何描述開發者是怎麼辦到的,但真的可以)

對講到這個,曾經有朋友跟我說看一眼別人寫的code就知道是從我這邊抄過去的。

我自己也經歷過好幾次,在改東西的時候可以立刻猜出這部分是哪個同事寫的。

我猜寫程式可能是一種把自己的靈魂獻祭進去的儀式吧。

開發 mur451 篇文章
歡迎所有互動

記錄一下歷史性的一刻

台北市政府・死亡

歡迎所有互動

嗯⋯⋯簡單試過的感想是,使用起來感覺不太到6.1 Sol比6 Astra笨。

雖然有時候Astra會突然開竅智商變超高這點在6.1 Sol上不會發生,但日常工作底下6.1 Sol high/xhigh可以取代Astra,而且感覺會比Astra便宜。

暴走機率有稍微比5.6 Sol好一點,理解意圖的能力應該跟Astra差不多,但暴走起來是真的很恐怖。(我只是要UX design,6.1 Sol就開始寫網頁、開本地伺服器、開瀏覽器檢查自己寫的網頁⋯⋯🫠)

然後價格是真的超便宜。官方標榜跟Astra差五倍,實際加上Session Cache之類優勢可以差到快30倍。

便宜到OpenAI把大家額度都砍半還划算那種便宜。

歡迎所有互動

⋯⋯Theo你加這什麼鬼功能到虛擬機上面

Theo!!!

歡迎所有互動

給大家看一下現在的6.1 Sol慢得有多離譜

唉🫠