
我讓 AI 幫我回 LINE,結果熟客以為店裡換人了|小店與一人公司自建 LINE AI客服實錄
2026 年 10 月 7 日AI工具比較,我只記得一句口訣:
跑腿找蜘蛛人,日常找隊長,大局找博士,硬仗才叫浩克。
如果你只有十秒,記這一句就夠了。
接下來是為什麼,以及每一格該填哪個型號。
先說一個我自己的故事。
這個故事,大叔是被自己的訂閱帳單點醒的。
📌 本文的「復仇者聯盟」比喻為作者創作,並非各家公司的官方分類。型號、價格與供應狀態為 2026 年 10 月初的資料,本文為 2026 年 10 月最新整理,資料更新日期:2026 年 10 月 8 日。
我最早用的 AI,是 Gemini
我最早用的 AI,是 Gemini。
我還寫過文章推薦它。
Veo 3 推出的時候,我很多 skills 都是建在 Gemini 的 Gem 上。後來我也用 Gemini Canvas 做出過三個工作用的小工具。
但後來,事情慢慢變了。
要做工作自動化,我覺得 Claude 比較順。
要生圖,我覺得 ChatGPT 比較順。
要做影音,我覺得 Grok 比較順。
這一年,我已經很少打開 Gemini 了。
我不是要說 Gemini 不好。
我想說的是:沒有哪一家,什麼都最強。
可是我一開始的習慣,偏偏是把所有事情,都丟給同一個我以為最強的那一個。
真正貴的,不是模型的價格,而是把對的活派給錯的人。
先給結論:AI工具比較真正要比的,是「派誰出場」
想像你是神盾局局長尼克·弗瑞。
手上有一支英雄團隊。
任務來了,重點不是派最強的人,而是派對的人。
我把市面上四家常用的 AI,各自拆成四個級距:
蜘蛛人,是小模型,快又便宜。
美國隊長,是日常主力。
奇異博士,是深度推理與長文件。
浩克,是旗艦,貴,而且不一定開放給你。
下面這張表,是這篇 AI工具比較最核心的一張,也是 AI 模型比較的重點。
| 級距 | 英雄 | Claude | ChatGPT(OpenAI) | Gemini | Grok |
|---|---|---|---|---|---|
| 小模型 | 蜘蛛人 | Haiku 4.5 | GPT-6 Luna | Flash-Lite 系列(版本號待核) | 資料不明 |
| 日常主力 | 美國隊長 | Sonnet 5.5 | GPT-6.1 Sol(前一版為 GPT-6 Sol) | Gemini 3.8 Flash | Grok 4.7 |
| 深度推理、長文件 | 奇異博士 | Opus 5.5 | Sol 調高思考力度(推測性配對) | Gemini 3.1 Pro(100 萬 token) | 資料不明 |
| 旗艦 | 浩克 | Fable 5.1(Mythos 限受信任機構) | GPT-6 Astra(限量) | 空缺 | 無獨立級別 |
這張表有三種格子,我要先講清楚。
第一種,是官方資料可以對上的。
第二種,是「推測性配對」。我把 OpenAI 的 Sol 調高思考力度,當成奇異博士。官方只確認 Sol 可以調整思考力度,這個配對是我的判斷。
第三種,是「資料不明」。
Grok 的小模型,我到 xAI 官方模型頁查,現行頁面只列出 Grok 4.7 一個文字模型。小模型和 Heavy 都沒有列。第三方整理文章的說法不一,所以我不寫。
Gemini 的旗艦,格子是空的。
原因是:新一代 Pro 傳聞是 200 萬 token,但我查到最新的資料,到 2026 年 8 月仍沒有正式上市。之後有沒有變,請以 Google 官方為準。
下面是我查到的價格,單位是每百萬 token 的輸入與輸出。
| 型號 | 輸入/輸出(美元) | 備註 |
|---|---|---|
| GPT-6 Luna | 0.10/0.50 | OpenAI 三個 GPT-6 級距共用約 105 萬 token 上下文 |
| GPT-6 Sol | 2/10 | GPT-6.1 Sol 的價格我沒有查到 |
| GPT-6 Astra | 10/50 | 約為 Sol 的 5 倍、Luna 的 100 倍 |
| Gemini 3.8 Flash | 0.75/3.75 | 優惠價到 2026/12/31,2027 年起 1.50/7.50 |
| Grok 4.7 | 2/6 | 上下文 50 萬 token |
| Claude 各型號 | 未納入本次查證 | 請看 Anthropic 官方價格頁 |
價格是 API 的價格,不是 ChatGPT 或 Claude 月費方案的價格。
表格看不懂也沒關係,後面我會用情境講。
真正的選擇,不是型號,而是任務。
你覺得選模型很亂,不是你的問題
連做出這些模型的人,都覺得很亂。
OpenAI 執行長 Sam Altman,在 GPT-5 上市前的記者說明會上,形容舊的模型選單是「very confusing mess」(大叔譯:非常混亂的一團糟)。
這句話是 Fortune 報導記者會時轉述的,不是專訪逐字稿。
所以他們的解法,是讓系統自動幫你選。
結果呢?
GPT-5 上線那幾天,自動選型的機制出了問題。Altman 後來在 Reddit 說明,那天 GPT-5 看起來比較笨,原因是選型機制沒有正常運作。
換句話說,把選擇交給系統,不一定省心。
懶人解法,也有自己的代價。
兩個誤區:什麼都用最強,和什麼都用預設
誤區一:什麼都用最強的,又慢又貴
這個坑,我踩得很深。
最恐怖的一次,是 ChatGPT 的 Astra。
我只是想測試看看,請它跑一篇文章,再幫我上架。
它超快。
分析的內容也很好,下標題和寫內文都很棒。
但是,一下子,我當週的額度就被跑完了。
這就是浩克的問題。
他很強,但你不需要他去搬一箱文具。
其實我在 GPT-6 Astra 值得升級嗎 那篇,就寫過類似的比喻:大砲打小鳥。
那篇整理的是 OpenAI 公布的資料。
在電腦操作模擬 OSWorld 2.0 上,Astra 約 40 分鐘做完,GPT-5.6 Sol 約 75 分鐘。
這些數字是 OpenAI 的測試結果,不是我自己計時的。
我那篇的結論是:寫文章、下標題這類小事,Sol 就夠了。
可是回頭看,我自己拿 Astra 去跑文章加上架的那一次,用的正是那種不划算的用法。
文章寫得對,不代表人就不會犯。
成本這件事,我另外寫過:當 AI 自動幫你做事,誰在替你看成本。
還有另一種「又慢又貴」,我不確定算不算誤區,只能說是我的感覺。
有幾次,不管是 Claude 或 ChatGPT,推出最新版本之後,我覺得它變笨了。
跑很久,答案還不如上一版。
這是我的主觀感覺,我沒有做過量測。
不過,新版跑得久,未必只是錯覺。Google 在發表 Gemini 3.8 Flash 時就說過,為了拉高表現,這個模型有時會用掉更多 token。
新,不等於省。
誤區二:什麼都用預設的,遇到難題就卡住
這一個誤區,我要老實說。
我沒有一個具體的卡關畫面可以講。
我不想硬編。
所以我只能引用業界整理的說法:難題丟給便宜的模型,可能一直重試,最後花的時間和 token,比一開始就選對還多(Svitla 整理)。
這個說法合理,但它是別人的觀察,不是我的故事。
所以我自己的做法很簡單:預設用隊長,遇到卡住再升一級,而不是一開始就叫浩克。
最貴的失誤,是在兩個極端之間,從來沒有想過中間那一格。
AI工具比較的情境對照:回訊息、寫文案、做報表,我各派誰
下面是我自己的實際派法。
只有最右欄標示「依級距建議」的,不是我的個人實測。
| 情境 | 我派誰 | 原因 |
|---|---|---|
| 回客人訊息、寫日常文案 | Claude Haiku 或 ChatGPT Luna | 跑腿活,量大,要快要便宜。我有故事行銷的 skills,這類任務我會再往上調一檔 |
| 完全無腦的文案 | Gemini Flash | 成本最低 |
| 整理耶濃銷售報表、做簡報 | Claude(最常用) | 最穩定,成本合理 |
| 生圖 | ChatGPT | 我的實測心得見 ChatGPT Image 2.0 實測筆記 |
| 短影音、影音 | Grok | 我自己的使用感覺 |
| 難題、很長的文件 | Opus 5.5 這一級 | 依級距建議,不是我的個人實測 |
你會發現,我沒有任何一格寫「全部都用同一個」。
派人,比挑人重要。
四位英雄的絕活與糗事
每一位,我都只寫查得到的,或我親身經歷的。
蜘蛛人:跑腿找他
絕活,是快、便宜、量大。
OpenAI 的 Luna 輸入只要 0.10 美元,而且和 Sol、Astra 共用同樣大的上下文。
糗事,是難題會卡。
Grok 這一格,我只能寫「資料不明」。
美國隊長:日常找他
Claude 的 Sonnet,是我做報表和簡報時最常派的人。
我給它的評語只有一個字:穩。
Gemini 3.8 Flash 是 9 月 2 日上線的,Google 稱它是目前最聰明的 Flash。
但也有中國大陸媒體的評測認為,它的判斷力和完成度,和旗艦相比仍有明顯差距。
OpenAI 在 9 月 29 日又推出 GPT-6.1 Sol,比 9 月 22 日的 GPT-6 Sol 再新一版。我還沒有逐項驗證它的細節,也沒有親自測過。
Grok 4.7,官方說它是旗艦,要拿來寫程式或聊天都可以。
至於個性,我的感覺是:它很敢講話,很有想法,就像創辦人的個性,狂大自信。
日常主力,不是最強,而是最不會讓你出事的那一個。
奇異博士:大局找他
Claude 的 Opus 5.5,是這一格。
OpenAI 的對應,我只能寫成「Sol 調高思考力度」,而且標明是推測。
Gemini 3.1 Pro 的上下文是 100 萬 token,不是 200 萬。
Grok 的 Heavy,官方現行模型頁沒有列,我就不寫。
奇異博士的糗事,是他想太久。
你叫他回一封「謝謝,明天見」的信,他也會想到下一個世紀。
浩克:硬仗才叫他
Claude 這一格,是 Fable 5.1。
Mythos 這一級,目前只開放給受信任的機構。
OpenAI 的 Astra,是最強,也是最貴。
它真正的位置,是多步驟、端到端的大工作,例如研究、分析、做文件與簡報、操作電腦。
我在 Astra 那篇 整理過它最有感的地方:速度。
不過同一篇引用的 Artificial Analysis 指數裡,Claude Fable 5.1 的分數(65.7)還是高過 Astra(61.2)。
所以我給自己的原則很簡單:小事用快速模型,中型工作用 Sol,大型專案才叫浩克。
我的糗事,前面講過了:一次測試,燒光當週額度。
Gemini 在這一格是空缺。Grok 則沒有獨立的旗艦級別。
浩克不是用來日常打怪的。
他是用來擋外星艦隊的。
我自己每個月花多少,訂了哪些
我個人的訂閱,有 Claude、ChatGPT 和 Gemini,加上 API,大概每個月兩千。
如果現在重來,我大概會少訂 Gemini。
但它其實是為了 Google Drive 的儲存空間,系統自動幫我升級的,所以也不用退。
這兩千塊,花得值不值,不在於總額。
在於有沒有一個固定的分工。
花得多不要緊,花在錯的地方才要緊。
AI 怎麼選?常見問題
我該用哪個 AI 模型?
先問自己:這件事做錯一次,要付出多少代價?
代價小,派蜘蛛人。代價中等,派隊長。代價大,才往上升級。
越新的模型,一定越好嗎?
不一定。
新版可能更強,也可能更慢、更耗 token。我自己幾次的感覺,是新版跑很久,答案還不如上一版,但這是主觀感受,不是量測結果。
ChatGPT 和 Claude 差在哪?
做 AI工具比較,不要用「誰比較強」來比。
用任務來比。我自己的分工是:做報表和簡報,我最常用 Claude;生圖,我用 ChatGPT。
Grok 值得訂嗎?
我只能講我的使用經驗:我拿它來做影音,覺得它很敢講、很有個性。
但官方現行的文字模型頁面只剩 Grok 4.7,更細的級距,我查不到,所以不下判斷。
大叔最後想說
如果你正在做 AI工具比較,先不要問:
「哪一個最強?」
換一個問題:
「這件事做錯一次,我要付出多少代價?」
回到神盾局的會議室。
弗瑞從來不是在選最強的英雄。
他是在選:這一戰,該派誰出場。
你現在最常把什麼任務,丟給最貴的那個模型?留言跟大叔說說看。
下一篇,我會用另一個比喻,講這四家 AI 各自的個性。
免費取得「AI 派人速查卡」
一頁圖卡:四個級距口訣、五個情境的派法,以及資料更新日期。
加入超韌性大叔 LINE 官方帳號,輸入「派人」即可免費領取。
作者與實作說明
本文由「超韌性大叔」依個人使用經驗撰寫,型號、價格與供應狀態的查證日為 2026 年 10 月 8 日。
我沒有親自測試 Gemini 3.1 Pro、Grok 4.7、GPT-6.1 Sol 與 Gemini Flash-Lite。降智的感覺,我也沒有做過量測。
各家模型更新很快,請以官方頁面為準。文中的復仇者聯盟比喻為作者創作。



