谁先发现自己错了
未来 AI 的核心竞争力 —— 一个普通使用者的记录
上午和 GPT 聊天,聊到一个我憋了很久的困惑:我分不清 ChatGPT 和 Codex 的区别。不是分不清界面,是分不清能力——两者会犯的错一样;一个搞不定的,另一个也搞不定。聊到最后我意识到,这不是我没找到它们的区别,而是我碰到了它们共同的边界。
同一个按钮,两种失败
之前我的 App 里有个按钮总是很难点到。我让 Codex 改,改了很多很多次,没用。前几天刚好又遇到同样的问题,换 ChatGPT 上,改了很多次,依然无效。最后是一个叫 WorkBuddy 的工具很快搞定的——它不认可 GPT 的判断,换了个方向,改完,就好了,还告诉了我 GPT 和 Codex 错在哪:它们一直在错误的事情上不断尝试。
其实这个问题我很早就遇到过。那时候我还在用 Trae 开发,发现它反复改一个 bug 改不好,我就跟它说:也许你改的方向不对,也许这个 bug 是别的原因引起的。比如两个地方的代码同时对一个按钮起作用,而层级不同,其中一个更高——你改层级低的那个,永远改不过来。就像两张图片叠在同一个位置,层级高的在上面遮着,你改底下那张,改一百次,画面上也看不见任何变化。
后来 Codex 也犯这个错,我跟它讲过一次,还专门写进了规则。最近这次,它依然犯了。ChatGPT 也一样。
我说“推翻”,它听成“微调”
类似的还有网页设计。我之所以一度从 Codex 切走,就是因为它的设计太糟糕:改来改去几乎一样。把改过的几版摆在一起,从人的直观感受看,看不出什么区别。我反复强调要推翻重做,不要模板,不要 PPT 感,要炫酷——每次说一大堆,结果都差不多。后来换成 GPT,同样的错误,同样的问题。
设计 Logo 那次更彻底。改了好多好多版,我给了大量参考,Codex 始终做得很糟糕;换 GPT,没有任何区别,依然十分糟糕——直到我的用量清零,也没有一版勉强能看的。
所以使用这两个工具的整个过程里,我完全感受不到它们的任何区别。GPT 那边给我的回复,我认为是准确的:你不是没找到 ChatGPT 和 Codex 的区别,你是遇到了两者共同的能力边界。
信任是一笔不对称的账
AI 做了一件意料之外的好事,你会惊喜,很开心。但开心是短暂的,而且会抬高你的预期——第二次、第三次,你就不那么惊喜了。到了第十次,还是意料之外,只不过这次是它搞砸了一件事。信任感不是下降,是改写:从此以后,你一定一定会担心它再次犯错。
因为你不懂它、不了解它,所以你不知道它什么时候会犯错,你对这件事不可控。而且人对错误、对负面的感知,天然比正面反馈强烈。所以哪怕它给你带来过很多惊喜,只要一件事搞砸了,信任就可能大幅清零——要么放弃 AI,要么换一家。而换一家的结果,前面已经说过了。
AI 不会害怕
你可能以为,强调过了、写进规则了,它就会记住。我的体验是:不能保证。它没有感情,自然不会担心犯错之后要承担什么后果;没有恐惧,就不会像人一样,始终留一部分注意力在重要的事情上,防着自己失手。规则、skill 这些机制也许能限制它,但限制不了它“放在心上”。
人类只懂人类。我们都有恐惧和焦虑,知道怎么恐吓别人,也知道别人为什么恐惧,所以知道怎么让对方把一件事情摆到足够高的位置。但 AI 不知道如何让 AI 把一件事放在这个高度——至少,我不知道该怎么教它。
未来 AI 开发最核心的竞争力,
不是谁更聪明、更快,
而是谁能更早发现自己错了。
带给人惊喜的 AI,会是最受欢迎的;
但最能留住用户的,是不犯错的 AI。
惊喜决定人什么时候来,
错误决定人什么时候走。
以上只是一个普通使用者的真实记录,不是评测,也不针对任何一家。工具在快速变好,希望这篇东西很快过时。