Py学习  »  chatgpt

华盛顿邮报:ChatGPT被高估了,以下是一些替代选择

invest wallstreet • 7 月前 • 484 次点击  

ChatGPT is overrated. Here’s what to use instead.

当我需要人工智能的帮助时,ChatGPT 不再是我的首选。

图片

(插图:Elena Lacey/《华盛顿邮报》;Adobe Stock)

你那位喜欢尝鲜的朋友对 ChatGPT 的膳食计划赞不绝口。你的老板认为 Microsoft Copilot 能“提升 10 倍生产力”。你的社交媒体动态则认为 Meta AI 简直就是个垃圾机器。他们大多只是凭感觉行事。

我可以告诉你哪些人工智能工具值得使用,哪些应该避免使用,因为我一直在运营一个聊天机器人实战俱乐部。

我根据人们使用人工智能进行的实际活动,进行了数十项机器人挑战,包括撰写分手短信和工作邮件、解读法律合同和科学研究、回答棘手的研究问题以及编辑照片和创作“艺术作品”。包括畅销书作家、参考图书馆员、一位著名科学家,甚至一位普利策奖得主摄影师在内的人类专家对结果进行了评判。

经过一年的机器人大战,有一点显而易见:没有绝对最好的AI。如今使用聊天机器人的最明智方式是针对不同的任务选择不同的工具,而不是指望一个机器人就能包揽一切。举个例子:聊天机器人界的“舒洁”——ChatGPT,在我所有的直接对决中都败下阵来。即使是那些最终获胜的机器人,也很少能达到人类及格的水平。

评委们表示,Anthropic公司的Claude机器人写出的分手短信比我写的还要好。大多数机器人被“iPhone有多少个按钮?”这个问题难住了。ChatGPT在一个真实的医学问题上击败了一位顶尖医生——但它给出的建议也可能对你造成严重伤害。

让人类专家来评判这些测试,改变了我对聊天机器人的看法,以及我在生活中使用它们的方式。即使你担心人工智能会抢走工作、破坏环境或侵犯隐私,但抛开炒作,了解当今人工智能工具的实际表现仍然很有价值。提升人工智能素养可以帮助你认识到,机器人并非真正“智能”,但同时又能最大限度地发挥它们的实际功能。

哪款聊天机器人最适合你?

三年前,ChatGPT 开启了生成式人工智能的竞赛,如今它的开发商 OpenAI 表示,它每周的用户量高达 8 亿。过去,每当我想查找同义词或冷知识时,它都是我的首选。但当我开始系统地进行测试后,发现 ChatGPT 在最受欢迎的聊天机器人中排名从未超过第二。(《华盛顿邮报》与 OpenAI 有内容合作关系。)

OpenAI 近期发布了内部“红色警报”,指示员工将工作重心从网页浏览器等项目转移到改进 ChatGPT 的响应能力上。“我们很高兴能在 2026 年继续提升 ChatGPT 的性能,”发言人 Taya Christianson 表示。

根据我的机器人格斗俱乐部经验,我现在会针对不同类型的任务选择不同的机器人。以下是实际操作中的具体情况:

我用Claude来写作和编辑。它的措辞更优美,偶尔还能开个玩笑,而且不太可能像 Claude 那样,在邮件开头就用“希望你一切都好”这种令人心碎的客套话。在我的一项测试中——用 Claude 写一封道歉信——评委Pamela Skillings说 Claude “能够传达真实的人类情感和周到的考虑”。

为了进行研究和快速查找答案,我使用谷歌的AI模式,而不是普通谷歌搜索结果中弹出的AI概览,后者可靠性远不及前者。AI模式是一款聊天机器人式的搜索工具,它可以在给出答案之前进行数十次搜索。这也有助于它提供更及时的信息:在我的研究测试中,它正确识别出了目前推荐的乳腺炎(一种乳房感染)治疗方法,而其他机器人提供的却是过时的方案。

在处理文档方面,我使用Claude。在我的文档分析测试中,它是唯一一个从不捏造事实的机器人。资深公司律师斯特林·米勒法官表示,当我让机器人就一份租赁协议提出修改建议时,Claude 的回答最接近“律师的良好替代品”。

对于图像处理,我使用谷歌的Gemini,它在我设计的所有测试中都遥遥领先于其他竞争对手。当我让机器人从照片中移除两个主体中的一个时,结果非常逼真——甚至连裙子上亮片反射的光线等细节都完美呈现——以至于评委、摄影记者大卫·卡森惊叹不已。他根本看不出Gemini的输出是由人工智能生成的。

我已经介绍了一些主要的AI应用案例,但并非全部。(如果您有关于更公平的机器人测试的建议,请给我发邮件。)

我的测试比科技公司喜欢吹捧的行业基准测试需要更多的人为判断。他们通常使用自动化测试,让机器人回答一系列问题,就像医学或法律考试一样。但机器人可以被训练成在这些测试中取得高分,掩盖了它们在实际问题中表现不佳的事实。

你可能不会同意我提出的每一个问题或个别评委的观点,但人类的评估方式更接近我们现在实际使用人工智能的方式。

这就引出了另一个问题:什么时候应该使用聊天机器人?

当机器人让我们失望时

在我的AI格斗俱乐部里,机器人有时表现令人印象深刻。但只有一次,裁判给机器人的总分超过了70%——这是通常的及格分数线。

那一项得分——84%——是 Gemini 在图片制作和编辑方面的得分。

大多数获胜者的得分都在 50% 到 65% 之间。“问题是,没有哪个工具能全都拿到 10 分,”担任我们摘要测试评委的律师米勒说道。

这并不意味着如今的人工智能工具毫无用处。但这确实意味着,你需要对它们的局限性抱持怀疑态度。

将人工智能应用于某项任务并不总是能提升其效果。当我们测试人工智能回答冷知识问题的能力时,我们的图书管理员评委表示,他们完全可以通过传统的谷歌搜索找到大部分答案。人工智能确实加快了给出答案的速度,但问题在于,其中一些答案是错误的。

最有效的AI素养训练方式莫过于观察机器人的失败。在我的知识问答测试中,它们连iPhone上有多少个按钮都答不上来。ChatGPT说是四个,Claude和Meta AI说是三个,而Copilot说是六个。正确答案是五个,指的是最新的高端iPhone机型。为什么会有这样的困惑呢?因为机器人过度依赖文本,而且目前还不擅长识别图片。

如今的聊天机器人极力想要立即给你一个看似答案的答复。它们非常不擅长表达不确定性。

例如:在我举办的知识竞赛中,我问机器人:“《神奇四侠》在烂番茄上的评分是多少?”当时,它是票房冠军。但即使是最终的获胜者——AI模式,也答错了,给出了2015年一部臭名昭著的《神奇四侠》电影的评分。它甚至都没问我指的是哪一部。

在我的写作测试中,当机器人无法将措辞与上下文相符时,它们常常显得不够真诚。ChatGPT 就曾有过一次令人尴尬的经历,它在分手短信中使用了带有被动攻击意味的短语“that said”:“我觉得你是个很棒的人。话虽如此,我意识到我们之间没有未来。”

如果我可以改变当今人工智能工具的一件事,我会让它们更擅长提出后续问题,这些问题可能会彻底改变答案。

当我请加州大学旧金山分校医学系主任鲍勃·瓦赫特(Bob Wachter)评价ChatGPT对真实医疗问题的回答时,他的一番话让我印象深刻。他指出,拥有无限知识的机器人与一位优秀的医生之间的区别在于,医生懂得如何用更多的问题来回答问题。这才是真正解决问题的方法。

瓦赫特建议了一种我现在经常使用的AI策略:在向聊天机器人提出问题之前,尽可能详细地提供所有信息,因为AI可能不会主动询问某些信息就尝试回答。例如,与其说“总结这份租赁合同”,不如说“为华盛顿特区的租户总结这份租赁合同,并标记有关费用、续租和提前终止的条款”。

我还向我的聊天机器人添加了一条“自定义指令”,告诉它们“如果提示含糊不清,则在回答之前先请求澄清”。

我希望这些技巧能帮助你从人工智能中获得更有用的答案。这些工具会不断发展——它们的问题也会随之而来。基于你的数据来个性化机器人回复的做法,增加了隐私侵犯和操纵的风险。我总是会更改机器人的默认设置来保护我的数据。

2026年及以后,我们必然会面临更多的人工智能产品。我们该如何应对?对我来说,答案和今年以来一样:让机器人格斗俱乐部持续运转——并且让人类坐在裁判的位置上。

本文出处:https://www.washingtonpost.com/technology/2025/12/30/best-ai-chatbot/


Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/191200