ChatGPT加了“思考“按钮,无脑拉满反而效果更差了…

封面图:思考强度滑块可视化
8月7日,ChatGPT做了一次更新。免费用户文字互动不再有次数限制,默认模型升级为GPT-5.6 Luna,付费用户拿到了一个"思考"按钮和推理强度滑块——可以手动调节AI回答时投入多少"思考"。
讨论这个功能的人,大多在聊两件事:免费了、更聪明了。
但我想聊的是另一件事。这个滑块,大多数人会用错。而且用错的方式很一致——往右拉满。
先搞清楚"思考"按钮到底在调什么
OpenAI在官方介绍里用了一个说法:滑块调高时,模型会"投入更多计算资源进行多步骤推理"。
翻译成人话:调低,AI快速给你一个回答;调高,AI在回答之前先"想"一会儿,把问题拆成几步,逐步推导,再给你结论。
听起来当然是"想"比"不想"好。所以大多数人的第一反应是:拉满。
问题就出在这里。
"思考"按钮调的不是"聪明程度",是"工作方式"。快答模式和深思模式,是两种完全不同的工具。你不会用锤子拧螺丝,但你可能在用快答模式做该用深思模式的事,反过来也一样。
论文写作的五个环节,需要五种"思考温度"
我把论文写作拆成五个环节,每个环节用ChatGPT跑了一遍,分别用最低和最高思考档位测试。结论是:思考强度和输出质量之间,不是正比关系,是倒U型关系。
润色:调低
润色是最不该开深思的环节。
你让AI"帮我润色这段",如果思考档位拉满,它不会只是改语法。它会开始"审视"你的论述——觉得这个因果关系不够强,那个表述太绝对,然后把你的句子改得面目全非。你以为它在润色,实际上它在重写,而且重写的方向是它认为"更严谨"的方向,不一定是你的方向。
润色需要的是快答模式:快速识别语法问题、表达不顺的地方,改完就收手。不要越界。
档位建议:最低档。润色是"修字",不是"修思想"。
翻译:调低
翻译同理。方法论翻译、摘要翻译这些任务,需要的是准确和通顺,不需要AI"思考"原文的学术价值。开深思模式,它可能会在翻译过程中"优化"你的表述——把"我们发现X与Y正相关"翻译成"研究揭示X与Y之间存在显著的正向关联",听起来更"学术"了,但已经不是你的原意了。
档位建议:最低档。翻译要忠实,不要"思考"。
文献综述梳理:调中
把20篇文献喂进去,让AI梳理研究脉络、指出矛盾点——这个任务需要一定的推理,但不需要最深度的推理。调到中档,AI会花一些时间理解文献之间的关系,但不会过度发散。
如果你调到最高档,它可能会"发现"一些文献之间其实不存在的深层联系——因为它想得太多了。
档位建议:中档。梳理要找关系,但不要"创造"关系。
论点诊断:调高
这是该拉满的环节。
你把核心论点段落丢给ChatGPT,让它当审稿人找漏洞。这个任务必须开深思模式——因为论点诊断需要多步推理:先理解你的论证逻辑,再找出薄弱环节,再给出攻击角度。快答模式只会给你"建议补充更多文献""表述可以更精确"这种正确的废话。
我测试过同一个论点段落:快答模式给了三条建议,全是"可以更具体""建议增加引用"这类放之四海皆准的话。深思模式给了两条建议,但第二条直接指出我的因果链条里漏了一个调节变量——这个漏洞我自己没发现,快答模式也没发现。
档位建议:最高档。找漏洞需要"想",敷衍的审查比不审查更危险。
方法论审查:调高
检查你的研究方法有没有硬伤——样本量够不够、对照组设计合不合理、统计方法选对没有。这种任务也必须拉满。快答模式会扫一眼说"看起来没问题",深思模式会逐步检查你的假设、数据结构、检验方法,告诉你"你的样本量在80%功效下需要至少127,你现在只有89"。
档位建议:最高档。方法论硬伤是致命伤,值得AI多花时间。
拉满的人为什么论文反而更差
现在说回那个反直觉的判断。
我观察过一些把思考滑块永远拉满的人。他们的论文有一个共同特征:过度学术化。
每一段都像是经过了严格的方法论审查——表述极其谨慎,每个论点都加了限定条件,每句话都嵌入了"在某种意义上""需要进一步验证"这样的缓冲语。读起来滴水不漏,但读完什么也记不住。
原因很简单:他们用深思模式做了所有事情。润色的时候,AI在"审视"他们的论述,把直觉判断改成了"已有研究表明";翻译的时候,AI在"优化"他们的表述,把直接结论改成了谨慎推论。每一步都在"提升严谨性",最后整篇论文变成了一团正确但空洞的学术海绵。
思考强度不是越高越好。它是工具,不是信仰。
快答模式保留了你的声音和直觉——因为它没时间"纠正"你。深思模式提升了严谨性——但它也会抹掉你的判断棱角。
真正会用的人,不是把滑块拉满的人,是知道哪个环节该拉满、哪个环节该拉低的人。
一张可以直接照做的表

思考温度表:五环节档位推荐
|
论文环节 |
思考档位 |
为什么 |
|---|---|---|
|
润色 |
最低 |
修字不修思想,别让AI越界 |
|
翻译 |
最低 |
忠实优先,不需要"优化" |
|
文献综述梳理 |
中档 |
找关系可以,别创造关系 |
|
论点诊断 |
最高 |
找漏洞必须深思,敷衍审查比不审查更危险 |
|
方法论审查 |
最高 |
致命伤值得AI多花时间 |
一个判断标准:这个任务需要AI"判断"还是"执行"? 执行类任务(润色、翻译、格式调整)调低,判断类任务(论点诊断、方法论审查、论证漏洞检测)调高。
搞反了,比不用AI还糟。
还有一件事:免费不等于随便用
这次更新还有一个被忽视的点:免费用户现在可以无限畅聊了。
听起来是好事。但对写论文的人来说,这可能是个陷阱。
无限畅聊意味着你可以无限制地问AI——同一段润色问7遍,同一个论点从5个角度反复确认。我之前说过一个现象:API账单最高的人,论文往往不是最好的。现在免费了,账单不是问题了,但"问太多"的问题还在。
问得越多,你对自己判断的信心就越低。 你问第一遍的时候,心里还有一个答案;问到第五遍,你已经开始怀疑自己的判断了;问到第十遍,论文的论点已经被AI的"建议"带偏了。
免费给了你无限提问的权利,但没给你无限提问的智慧。
关于学境思源
AI真正拉开差距的,从来不是模型有多强,而是你是否知道什么时候该思考、什么时候该执行,什么时候该让AI参与,什么时候该保留自己的判断。
学境思源专注于AI与学术写作的深度结合,持续研究不同模型、不同能力在真实科研场景中的最佳使用方式,并将这些经验沉淀为可直接应用的学术工作流。从选题、文献阅读、论文诊断到内容优化,我们希望帮助每一位研究者更高效地使用AI,而不是更依赖AI,让模型成为提升研究效率的工具,而不是替代思考的答案。
如果这篇对你有用,可以分享给一起写论文的同学。
关注学境思源,每周拆解AI如何改变学术写作。
⭐ 星标学境思源,不错过每篇更新。
#ChatGPT #论文写作 #GPT5.6 #学术写作 #思考按钮
更多推荐




所有评论(0)