
学境思源,键生成论文初稿
8月1日,DeepSeek上线了V4-Flash正式版。
开发者社区炸了,但炸的原因不是参数有多大、价格有多低——而是这次升的式太反常了。
V4-Flash正式版和三个月前的预览版用的是同个模型骨架。2840亿总参数,130亿激活参数,架构样,尺寸样,连个经元都没多。
图1:DeepSeek V4-Flash后训练前后对比
它只做了件事:重新做了遍后训练。
结果呢?在DeepSWE基准上,分数从7.3飙到54.4,涨了6倍多。在Terminal Bench上,82.7分,逼近Claude Opus 4.8的85.0。在Artificial Analysis智能指数上,50分,只比GPT-5.6 Luna低1分。
模型没变,能力翻6倍。
这件事在AI圈引发了大量讨论,但几乎没有人把它和论文写作联系起来。我觉得这是可惜的——因为这个原理,恰恰是大多数人用AI写论文时漏掉的那步。
什么是"后训练",为什么它对写论文的人很重要
先说清楚"后训练"是什么。
大模型的训练分两个阶段。阶段叫"预训练",相当于让模型读了整个互联网,学会语言和知识。二阶段叫"后训练",是用特定的数据和法去"调教"模型——告诉它什么回答是好回答,什么是不好的,怎么思考,怎么组织语言。
DeepSeek V4-Flash这次证明了件事:预训练决定了模型的天花板,但后训练决定了它能摸到天花板的多。同个模型,后训练做得好和做得差,能力差6倍。
这跟写论文有什么关系?
你每次用ChatGPT、DeepSeek、Kimi写论文时绍兴防火门胶,其实在做的就是次"微型后训练"。你给的提示词、你提供的示例、你反馈的修改意见、你设定的约束条件——这些就是模型在"预训练"基础上获得的"后训练信号"。
大多数人用AI写论文的式是:开对话框,输入"帮我写段关于XX的文献综述",然后直接用输出结果。
这相当于什么?相当于DeepSeek发了预训练版就不管了,不做任何后训练。你能拿到的,是模型"出厂状态"的表现——及格,但远不是它的上限。
四个"后训练"法,让同个模型写出不同的论文
图2:四个后训练法卡片
法:给它3段你自己写的文字
这是简单、回报的步。
不要提示开始。在让AI写任何东西之前,先给它3段你自己写的论文片段——好是你满意的段落。然后在提示词里加句:
"以下是我之前写的内容,请参考这个风格、用词习惯和论证节奏来写。"
这叫"few-shot示例",本质上是给模型次微型后训练。果比你想象的大得多。同个DeepSeek V4-Flash,有few-shot示例,输出质量可以差个档次。
我实测过:让DeepSeek写段关于"社会资本与社区理"的文献综述。不给示例时,它写的是标准的教科书腔——"已有研究表明""学者们普遍认为"。给了3段我自己写的文字后,它开始用"这脉络的核心张力在于……"这种贴近学术讨论的句式。
不是它变聪明了,是它知道你要什么了。
法二:不要让它步到位,分三轮迭代
DeepSeek这次后训练的个关键是"多轮反馈"——不是次灌数据,而是反复迭代。
你写论文也该这样。不要说"帮我写这段",然后直接用。分三轮:
轮:让它写出初稿绍兴防火门胶。
二轮:你把初稿里不满意的地标注出来——"二段的论据不够具体""结论太对了"——让它改。
三轮:你问它"如果审稿人要挑这段的毛病,可能挑什么",万能胶生产厂家根据它的回答再做后轮修正。
三轮迭代下来,质量比步到位好太多。关键是二轮和三轮——你给它的反馈,就是"后训练信号"。
法三:用"负面约束"比"正面要求"有
DeepSeek的后训练里有项技术叫"偏好优化"——不仅告诉模型什么是好的,还明确告诉它什么是不好的。
你写论文时也可以用这个法。不要只说"写得学术点",要说:
"不要用'已有研究表明''学者们普遍认为'这类套话开头。不要在每段结尾都做总结。不要用'值得注意的是'作为过渡。"
负面约束比正面要求有,因为模型清楚"不该做什么"。当你只说"写好点"时,模型对"好"的理解可能和你不同。但你说"不要用这些词",边界就清晰了。
法四:让它先列大纲再展开
DeepSeek V4-Flash正式版有个新能力:可切换"思考模式"和非思考模式。思考模式下,它会先规划再执行。
你可以手动模拟这个过程。不要说"帮我写篇关于XX的文献综述",而是:
步:"给我列个关于XX的文献综述的大纲,按时间脉络还是主题脉络,你建议哪个?为什么?"
二步:评估它的大纲,指出哪里要调整。
三步:"按调整后的大纲展开二部分。"
这样写出来的论文,逻辑结构比步到位强太多。因为你给了模型"思考的时间"——这本质上也是种后训练。
个反直觉判断
很多人追新模型——K3出了换K3,Luna出了换Luna,Opus出了换Opus。但DeepSeek这次告诉你:同个模型,后训练做得好和做得差,能力差6倍。
翻译成论文写作的语言:你用同个ChatGPT,"后训练"做到位和不做,论文质量也差好几倍。与其花时间研究哪个模型强,不如花时间优化你给模型的式。
DeepSeek V4-Flash正式版的API价格低到0.2元/百万tokens(缓存命中)。但再便宜的模型,如果你每次都是提示、步到位、不迭代,你拿到的也只是"出厂状态"的及格分。
模型决定下限,后训练决定上限。
关于学境思源
很多人以为AI写作的差距,来自模型本身。但真正决定结果的,往往是你有没有建立正确的使用法。
学境思源关注的,正是AI与学术写作结中的这些关键环节。我们不仅提供AI辅助写作工具,希望帮助每位研究者理解AI、驾驭AI,把模型能力转化为自己的研究率。
从选题分析、文献梳理,到框架设计、初稿生成、内容优化,再到反复修改完善,学境思源围绕真实学术场景造完整工作流,让AI不只是个聊天工具,而成为科研过程中的智能助手。
未来,模型会越来越强,但会使用AI的人,才会真正获得优势。
关注学境思源,探索AI赋能学术写作的新式。
如果这篇对你有用,可以分享给起写论文的同学。
关注学境思源,每周拆解AI如何改变学术写作。
⭐ 星标学境思源,不错过每周新。
#DeepSeek #ChatGPT #论文写作 #学术写作 #后训练相关词条:储罐保温 异型材设备 钢绞线厂家 玻璃丝棉厂家 万能胶厂家
奥力斯 保温护角专用胶批发 联系人:王经理 手机:13903175735(微信同号) 地址:河北省任丘市北辛庄乡南代河工业区
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》绍兴防火门胶,以此来变相勒索商家索要赔偿的违法恶意行为。