☰
从提示词到成稿:用文心AI辅助历史朝代分析的完整实践
2026/10/6 12:52:20 网站建设 项目流程

做历史类内容久了,我遇到的最大尴尬不是没素材,而是素材太多、观点却出奇一致。随便翻几篇朝代分析文章,引用的史料就那么几段,判断套路也逃不出“强盛—危机—衰落”的标准剧本。去年底,我决定换个思路:不自己闭门憋观点,而是把文心AI拉进讨论桌,让它以一个大模型的身份来点评历代王朝的兴衰。于是就有了“孤能子视角:文心AI点评朝代分析”这个系列。

这个系列的操作方式并不复杂:我准备一套相对稳定的分析框架,让文心AI按照框架对选定朝代逐一输出判断,再由我做核查、校验和重组,最终形成成稿。我并不是指望AI给出什么惊世骇俗的历史结论,而是想验证一个更实际的问题——在大模型的辅助下,历史内容创作者能不能用更低的时间成本,产出有角度、有依据、有争议性的内容?同时,我也想借这个系列摸一摸文心AI在“长时段、大跨度”人文分析上的能力边界。

如果你也在做历史、人文、社科类内容,或者正在琢磨怎么把大模型用在非技术领域,这篇就把我这个系列从0到1的完整过程拆开聊,包括提示词怎么搭、AI输出怎么校验、哪些坑我替你踩过了,以及最终成稿时人工介入的尺度在哪里。

1. 为什么让AI介入历史分析:从选题逻辑到框架定位

1.1 一个内容创作者的困境:素材多、观点少

做朝代分析类的历史内容,我前后有一年多。最初几期靠翻史料、查论文,输出效率非常低。一篇常规的朝代解读,光文献梳理就要两三天,真正落笔时还会被“到底写什么角度”卡住。这种“找资料两天、写稿一小时”的节奏,让更新频率一直上不去。

后来我开始用文心AI做头脑风暴,起初只是让它列几个“唐朝灭亡的制度性因素”之类的提纲。用了几次后我发现,AI的输出虽然不够精,但提供了一个很珍贵的东西——它没有我那种“写文章必须踩某个既有观点”的惯性,经常能给出我平时不会优先考虑的维度。比如有一次我问“宋朝为什么给人积弱的印象”,它第一反应不是“重文轻武”,而是提到了“财政汲取能力强但转化效率低”这个角度,直接把我往制度经济学的方向带过去了。

于是我把定位从“AI辅助查资料”升级为“AI作为分析主体之一”——让AI站在一个相对客观的第三方视角,对整个朝代的兴衰路径做点评。我把这个系列命名为“孤能子视角”,本质上是想做个实验:我的视角加AI的视角,能碰撞出什么内容。

1.2 系列选代的三个硬性标准

“点评朝代”听起来简单,实操起来有个大问题:中国历史上那么多朝代,怎么选?每个都做,精力不够;更重要的是,很多朝代资料零散,AI能输出的内容质量会明显下降,硬做就成了自嗨。

我给自己定了三条选代标准:

  • 必须有足够丰富的正史记载和学术研究做底子,否则AI容易生成缺乏依据的“正确废话”
  • 最好有公认的兴衰转折点,方便做阶段划分,这样AI的逻辑链不容易散
  • 尽量覆盖不同历史类型的范例——大一统王朝、分裂割据时期、偏安政权都要有

按这三条标准,整个系列我排了一条线:秦、汉、唐、宋、明、清,偶尔穿插南北朝和五代十国的专门期数。这几类政权的结构差异很大,正好能测试AI在不同治理模式下的分析表现。比如秦朝是“制度先行”的典型,两宋是“财政强而军事弱”的样本,明朝则能观察“制度设计与实际运行脱节”的后果。每个朝代都能提供一个不同的分析维度,内容不重复。

1.3 为什么选文心AI,而不是其他大模型

这里可能有人会问,市面上大模型那么多,为什么选文心AI?我的考量很实际。

第一,文心AI在中文长文本的理解和生成上,语感比较稳定,尤其在涉及古代文言史料译读时,出错的频率比某些英文优先的模型低。历史分析对中文语感的依赖远超想象——同一个制度名词,不同的断句和解释方式,写出来的味道完全不同。

第二,它有相对完备的对话上下文能力,适合我这种多轮追问式的分析方式。做朝代点评很少一轮能完事,经常要追着AI连续问四五个相关的问题,上下文保持得越稳,后续回答的连贯性越好。

第三,文心AI对成语典故、朝代制度这些“中式知识”的调用更自然。我问过它“九品中正制的流弊”,它能直接对应到“上品无寒门,下品无势族”这句话,省去了不少转译成本。

但这不代表文心AI是唯一选择。我在系列后期也用其他模型做过交叉验证,后面会单独讲到这一点。

2. 构建“朝代点评”的提示词体系:模板设计、多轮追问与角色设定

2.1 一套可复用的三层结构提示词

很多人用AI做历史分析,上来就问“你怎么看唐朝”,然后拿第一轮答案直接发文。这是典型的把AI当搜索引擎用,浪费了大模型真正的强项——结构化推理。我用的方案是三层结构提示词:角色设定、分析框架、输出规范。

给你看一个我在唐代那期实际用过的精简版本:

你是一位专注中国古代政治制度史研究的学者,擅长从制度设计、经济运行、军事布局、文化气质四个维度分析王朝兴衰。请以专题点评的形式,分析唐代由盛转衰的整体路径。要求: 1. 先给出总体判断,再按阶段展开; 2. 每个阶段至少点出一个具体的制度性因素; 3. 涉及史料时,尽量标注正史名称; 4. 结尾给出一个不同于主流观点的观察角度。

这套提示词的效果比“你怎么看唐朝”好很多。原因在于我给AI设了三层约束:角色上的“学者”定位、维度上的“四个分析面”、任务上的“判断加分阶段加非主流观点”。AI一旦有了分析框架,输出就不会是一锅乱炖,而是结构清晰的论述。

2.2 多轮追问:把“单次回答”变成“分析对话”

单次提示词得到的往往是一篇泛泛的综述,信息密度低,观点也偏保守。真正让内容有深度的方法,是多轮追问。

我的习惯是拿到第一轮答案后,至少做三轮追问:

  • 追问1:针对AI提到的某个制度点,要求展开具体运作机制,而不是停留在名词层面
  • 追问2:要求AI列举反例——当时有没有相反的证据是它忽略掉的
  • 追问3:要求AI把这个朝代的某个侧面和前一个或后一个朝代做横向比较

拿唐朝那期举例。文心AI第一轮提到了“府兵制瓦解对中央权威的削弱”,我立刻追问:“府兵制瓦解的具体时间节点是什么?有没有地方藩镇在此之前已经壮大的证据?府兵制瓦解与均田制破坏之间的传导逻辑是什么?”经过这三轮追问,最终稿里关于军事制度变迁的内容,比第一轮的回答具体了不止一个量级。

这种追问方式的本质,是把AI当成一个知识面广但主动性不足的对话者。它不会主动告诉你它哪里没想清楚,但只要你问到具体处,它大概率能调取出更细的内容。独立分析这件事,主动权始终要抓在自己手里。

2.3 角色设定不是越多越好

这里要提醒一个容易翻车的地方:角色设定不宜堆砌。“你是一位拥有五十年研究经验、发表过百篇论文、精通十四国语言的历史学泰斗”——这种设定并不会让输出变好,反而会让AI在长文里频繁使用高姿态词汇,内容空泛得一塌糊涂。

我最终固定下来的角色设定就一句话:“专注中国古代政治制度史研究的学者”。加了“政治制度史”这个限定词,是为了让AI的分析偏向行政框架,而不是泛泛地谈文化风情。做朝代点评最容易出现的偏差就是跑偏到“这个朝代有哪些名人、哪些发明、哪些美食”——那叫百科,不叫分析。

另外要注意,角色设定和分析框架必须匹配。如果你把AI设定成“经济史学者”,却要求它重点分析军事地理,输出就会很别扭。设定和框架一致,AI才知道自己该干什么。

3. 实测记录:用同一套提示词跑通唐代分析的完整过程

3.1 第一轮输出:总体框架的质量检查

直接给你看一段当时文心AI的第一轮核心输出片段(我做了少量格式整理):

唐王朝的兴衰轨迹,大体可以分成三个阶段。第一阶段从贞观到开元,是制度红利释放期,均田制和府兵制的匹配让财政与军事保持相对平衡;第二阶段从天宝到安史之乱,是制度红利耗散期,均田制解体导致财政收入向两税法过渡,但中央对地方军权的回收没有同步完成;第三阶段从藩镇割据到黄巢起义,是结构性失衡的总爆发期。总体来看,唐朝的衰败不是某个皇帝个人决策的问题,而是制度间失配的累积。

这段输出我整体满意——它有清晰的阶段划分,有制度线索,也有结构性判断,不是简单的“明君昏君”叙事。但“不是某个皇帝个人决策的问题”这种表述,我当时就觉得太绝对了。制度失配确实是宏观层面的解释,但忽略了个体的关键作用——玄宗晚年对军政结构的调整,难道不是主动选择的结果吗?这种“宏观决定论”的倾向,在AI的历史分析里反复出现,值得警惕。

3.2 多轮追问后的深度扩展

我用前面说的三个追问方向,把这段内容逐步扩展开。其中最有价值的一轮追问,是关于“两税法与藩镇权力扩张之间的关系”。

文心AI在追问中给出的回复大致是:两税法在德宗建中元年推行,是唐政府试图在均田制崩溃后重建财政能力的手段。但它的推行与藩镇实权膨胀在时间上高度重叠——财政上中央对地方的依赖增强,军事上中央对地方的节制减弱,二者叠加,导致中央权威呈加速度下降趋势。

这个视角并不完全是AI的原创——学术界关于两税法与藩镇关系的讨论有很多——但AI能够在对话中自主建立因果链,已经比单纯检索资料高效得多。我那期的深度内容,大部分来自这轮追问。换句话说,提示词决定内容的下限,追问深度决定内容的上限。

3.3 不同朝代的输出质量差异:一个横向对比

跑完前六个朝代后,我做了一个输出质量对比,发现AI的表现并不平均。为了方便说明,我列个简表:

朝代输出特征常见问题我的修正方向
唐代信息密度高,能建立因果链制度细节描述准确但人口数据失真补人口和经济数据
宋代经济维度叙述充分军事线索被简化,“积弱”归因套路化补军事制度和关键战役
明代制度术语丰富卫所制与内阁制存在混淆风险逐一核对制度名和时间点
清代边疆治理叙述完整处理民族政策时倾向回避争议说法用官方史料对照敏感表述

这个表让我在后续几期的加工环节更有针对性——我知道哪些方面可以放心用AI的一手输出,哪些必须人工补强。做系列内容的优势就在这里:每做一期都是在给下一期铺路,方法论会越来越顺滑。

3.4 暴露出的明显短板:史实与演义混杂

不提短板不公平。整个系列跑下来,文心AI最明显的问题是“史实与演义不分”。在一次问答中,它把《隋唐演义》里虚构的细节当作史实输出,而且表达得非常自信。这种问题在单次对话中很容易被忽略,因为AI的“自信语气”会让人下意识放松警惕。

我的对策是:凡是涉及具体年份、具体人物行动、具体制度名称的句子,全部拆出来单查一遍。这一步很耗时,但不可缺少。后来代AI做历史内容的作者越来越多,我判断内容质量的一个重要标准,不是看它写得顺不顺,而是看它有没有把事实性信息当作可核验素材来对待。

4. 从AI草稿到成稿:我在加工环节每天必做的四道工序

4.1 事实核查:只信原文,不信转述

AI的历史知识来源非常杂,从正史、野史到网络文章都有,而且它不会告诉你某条信息具体从哪里来。所以我的原则是:凡是具体数据,一律回到纸质或权威电子史料里核对一遍。

举一个实际踩过的例子。文心AI在描述唐朝人口时,给出了“贞观年间人口达到8000万”的说法。这个数据有问题——8000万这个量级更接近天宝年间的官方户口统计,贞观时期的人口远低于这个数。如果不查,发出去就会被读者挑错。这种事情一多,号的专业度就垮了。

我现在的核查顺序是:

  • 年份、人物、官职、制度名,直接对“二十五史”和《资治通鉴》原文
  • 人口、税收、军队数量这类数据,优先查学术论文和《中国人口史》等专著
  • 凡是AI标注“据某史记载”但不肯给具体卷目和篇名的句子,一律降级处理

4.2 观点校准:去掉“平均化”表述

AI生成的历史判断,最典型的特征是“各打五十大板”。比如分析王安石变法,AI会倾向于说“变法的初衷是好的,但执行过程中也存在问题”——这种话放到任何历史事件上都成立,等于什么都没说。

我在加工时会专门扫描这类“平均化”表述,把它们改写成具体的判断。比如上面那句话,我可能会改成“王安石变法的核心矛盾不在初衷,而在财政集权与官僚执行能力之间的落差,青苗法在路县两级的落地走样不是偶然,是激励机制设计缺失的必然结果”。“平均化”的表述适合做铺垫,但不适合做观点,观点必须要有偏向性。

这个过程中我会问自己一个问题:如果这篇文章被人拿到专业历史论坛去讨论,我能为自己的判断拿出什么样的依据?如果拿不出,就回去再找材料,而不是用一个看似周全的模糊判断糊弄过去。

4.3 案例增补:一个具体的例子胜过三段抽象判断

AI擅长总结规律,但不擅长讲故事。它可能会说“均田制瓦解导致自耕农经济衰退”,但不会主动告诉你一个具体的农户家庭在这种制度变迁中经历了什么。

我的做法是在关键判断后面补案例。比如谈均田制瓦解时,我补了敦煌文书记载的一个户籍残卷案例——一户人家登记的受田数目从足额逐渐变成不足额,最终在文书中彻底消失。这个微观案例让“制度瓦解”从抽象概念变成了具体画面,读者的感受完全不同。

补案例的能力不是AI能替代的,这部分很依赖创作者自身的阅读积累。如果平时读得少,可以借助工具先找出文献线索,再回到原始材料里提取细节。但无论如何,案例必须真实,不能为了叙事效果自己编造细节。

4.4 结构重组:AI擅长堆料,不擅长叙事

AI给出的东西往往是“正确的骨架加平均化的肌肉”,但缺乏一个拿人的节奏。从第一段到第十段,每一段的权重差不多,读起来像学术综述,不适合面向大众的历史解读。

我在重组时一般遵循一个原则:开头抓冲突,中段递进,收尾落一句有记忆点的话。所谓“冲突”,不一定是血腥的宫廷政变,也可以是制度和现实之间的张力。比如谈唐朝藩镇问题,开头可以直接从“安史之乱后,朝廷名义上拥有全国,实际控制的却只有长安周边一小块地盘”切入,比“唐朝中后期,中央权威衰落”要有冲击力得多。

结构重组是人工介入最重的一步,但也是最值得投入的一步。同样的素材,不同的叙事顺序,阅读体验完全不同。

5. AI历史分析的边界:这个系列教会我的四件事

5.1 长时段判断是AI的相对优势场

单个朝代的某个具体事件,AI很可能说错年份、说错人名。但把时间尺度拉到两三百年,让它概括一个王朝的整体演变路径,它的表现反而比很多入门文章要好。这是因为大模型的训练语料里包含大量“XX朝由盛转衰的原因”这类综述性文本,AI对整个历史周期的结构性叙述已经形成了一种“平均模型”。所以,短时段追问要警惕,长时段框架可以放心用。

5.2 “交叉验证”比“单一追问”更重要

系列做到中期,我开始用其他大模型对同一主题进行交叉验证。做法很简单:让文心AI输出一轮分析后,把它的核心观点提炼成三到四个问题,扔给另一个模型,看对方怎么回答。两个模型的训练数据和偏差各不相同,如果它们对同一个判断达成了一致,这个判断大概率是靠谱的;如果观点冲突严重,就说明这个话题存在争议,需要我自己去查证裁决。

这是一种很实用的AI使用方式——不要让单一信息源成为你的盲区。现实中不同的人对同一个历史问题会有不同看法,大模型也一样。

5.3 价值中立的表象背后,藏着“主流观点惯性”

这里想分享一个有价值的观察:文心AI在涉及历史评价时,表面是价值中立的,但实际上有明显的主流观点惯性。它会倾向于回避尖锐的争议,选择更安全、更被普遍接受的解释。比如谈“清朝的统治政策”时,它的表述会自动偏向“多民族国家的治理”这个框架,而对历史上存在的一些争议性政策避重就轻。

这提醒我一个很实际的问题:如果你做历史内容只是为了获得一种“合理的解释”,那AI完全够用;但如果你想触及更深层的争论,AI给出的“合理”反而可能是阻碍——它会让你误以为这个问题已经有了标准答案,而实际上很多历史判断根本没有标准答案。创作者的职责不是继承结论,而是检验结论。

5.4 人工角色不是审核员,而是分析合伙人

整个系列做下来,我对AI和人的分工有了一个清晰的结论:AI是分析合伙人,不是内容生成器。它负责提供框架、线索、反例和表达参照,但它缺少两个关键能力——判断什么值得强调,以及感受什么样的表达能和读者产生连接。这两种能力恰恰是内容创作的核心。

所以我的工作流不是“AI写完,我删改”,而是“AI拆解,我重建”。AI先把一个朝代的重要维度铺开,我从里面挑出最值得说的部分,再回去查资料、补案例、排结构。这个过程中,AI是起点,不是终点。

6. 继续做这个系列时,我会调整的几个方向

按目前的节奏,系列已经覆盖了秦、汉、唐、宋、明、清六个主要朝代。接下来我计划做两个方向的调整:

第一个方向是增加专题期数,不再严格按朝代划分,而是按“制度主题”跨朝代对比。比如单独做一期“从唐代两税法到明代一条鞭法的财政集权演变”,或者“中国历史上中央与地方关系的三种模式”。这种跨朝代专题正好能用上AI的长时段优势,也更适合把前面几期积累的判断整合起来。

第二个方向是增加“读者提问驱动”的期数。现在评论区经常有人问“AI怎么看某个具体的历史争议”,我打算把这些提问搜集起来,直接拿给文心AI做一轮分析,然后我再校验加工。这样系列的互动性会更强,读者也能看到“AI如何应对具体问题”的真实过程。

到目前为止,这个系列已经成为我所有内容线里读者互动率最高的一个。很多人以为AI点评历史会显得冷冰冰,但实际效果恰恰相反——AI那种“一本正经地整理共识”的语气,反而激活了评论区里不少真知灼见。我现在越来越觉得,好内容不一定非要有独家的史料,能有一个清晰的方法论把知识重新组织一遍,本身就很有价值。如果你也准备试,我的建议是:别怕AI说得不对,怕的是你不校验就发出去。把AI当成那个“读了很多书但经常记错细节的同事”,你只需要当好那个把关的人。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询