LLM+Wiki 知识库、自动化与 Agent 编排
- 厘清大语言模型(LLM)、本地 Wiki 知识库、文件索引与会话上下文的底层分工,掌握一手文献原子化解构方法(概念卡、配方卡、避坑卡)。
- 掌握复杂融媒体生产任务的“五要素工程拆解法”(目标 Goal、输入 Input、处理步骤 Steps、输出 Output、验收判据 Acceptance Criteria)。
- 深入掌握现代 Agent 编排的三大核心工作流范式:链式顺序流(Chaining)、条件路由分发(Routing)与评估—优化器对抗循环(Evaluator-Optimizer)。
- 在 WorkBuddy 中落地端到端半自动化采编流水线,固化项目级技能,并在数据清洗、初稿生成与事实核查之间设立刚性的人工终审卡点。
随着融媒体内容形态从单一的新闻文字向数据图表、交互 H5、深度视听与社媒矩阵延展,内容创作者面临的认知负荷与生产复杂度呈非线性暴增。如果仅仅把大模型当作“单句问答的高级输入法”,一旦面对几十个交叉信源比对、跨平台自适应改写及严谨事实核查等复合任务,创作者依然会陷入手忙脚乱的泥潭。
实现采编生产力质变的关键,在于将内容创作解构为可编排、可复用、可验证的“模块化内容生产流水线”。
本阶段我们重点解决如何利用 本地 Wiki 知识库 筑牢事实与理论底座,并通过 Agent 编排 将繁复的采编业务串联为半自动化流水线:
| 层面 | 需要回答的问题 | 在自动化与编排中的具体表现 | 不能被什么替代 |
|---|---|---|---|
| 道:新闻真实与价值把关 | 自动化生产的边界在哪里?哪些环节绝不能“无人驾驶”? | 严把事实核实与价值导向关口,拒绝算法炮制信息垃圾,恪守可署名责任 | 不能被自动化脚本或批处理模型替代 |
| 法:任务解构与编排规律 | 复杂宏大的报道选题如何拆解为模型可稳健执行的工步? | 运用五要素模型拆解任务,依业务特征匹配编排模式(链式/路由/评估) | 不能被模糊泛化的“帮我写个大稿”替代 |
| 术:接口契约与核验清单 | 上下游智能体之间传递什么数据格式?如何拦截中间幻觉? | 统一结构化 Markdown 协议,设置严苛验收判据与熔断打回机制 | 不能被跳过验证直接发布替代 |
| 器:本地 Wiki 与工作流引擎 | 哪些载体承接知识检索与指令流转? | LLM-Wiki 知识图谱、WorkBuddy 技能系统、多步自动化流水线 | 不能替人承担事实失真的法律责任 |
flowchart TB subgraph Knowledge [外部知识底座:本地 LLM-Wiki] K1[一手采访素材 raw/] K2[概念卡 Concepts/] K3[避坑卡 Pitfalls/] end
subgraph Pipeline [Agent 自动化编排流水线] P1["步骤 1:信源清洗与特征提取<br/>(链式 Chaining)"] --> P2{"步骤 2:选题受众分流<br/>(路由 Routing)"} P2 -->|深度调查方向| P3A[调查特稿工步] P2 -->|数据可视化方向| P3B[数据图表工步] P3A --> P4["步骤 3:生成器—评估器对抗优化<br/>(Evaluator-Optimizer)"] P3B --> P4 end
subgraph Gatekeeping [人工负责终审卡点] G1{人类主理人终审} end
Knowledge -->|精准注入上下文| Pipeline P4 -->|结构化草稿| G1 G1 -->|验收通过并签署真实姓名| Output[正式融媒体作品发布] G1 -->|发现事实疑点打回重算| P1本讲义对应四个 45 分钟小节:
| 小节 | 课时时长 | 核心维度 | 重点突破 | 当堂留下什么 |
|---|---|---|---|---|
| 第一小节:知识库不是网盘:从散碎资料到原子化知识图谱 | 45 分钟 | 道、法为主 | 确立一手文献准入标准,掌握三层卡片(概念/配方/避坑)解构 | 一份本地原子化 Wiki 卡片库 |
| 第二小节:复杂采编任务的“五要素”工程拆解法 | 45 分钟 | 法、术为主 | 破解模糊提示词幻觉,掌握五要素(Goal/Input/Steps/Output/Acceptance) | 一份工业级采编任务工单 |
| 第三小节:现代 Agent 编排的三大工作流范式 | 45 分钟 | 术、器为主 | 掌握链式、路由与评估—优化器模式,构建人机对抗校验循环 | 一套多步编排流程图与状态机 |
| 第四小节:在 WorkBuddy 中落地端到端流水线与把关卡点 | 45 分钟 | 术、器为主,道终审 | 编写复合 Skill,打通“清洗 $\to$ 提炼 $\to$ 质检 $\to$ 终审”闭环 | 一个可运行的流水线 Skill 与产物 |
第一小节:知识库不是网盘:从散碎资料到原子化知识图谱
Section titled “第一小节:知识库不是网盘:从散碎资料到原子化知识图谱”1. 警惕“二手拼贴”与垃圾进垃圾出(GIGO 原则)
Section titled “1. 警惕“二手拼贴”与垃圾进垃圾出(GIGO 原则)”在新闻实践中,很多学生习惯去百度文库、营销号或未经核实的网络百科复制散乱的二手资料,塞进文件夹便宣称“已经建立了知识库”。大语言模型遵循极其冷酷的计算机基本定律——垃圾进,垃圾出(Garbage In, Garbage Out)。将充满常识错误、商业软文和逻辑混乱的二手材料喂给模型,不仅无法提升内容质量,反而会成为模型严重幻觉的放大器。
新闻传播学知识库的准入原则是:必须来自一手调研、专业学术文献、官方权威统计年鉴或现场采访录音整理稿。
2. 卡片盒笔记法(Zettelkasten)与三层知识体系
Section titled “2. 卡片盒笔记法(Zettelkasten)与三层知识体系”德国社会学家尼克拉斯·卢曼(Niklas Luhmann)凭借卡片盒笔记法,在学术生涯中出版了 70 余部专著。我们将这一认知工程引入现代 LLM-Wiki 搭建,强制将原始资料解构为三类标准 Markdown 卡片:
- 概念卡(Concepts):定义专业核心范畴。解释“是什么”,阐明其内在机理与边界。
- 文件命名:
wiki/concepts/概念名.md - 包含内容:定义、理论出处、核心机理、易混淆概念。
- 文件命名:
- 配方卡(Recipes / SOP):固化标准化业务操作。解释“怎么做”,提供可执行的工业步骤。
- 文件命名:
wiki/recipes/操作名.md - 包含内容:前置条件、输入材料、标准执行步骤、预期输出形态。
- 文件命名:
- 避坑卡(Pitfalls):记录真实采编中的失败教训与错误样本。解释“什么绝不能做”。
- 文件命名:
wiki/pitfalls/错误类型.md - 包含内容:典型错误症状、产生原因、挽回方案、防范规则。
- 文件命名:
classDiagram class ConceptCard { +String 概念名称 +String 理论出处 +String 运行机理 +String 适用边界 } class RecipeCard { +String 任务目标 +String 输入前置条件 +List 执行工步SOP +String 交付物标准 } class PitfallCard { +String 错误表现 +String 根因分析 +String 拦截判据 +String 修复规程 } ConceptCard <|-- RecipeCard : 理论支撑 RecipeCard <|-- PitfallCard : 边界约束3. 双向链接(Wikilinks)与知识自愈
Section titled “3. 双向链接(Wikilinks)与知识自愈”在本地 Wiki 中,卡片绝不是孤立的文件,而是使用 [[wikilink]] 双向链接语法织就的网络。例如在配方卡 [[深度访谈核实规程]] 中,可以关联 [[来源可信度阶梯]],并反向链接到 [[避坑-单亲源失实案例]]。这种拓扑网状结构不仅极大降低了创作者调取知识的心智成本,也为后续 Agent 在大容量检索时提供了清晰的关联路径。
第二小节:复杂采编任务的“五要素”工程拆解法
Section titled “第二小节:复杂采编任务的“五要素”工程拆解法”1. 为什么“宏大指令”必然导致平庸与崩溃
Section titled “1. 为什么“宏大指令”必然导致平庸与崩溃”请观察两段对大模型的输入:
- 输入 A(模糊指令):“帮我根据甘肃天水麻辣烫的火爆现象,写一篇深刻的深度报道策划。”
- 输入 B(五要素工程工单):明确界定目标、输入、步骤、输出与验收判据。
输入 A 必然导致灾难性后果:模型只能检索其预训练语料中的公关套话,堆砌“热气腾腾的烟火气”、“文旅赋能乡村振兴”等泛化词汇,产出毫无新闻价值的垃圾文本。这是因为模糊指令迫使模型在其数十亿维度的概率空间中进行盲目搜索,内在认知负荷全部消耗在猜测试图上。
2. 五要素模型(Goal, Input, Steps, Output, Acceptance)
Section titled “2. 五要素模型(Goal, Input, Steps, Output, Acceptance)”合格的融媒体内容工程师必须像软件工程师编写接口契约一样,严格拆解每一个采编子任务:
| 要素 | 核心要求与规范 | 新闻采编实践标准 |
|---|---|---|
| 目标 (Goal) | 唯一性、确定性。只解决一个确切问题,严禁目标泛化 | 从 3 篇天水文旅官方统计简报中,提取近 3 年节假日客流与旅游综合收入数据 |
| 输入 (Input) | 明确给出物理路径,绝不让 Agent 自行全盘漫游 | 仅限挂载 @raw/tianshui-stats-2024.csv 与 @raw/interview-notes.md |
| 步骤 (Steps) | 严格按序号排列因果次序,要求有声化推理 | ①清洗缺失年份;②计算人均消费增长率;③比对受访商户真实客单价偏差 |
| 输出 (Output) | 强制指定文件结构、数据格式与保存路径 | 必须输出为带有 4 个字段的 Markdown 表格,并存入 output/data-summary.md |
| 验收 (Acceptance) | 可证伪、可量化的核查判据(Checklist) | ①表中不得出现“估算”字段;②必须标注每一条数据的原始文件行号;③计算误差 $\le 0.1%$ |
flowchart LR G[1. 目标 Goal<br/>唯一且确定] --> I[2. 输入 Input<br/>物理文件指针] I --> S[3. 步骤 Steps<br/>因果有序执行] S --> O[4. 输出 Output<br/>结构化格式] O --> A{5. 验收 Acceptance<br/>刚性量规比对} A -->|全部达标| Finish[进入下一工步] A -->|未达标| S第三小节:现代 Agent 编排的三大工作流范式
Section titled “第三小节:现代 Agent 编排的三大工作流范式”根据 Anthropic 在《Building Effective AI Agents》(2024)中提出的工业界权威架构,复杂采编流水线通常由以下三种工作流模式组合而成:
1. 链式顺序流(Chaining Workflow)
Section titled “1. 链式顺序流(Chaining Workflow)”- 核心机理:前一步的输出,经过结构化校验后,作为后一步的输入。
- 融媒体场景:
原始采访录音转录 (raw/audio-transcript.txt)$\to$核心争议观点与时间戳提取 (output/key-points.md)$\to$三幕剧人物冲突故事大纲 (output/story-outline.md)$\to$短视频多机位分镜脚本 (output/script-final.md)。 - 工程控制点:相邻步骤之间必须有“数据契约”。一旦上一步生成的 Markdown 字段出现缺失,下游节点必须立即报错熔断,严禁带病运行。
2. 条件路由分发(Routing Pattern)
Section titled “2. 条件路由分发(Routing Pattern)”- 核心机理:由一个前置分类器 Agent 分析输入材料的特征,依据预设规则将任务动态路由到不同的专业处理流水线。
- 融媒体场景:读者线索库监控。当 Agent 扫描到一条读者报料文本:
- 若属于政策咨询与民生求助 $\to$ 路由至【信息服务答疑 Skill】,调用本地办事指南知识库;
- 若属于社会矛盾与调查线索 $\to$ 路由至【深度调查核实 Skill】,启动多源信源交叉比对流程;
- 若属于纯粹情绪发泄或广告垃圾 $\to$ 路由至【过滤废弃库】并记录留存。
3. 评估—优化器对抗模式(Evaluator-Optimizer Workflow)
Section titled “3. 评估—优化器对抗模式(Evaluator-Optimizer Workflow)”- 核心机理:引入两个具有不同提示词与评价视角的独立 Agent——**生成器(Generator)**负责产出草稿,**评估器(Evaluator)**对照严苛的量规(Rubric)进行挑刺打分。评估器若判定不合格,输出具体的修改指示(Feedback Loop),打回生成器重写,直至达标。
- 融媒体场景:深度调查稿的事实自查。生成器撰写完一篇 2000 字特稿后,评估器强制加载
wiki/pitfalls/避坑库,逐句比对正文与raw/原始材料,如果发现“未经核实的孤证”或“情绪化修饰词”,直接打回重算。
sequenceDiagram autonumber actor Editor as 人类编辑 participant Gen as 生成器 Agent (Generator) participant Eval as 评估器 Agent (Evaluator) participant Human as 人工复核终审
Editor->>Gen: 提交采编任务工单与原始资料 loop 循环迭代至达标 (最多 3 次) Gen->>Eval: 提交生成的结构化草稿 Eval->>Eval: 对照验收量规与避坑库比对 alt 存在无信源推断或格式漏洞 Eval-->>Gen: 驳回!附带具体错误定位与修改指令 else 满足全部验收判据 Eval->>Human: 提交高可信候选稿与事实核查溯源表 end end Human->>Human: 终极价值把关与事实可署名终审第四小节:在 WorkBuddy 中落地端到端流水线与把关卡点
Section titled “第四小节:在 WorkBuddy 中落地端到端流水线与把关卡点”1. 编写流水线复合 Skill
Section titled “1. 编写流水线复合 Skill”我们将在 WorkBuddy 中落地一个真实工业级的复合技能——采编一体化事实清洗与大纲生成流水线(news-chain)。在项目根目录下新建 .workbuddy/skills/news-chain/SKILL.md:
---name: news-chaindescription: "融合新闻采编流水线复合技能。实现从一手调查原始素材到结构化事实核查表与多模态大纲的自动编排,内置评估器自查逻辑。"parameters: type: object properties: raw_source: type: string description: "原始素材文件路径(如 raw/interview.md)" output_dir: type: string description: "输出保存目录,默认 output/" required: - raw_source---
# 角色定义你是严谨的调查记者兼新闻流水线工程师。你严格根据用户提供的输入材料工作,严禁任何形式的推测或虚构。
# 阶段一:事实原子化提取(Extractor)1. 逐行读取输入文件,提取核心事实三元组:【时间/主体/具体动作或数字】。2. 提取至少 3 段具有代表性且语义完整的受访者原话,保留原始语流痕迹,不得文学化润色。3. 将不确定、模糊或存在前后矛盾的信息单独列为【存疑事实清单】。
# 阶段二:多模态内容策划(Synthesizer)基于阶段一提取的确凿事实,设计一套融媒体产品骨架:- **核心新闻冲突**:一句话概括核心利益或观念分歧。- **叙事节拍(三幕式)**:开头设疑悬念、中段矛盾交锋、尾段公共价值留白。- **多模态视听建议**:指明哪些部分使用数据图表、哪些部分使用现场实景原声。
# 阶段三:自动化严谨度质检(Evaluator)对照以下规则自检,任何一条不符必须在正文末尾红字自纠:- [ ] 所有出现的数字是否能在输入文件中定位行号?- [ ] 是否存在把“个别受访者意见”偷换为“普遍现象”的词汇?- [ ] 是否给出了至少一条尚待人类记者现场实地补充核实的问题?
# 产物规范结果必须保存为 Markdown 格式,严格存放于指定输出目录,文件命名为 `fact-pipeline-result.md`。2. 刚性的人工复核卡点(Human-in-the-loop Gatekeeping)
Section titled “2. 刚性的人工复核卡点(Human-in-the-loop Gatekeeping)”自动化编排不是“全自动无人驾驶”。在流水线运行完毕后,人类记者必须在以下三个卡点进行签字画押:
- 输入卡点:原始素材是否已脱敏?录音转录文本是否存在语音识别同音字错误?
- 中间卡点:评估器指出的【存疑事实清单】,必须由记者重新打电话或现场确认,不可让 AI 自行“圆场”。
- 输出卡点:在成品发布前,完成可署名验收,将核对记录写入
audit-log.md。
实践示例:非遗传统手艺工业化调查报道流水线
Section titled “实践示例:非遗传统手艺工业化调查报道流水线”甘肃兰州牛肉拉面正在经历预包装工业化与全球连锁化浪潮。团队获取了一份真实的店主现场采访记录与行业统计摘要,存放在 raw/ramen-interview.md。需要通过 WorkBuddy 运行 news-chain 编排流水线,生成高可信事实表并完成人工核查。
步骤 1:准备一手输入材料 raw/ramen-interview.md
Section titled “步骤 1:准备一手输入材料 raw/ramen-interview.md”在个人项目根目录下创建该文件,填入具有真实矛盾的原材料:
# 兰州牛肉面老字号马老板访谈笔录 (2026-09-08 现场记录)- 记录人:融媒体实训第 2 组 记者李华- 现场地点:兰州市城关区某老字号拉面馆后厨- 核心原话录音整理: 1. 马老板:“预包装面那不叫牛肉面,那是牛肉味的拉条子!汤没有牛骨现熬六小时的骨髓油香,蓬灰水比例差一分,面剂子拉出来的筋道就全塌了。” 2. 马老板:“但你不得不承认,我们店一天撑死卖 1200 碗,房租一个月三万八,人工五个师傅要两万五。年轻人嫌后厨热、苦,没人愿意学大宽和二细。人家预包装工厂一条线一天出 5 万包,直接卖到欧洲去。”- 行业公开数据(兰州牛肉拉面行业协会 2025 年报摘要): 全市实体门店约 3800 家,年总营业额约 120 亿元;预包装工业化产值连续三年增速超 35%,2025 年突破 80 亿元。步骤 2:在 WorkBuddy 中下发流水线任务工单
Section titled “步骤 2:在 WorkBuddy 中下发流水线任务工单”新建 tasks/task-ramen.md:
# 任务工单:运行拉面调查流水线- 目标:提炼核心事实、构建融媒体报道大纲并执行事实自查。- 输入:`@raw/ramen-interview.md`- 技能:调用 `.workbuddy/skills/news-chain/SKILL.md`- 输出路径:`output/fact-pipeline-result.md`- 验收硬标准:必须精确保留马老板原话中的具体工时、数字与矛盾,自查清单逐项核对。在 WorkBuddy 对话框发送:
“使用 Select Folder 确认当前工作区,读取
@tasks/task-ramen.md并执行。”
步骤 3:查看产物与人工核验纠错
Section titled “步骤 3:查看产物与人工核验纠错”打开生成的 output/fact-pipeline-result.md,重点核对:
- 是否如实保留了“实体店日均 1200 碗”与“工厂日均 5 万包”的对比?
- 是否存在虚构“马老板最后痛哭流涕”等文学化煽情?
- 在
audit-log.md中记录核验结果,确认无误后进入下一步视频脚本分镜制作。
- 基础练习(Wiki 三层卡片解构):
从学校官网或权威媒体选取一篇关于“大学毕业生就业结构变迁”的权威调研报告,在个人项目
wiki/目录下亲自动手拆解并编写 1 张概念卡、1 张配方卡和 1 张避坑卡,卡片之间建立至少 2 处[[wikilink]]双向链接。 - 进阶练习(五要素工单编写与防幻觉测试): 挑选一个包含复杂统计表格的新闻原材料,编写一份严谨的五要素任务工单。故意在工单中留出一个漏洞(如不指定输出文件格式),观察大模型输出的失控状态;再补全五要素约束重新测试,对比前后差异。
- 综合练习(端到端编排与对抗校验):
在 WorkBuddy 中部署并运行
news-chain复合技能。利用你所在小组的真实账号素材跑通全流程,人工找出生成结果中至少一处被 AI 夸大或推论过度的地方,在audit-log.md中记录你的纠错过程与最终通过裁决。
- 知识筑底:拒绝二手网络垃圾,一手文献通过概念卡、配方卡、避坑卡实现原子化沉淀与双向链接织网。
- 精准工单:五要素(Goal、Input、Steps、Output、Acceptance)是消除大模型幻觉与格式漂移的工业铁律。
- 三大范式:复杂采编业务通过链式(顺序因果)、路由(分流派发)与评估—优化器(对抗自查)进行工程编排。
- 人在回路:流水线负责提高信息清洗与初排效率,人类记者在输入端、存疑端与终审端牢牢占据把关卡点。
- Anthropic (2024). Building Effective AI Agents — 深入理解链式、路由、并行与评估器等 Agent 现代编排范式的官方权威指南。
- Ahrens, S. (2017). How to Take Smart Notes — 卡片盒笔记法(Zettelkasten)原著,指导如何将离散文献解构为高价值知识网络。
- Sweller, J., et al. (2019). Cognitive Architecture and Instructional Design: 20 Years Later — 认知负荷理论最新综述,深入理解分层拆解与工作记忆保护的心理学机制。
- Shoemaker, P. J., & Vos, T. P. (2009). Gatekeeping Theory — 理解把关人在多源信息流动与公众信任中的核心地位。
- Tencent WorkBuddy 技能开发与多智能体协同参考 — 核对复合任务下发、上下文注入与结果面板多视图检查。