课程实地项目 · 实操手册

六类任务,AI 与 Agent 怎么用

下面每一条都是可以直接复制、粘贴、跑通的指令。区分一件事:普通 AI 聊天只会给你一段文字,Agent 会直接帮你把活干完——读你的录音、跑转写、生成文件、按时提醒你缺什么。本页示例以 WorkBuddy 为主,另附学生手机端的等价做法。

速查

六类任务 × 工具对照

先找到你的任务在哪一行,再看用哪个工具、产出什么。不必一次全学,用到哪条抄哪条。

任务AI / Agent 干什么主用工具最终产出
① 志愿讲解转写试讲录音、挑出表达问题、打磨讲解词WorkBuddy 本地转录 + 大模型讲解词定稿、表达改进清单
② 人物故事稿史料梳理、成稿、投稿格式校对WorkBuddy + 提示词模板可投稿的 3 分钟故事稿
③ 场馆走读采集生成采集清单、现场速记整理手机豆包 + WorkBuddy采集清单、现场笔记
④ 点位深度访谈提纲生成、批量转录、口述体成稿、核查WorkBuddy 批量处理12 份口述稿 + 核查表
⑤ 数字人对话跨时空脚本、口播稿、分镜大模型 + 数字人工具对话脚本、口播稿
⑥ 成果整合发布汇总成网页 / 文档,生成二维码WorkBuddy单页导览站、投稿包
任务 ①

志愿讲解:把试讲录音变成可改的稿子

学生最容易卡在"我讲得哪里不对"——自己听录音听不出来。Agent 可以把口语转写成文字,逐句指出问题。

试讲复盘

一段 3–5 分钟的试讲录音 → 文字稿 + 3 条具体改进建议 + 打磨后的讲解词
1
Agent 干活步骤
  • 本地转写录音(离线,音频不出本机)
  • 标出口头禅、重复句、逻辑断点
  • 按讲解场景重写出一版能直接念的稿
预计耗时
转写 1 分钟内;成稿 5–10 分钟
直接复制这条指令把音频文件交给 WorkBuddy 后发送
请把这段讲解试讲录音完整转写成文字稿,然后做三件事:

1. 【诊断】逐段标出问题,只标三类:
   · 口头禅与重复(指出具体第几句、重复了什么)
   · 逻辑断点(听众会在哪里听不懂,缺了什么背景没交代)
   · 表达问题(长句、书面语、站著讲不出来的句子)
2. 【改进】给出 3 条改进建议,每条必须引用原文中的具体一句,并给出改写后的版本。不要给"注意语速"这种空话。
3. 【成稿】基于原稿重写一版 3 分钟讲解词,要求:
   · 开场 30 秒有钩子(具体的人、精确数字、或反常识的事实),不许用"大家好今天我来介绍"
   · 单句不超过 25 字,口语化
   · 每 60 秒标一个 [停顿·引导看展品]
   · 结尾回到"今天为什么还要讲这个"

最后把转写稿和改进建议分别存成两个文件。
本地转写免费产出:讲解词 + 改进清单注意:史实另走核查流程
任务 ②

人物故事稿:从史料到可投稿的成稿

这类稿子要对外发表,最大风险是 AI 编造细节。指令里必须写死"不确定就标【待核实】"。

史料 → 讲解稿

零散史料 + 口述草稿 → 一篇结构完整、史实可追溯的 3 分钟故事稿
2
Agent 干活步骤
  • 按"处境 → 选择 → 回望"重组材料
  • 逐条标注史实来源,无法确认的直接标出
  • 输出两个版本:讲解口播版 + 投稿文字版
直接复制这条指令把史料与草稿一起粘贴
请根据我提供的史料和口述草稿,写一篇 3 分钟人物故事稿(约 600 字),用于场馆讲解并对外投稿。

结构:
· 开场 30 秒:一个具体场景或物件切入,不用生平介绍开头
· 中段:一个关键选择或转折,要有细节(时间、地点、动作、对话)
· 结尾:落到"今天为什么还要讲这个人"

硬性约束:
1. 所有年代、职务、地名、数字必须附来源;来源只认权威材料(馆方展陈说明、官方出版物、正式史料)
2. 任何无法在权威来源中确认的内容,一律写【待核实】,禁止补全、禁止合理推测、禁止为了故事完整而虚构
3. 如果两处材料说法矛盾,明确指出,不要和稀泥
4. 语言口语化,单句不超过 25 字

输出两个版本:
A. 讲解口播版(带 [停顿] 标记)
B. 投稿文字版(书面语,800 字内,带标题)

最后附一张核查表:全文出现的所有史实条目 | 是否有来源 | 来源是什么 | 风险等级。
发稿前必做:把核查表里每一条"无来源"的内容查实或删掉。AI 生成的年代和职务是最高频的出错点,一次也不能放过。
任务 ③

场馆走读采集:出发前先拿到清单

学生到现场最容易"不知道拍什么、问什么",回来素材残缺无法用。出发前让 Agent 出一份清单,手机上看。

采集清单生成

一个场馆 + 一条线路 → 可照做的拍摄清单、提问清单、记录清单
3
直接复制这条指令出发前一天用
我明天要去【场馆名称】做一次走读采集,主题是【主题】,现场时间约 2 小时,只有手机,没有专业设备。
请生成一份现场采集清单,三部分:

1. 【拍摄清单】按参观动线顺序列出 8–12 个必拍镜头,每个注明:
   拍什么 / 横屏还是竖屏 / 是特写还是空镜 / 这段素材后面用在成片的哪里
   其中必须包含:1 个开场用的环境空镜、1 个能体现"古今对比"的对照镜头
2. 【提问清单】给现场讲解员或传承人的 5 个问题,要求:
   从具体物件和动作切入,不问"你觉得怎么样"这类空问题
   每个问题后面标注"追问方向"(对方答得简短时怎么追)
3. 【记录清单】现场必须记下来的信息字段(工艺名称、材料、工序、传承人、年代等),做成可直接勾选的表

补充要求:如果馆内可能不允许拍摄,请提醒我需要先确认什么。
手机可用(豆包/DeepSeek 同样有效)产出:三张清单
回来之后:现场速记整理把手机备忘录里的碎片丢给它
下面是我在现场用手机随手记的碎片笔记,顺序混乱、有错字、有简写。
请整理成一份结构化的现场记录:
· 按"参观动线"重新排序
· 补充每个点的空缺字段,能补的补,补不了的写【需回访】
· 标出哪些内容明显需要核实(年代、人名、数字)
· 最后列出:这次采集还缺什么素材,下次去必须补哪 3 项

笔记如下:
———
(粘贴碎片笔记)
任务 ④

点位深度访谈:一个人负责一个点,批量处理才不会崩

这是工作量最大的一块:多个点位、多段访谈。关键不是"能不能做",而是"能不能一次做一批"——这正是 Agent 比聊天机器人强的地方。

批量转录 + 成稿

一个装满 m4a 的文件夹 → 逐个转写 + 命名归档 + 汇总表 + 口述体成稿
4
指令 A:批量转录归档把整个素材目录交给它
请处理【目录路径】下所有音频文件(m4a/mp3/wav):
1. 逐个转写成文字稿,本地离线处理,不要把音频上传到任何在线服务
2. 输出文件按"点位编号-日期-访谈对象.txt"命名,存到 transcripts/ 目录
3. 同时为每个文件生成带时间戳的 .srt 字幕
4. 全部处理完后,生成一张汇总表 progress.csv,列为:
   文件名 | 时长 | 字数 | 主要说话人数量 | 是否含授权确认语 | 转写质量(好/一般/差) | 备注
5. 凡是"是否含授权确认语"为否的文件,单独列出来提醒我——这些素材暂时不能对外发布

处理过程中如果某个文件失败,不要中断,记录原因后继续下一个。
指令 B:单篇口述体成稿转录完成后逐篇处理
下面是采访【对象身份】的转写稿。请整理成一篇 800 字左右的口述体文章。

要求:
1. 保留第一人称"我",保留受访者原本的说话味道,不要润色成书面语
2. 删掉重复与口头禅,但不改变原意,不添加原文没有的内容
3. 按"当时的处境 → 关键选择 → 今天的回望"三段组织
4. 所有时间、地点、数字原样保留,不要四舍五入、不要换算("1978 年"不许写成"70 年代末")
5. 听不清的地方标【听不清 12:34】,绝不猜测补全
6. 人名、地名、机构名拿不准的标【待核实】

转写稿如下:
———
(粘贴转写文本)
指令 C:访谈提纲(采访前用)30 分钟访谈的标准配置
我要采访一位【受访者身份】,时间 30 分钟。受访者背景:【一句话介绍】。
目的是做一条口述素材,最终剪成 3 分钟视频 + 一篇文字稿。

请生成一份访谈提纲:
· 开场破冰 3 问:从具体物件、场景、动作切入,不问空问题
· 主体 8 问:每问附【追问方向】(对方答得简短时怎么追)
· 收尾 2 问:一个关于未来,一个关于"想对 20 岁的自己说什么"
· 每问标注【素材用途】:这段能剪到成片的哪个位置

约束:
· 不设计诱导性提问,不让受访者背稿,不替受访者总结
· 涉及年代、职务、奖项的问题单独列出,便于事后核实
· 语言口语化,像聊天,不像调查问卷
· 另附:采访开始前必须完成的授权确认话术(一句话,要能录进录音里)
本地转录:16 分钟音频约 1 分钟出稿抢话处说话人可能判错,需人工复核无授权确认的素材不得发布
任务 ⑤

数字人跨时空对话:脚本是难点,不是技术

数字人工具本身不难,难在脚本——让历史人物"开口"说什么、什么不能说。这部分完全可以先用 AI 打磨脚本,再决定要不要花钱做形象。

对话脚本 + 口播稿

史料 → 90 秒跨时空对话脚本 → 数字人口播稿(含口型约束)
5
直接复制这条指令先写脚本,别急着做形象
请写一段 90 秒的"跨时空对话"脚本,用于数字人演绎。双方:

A = 当代大学生,带手机,说今天的口语,有好奇也会迟疑
B = 【历史人物】,只能说史料中确有其事的内容,不确定的地方标【待核实】

结构:
· A 开场提一个现代人真的会好奇的问题(例如"您那时候怎么跟家里联系"),不要问空泛的大问题
· B 回答必须带具体细节——时间、地点、物件、气味,不要说空话
· 三轮来回,每轮都要产生一次具体的"反差"
· 结尾两人各一句,形成对照,不总结、不升华、不喊口号

禁止:
· 让 B 说出她不可能知道的现代词汇
· 让任何一方发表后世视角的历史评价
· 为了煽情虚构情节——宁可短,不可假
配套:数字人口播稿口型同步有约束,写法不一样
请为数字人形象写一段 45 秒口播稿。
角色设定:【历史人物身份】;要讲的事:【一句话概括】

约束:
· 数字人口型同步有限,用短句,每句不超过 20 字
· 避免生僻字、连续叠词、拗口的外文音译
· 停顿处标 [停0.5s],配合手势处标 [手势]
· 只用该人物可能知道的词,不得出现现代概念
· 最后一句留给"画面定格 + 字幕"

同时给出这段口播对应的 3 条画面提示(背景场景怎么搭)。
成本与合规提醒:数字人形象与声音克隆通常按次或按分钟收费,先做 1 个形象跑通再批量;历史人物形象成片必须显著标注"AI 生成";涉及在世人物及其家属的,先取得书面或录音同意。
任务 ⑥

成果整合:把散落素材变成一个能拿得出手的东西

前面所有工作的终点。Agent 的强项在这里最明显——它可以直接生成一个文件,而不是给你一段"你可以这样做"的建议。

产出 1 · 单页导览

点位资料整合站

把所有点位的文字、图片、口播稿合成一个可打开的 HTML,手机上也能看,能直接发给别人。

产出 2 · 投稿包

成稿 + 核查表 + 素材清单

按平台要求打包:正文、图片说明、授权确认记录、史实核查表,一次交齐不返工。

直接复制这条指令素材齐了之后用它收口
请把【素材目录】里的点位资料整合成一个单页 HTML 导览页,要求:

1. 顶部:一条横向时间轴,标出各点位的地理顺序
2. 每个点位一张卡片,包含:
   · 点位名称与编号
   · 200–300 字沿革说明
   · 3 条"古今对比"(要具体到物件,不要空泛说"变化很大")
   · 60 秒口播稿
   · 对应照片(图片路径在素材目录里)
3. 卡片可点开收起,手机竖屏也能正常看
4. 页面底部注明素材来源与"部分内容由 AI 辅助生成,史实已人工核实"
5. 输出一个单独的 .html 文件,双击即可打开,不依赖网络

如果某个点位缺少照片或口播稿,在页面上留占位并标【待补】,不要跳过该点位。

最后告诉我:还缺哪几个点位的什么素材。
配套:短视频分镜要做片子时用
地点:【点位】,时长 60 秒,竖屏 9:16,受众是大学生。
请输出分镜表,每行五列:时间轴 | 画面(具体拍什么)| 口播(每句不超过 15 字)| 字幕关键词 | 音效/音乐

要求:
1. 前 3 秒必须有冲突或悬念,不能是空镜加标题
2. 至少 1 处"古今对比",具体到物件
3. 中间 40 秒最多讲 3 件事
4. 结尾 5 秒给行动号召或留白,二选一
5. 所有史实标注来源,不确定的写【待核实】

点位背景资料:
———
(粘贴资料)
进阶

设成定时任务:让 Agent 自己盯着进度

这几件事不需要你记得做。把下面任意一条设成定时自动化,到点它自己跑,跑完把结果发给你。进度失控是多点位项目最常见的翻车方式,定时任务是最便宜的解法。

每周一 09:00

素材进度巡检

扫描素材目录,列出上周新增文件、缺失项、命名不合规的文件,生成一张进度表发我。谁的点位还没交素材,直接点名。

"检查素材目录,对比点位清单,列出缺失与不合规项,生成进度提醒"
每天 20:00

当日录音自动转写

把当天新增的录音全部转写成文字稿并归档,第二天一早就能看到昨天的素材成稿,不用等、不用催。

"转写今天新增的音频,按规范命名归档,汇总后告诉我哪几段质量差需要重录"
每月最后一天

月报与风险扫描

汇总本月产出(稿件数、字数、成片数),并扫描所有待核实条目是否还挂着——挂太久的史实风险要提前暴露。

"汇总本月产出并列出仍未核实的史实条目,按风险排序"
提醒:自动化只在需要"重复且容易忘"的事上用。采集、访谈、判断史实这些环节不能自动化替代人——机器可以提醒你缺素材,但不能替你去现场。
给不用电脑的学生

手机端等价做法

不是每个人都有电脑,也不是每个人都愿意开电脑。下面三件事手机豆包、DeepSeek 就能做,效果不打折。

场景手机上怎么做
现场记录边走边用语音输入口述所见所闻,结束时让它"整理成结构化现场笔记,标出需要核实的年代与人名"
讲解词初稿把口述笔记粘贴进去,让它"改写成 3 分钟讲解词,开场有钩子,每 60 秒一个停顿点"
拍摄前构思告诉它"我在【地点】,只有手机,要拍 60 秒短视频",让它直接给分镜表,照着拍就行
手机上做不了的三件事:批量转录长录音、生成本地文件与网页、定时任务。这三件交给有电脑的人统一处理——这也正是分组时每组至少要有一个"技术搭子"的原因。
底线

三条纪律,违反一条整个项目白做

纪律一 · 命名

点位编号-姓名-日期-类型.后缀

例:Z03-李萌-20261015-访谈.m4a。每段录音开头先口述"我是谁、今天几号、在哪、采访谁"——30 秒,解决后期认不出谁是谁的问题。

纪律二 · 授权

录音里必须有那句同意

采访开始前录一句:"本次采访用于教学与非商业传播,您是否同意?"对方口头同意即可,但必须有这一句。没有的素材不得发布,批量转录时会自动标出。

纪律三 · 核实

AI 生成 1 分钟,核实 30 分钟

年代、职务、奖项、数字是 AI 最高频的出错点。凡是要公开发的内容,逐条走核查流程;没有来源的一律删掉或标【存疑】,不替它补全。