汇报顺序:
硕 3: 周书发 → 文柘青 →
硕 2: 李浩铭 → 管明露 → 李山岚 →
硕 1: 王硕 → 朱丹晨 → 马婧怡 →
准硕 S2026: 南迪柯 → 杨瑞豪
注:本期组会记录由 Claude Opus 4.7 基于录音转文字稿与各位同学的历史组会档案归纳整理。文章按每位汇报同学分节,包含「研究历程」「本次要点」「下次预期」「AI 实操建议」四部分。可能存在由音频转换、AI 幻觉造成的错误(特别是 AI 实操建议节中的论文 DOI、工具名、政策文件号),请阅读时甄别,以实际组会过程中的表达为准。
2026-08-06 组会记录
本期讨论 6 位(按汇报顺序)
- 🎯 管明露:专利样本去重、新兴技术展示与 DID 对照组设计
- 🎯 李山岚:多期 DID 初步结果、平行趋势与机制变量筛选
- 🎯 朱丹晨:双试点联合效应与城市绿色创新效率选题
- 🎯 王硕:结题报告自动目录、编号体系与合稿排版
- 🎯 马婧怡:论文题目用词、研究主线与指标体系取舍
- 🎯 南迪柯:层次聚类、动态主题模型与自有数据试验
🎯 一、管明露:专利样本去重、新兴技术展示与 DID 对照组设计
📚 研究历程
管明露的小论文从集成电路专利主题识别起步,逐步形成了 BERTopic、层次主题模型、新兴度评价和成熟度惩罚相结合的技术路线。经过论文修改、会议汇报和专家意见回应之后,她的关注点已经从“算法能不能运行”转向“样本边界、指标含义和识别结果能不能经得起追问”。
大论文沿着“先识别新兴技术、再评估政策影响”的路径进入企业面板数据阶段。7 月下旬,她已经确定以 121 家集成电路上市公司为主体补充中国专利,并准备把新型技术识别结果汇总到企业—年份层面。本周,约 5.3 万条专利已经下载并完成第一轮去重,研究由数据收集进一步推进到样本规则、结果展示和 DID 分组设计三个更具体的接口。
📝 本次(2026-08-06)
你的汇报(专利处理与政策分组)
- 因智慧芽批量下载受限,改用另一专利数据库,以 121 家集成电路上市公司全称检索到 53,127 条中国公开专利
- 发现同一申请存在“发明申请”和“授权发明”等不同公开阶段,标题、摘要和申请号相同而公开号尾码不同;去重后保留约 3.9 万条
- 用清洗后样本得到 69 个主题,并按年度新兴度得分前 20%标记新兴主题;当前用蓝白二值图展示年度结果
- DID 处理组和对照组仍未定稿:可按主营业务暴露程度在现有企业内部划分,也可补充同属电子行业但非集成电路的上市公司作为对照
林老师指导
- 已经二值化的 0/1 数据不适合继续画热度图;热度图应使用筛选前的连续新兴度得分,最终入文时再用表格呈现入选主题
- 当前主题编号只是中间结果,论文成稿前需要补充准确、可解释的中文主题名称
- 专利申请与授权是同一申请在不同阶段留下的记录;若研究授权结果,原则上优先保留授权版本,但在文本完全一致的大论文试算阶段也可先保留申请版本,关键是固定并说明规则
- 若能够补充同一行业中未被政策直接覆盖的企业,对照组设计会更稳;若暂时只在 121 家内部划分,可尝试把低政策暴露企业记为 0、中高暴露企业记为 1,但必须给出客观标准
⏭️ 下次预期(下一次组会)
- [ ] 提交一张“原始记录—同申请不同公开阶段—最终保留记录”的去重规则表,并报告各规则删除了多少条
- [ ] 用筛选前的连续新兴度得分重画年度热度图,同时整理“主题编号—中文名称—代表专利—入选年份”表
- [ ] 列出两套对照组方案:现有企业内部按政策暴露度划分,以及补充非集成电路电子企业;比较样本量、数据成本和识别风险
- [ ] 对拟补充企业先做小规模检索测试,确认能够复用同一检索、清洗、主题标注和企业—年份聚合流程
🤖 AI 实操建议
① 去重不要只看标题和摘要,要先识别“同一申请的多个公开阶段”
建议在原始表中保留 application_number、publication_number、kind_code、申请日、公开日、授权日和专利类型,再生成一个明确的分析样本标记。可以直接使用下面这张内部规则表:
| 情形 | 识别字段 | 建议动作 | 理由 |
|---|---|---|---|
| 同一申请的申请公开与授权公开 | 申请号相同、kind code 不同 | 原始表都保留,分析表按研究口径留一条 | 两条是不同公开阶段,不是普通重复行 |
| 完全重复导出 | 全部关键字段相同 | 删除重复副本 | 不增加信息 |
| 同族或分案申请 | 申请号不同、文本相近 | 不自动删除 | 可能对应不同权利范围 |
WIPO 的 ST.16 标准说明了尾部字母数字用于区分专利文献种类,可用来核对不同公开阶段。
② 热度图和入选表承担不同任务
热度图回答“同一主题在不同年份的新兴度如何变化”,因此应保留连续分数,并考虑按年份标准化后展示;入选表回答“哪些主题越过了前 20%门槛”,可以使用 0/1 标记。不要把同一份二值结果同时承担趋势展示和最终筛选两个任务。
③ 对照组先写资格规则,再下载数据
可以先建一张候选企业表:公司名称、证监会行业代码、集成电路主营业务占比、是否可能享受政策、数据可得性、是否纳入。处理状态必须由政策前或政策资格信息决定,不能因为某家公司政策后新兴专利增长较少,就把它划进对照组。
⚠️ 风险预警
- 仅凭公开号尾码直接删除记录,可能误删同一申请的不同法律阶段;必须保留原始表和删除日志
- 用人工阅读主营业务划分高低暴露度时,需双人复核或设置可重复的编码规则
- 补充对照企业后,若检索式、专利类型或年份口径与处理组不同,会把数据口径差异误当成政策效应
🎯 二、李山岚:多期 DID 初步结果、平行趋势与机制变量筛选
📚 研究历程
李山岚的大论文经历了从 GPU 技术融合、区域算力创新到城市算力技术创新的多轮收束,最终形成“人工智能创新发展试验区政策—城市算力技术创新”的多期 DID 主线。6 月以来,她完成了算力专利检索、约 17 万条中国样本清洗、城市匹配和六项指标构建,并用熵权 TOPSIS 合成了第一版被解释变量。
7 月下旬,研究开始从指标工程进入实证检验:政策城市、建设年份、控制变量和城市—年份面板陆续对接。本周已经跑出第一版相关性、多重共线性和事件研究结果。当前最重要的信号不是“有没有三颗星”,而是现有平行趋势和政策后系数尚未形成清晰、稳定的识别结果,需要先判断问题来自处理时间、样本结构、变量口径、模型设定,还是政策本身确实没有预期效果。
📝 本次(2026-08-06)
你的汇报(基准回归与机制变量)
- 整理了试验区城市及建设年份,采用多期 DID,并从同类政策创新论文中筛选控制变量
- 当前相关性结果较显著,多重共线性未见明显问题;但平行趋势或事件研究输出没有支持预期的政策后显著影响
- 准备尝试变量变换、控制变量组合和其他合理设定,判断结果能否稳定
- 初步考虑高层次人才集聚和政府干预等中介变量;调节效应暂不作为主任务,待基础结果成立后再决定是否增加
林老师指导
- 原始变量处理、控制变量选择和模型设定仍有多种合理方案,可以做系统尝试,但每种调整都要回头判断理论和统计上是否成立
- 可把批量遍历模型的工具作为诊断入口,查看哪些设定会改变结果,再决定哪些方案具有实质依据
- 现阶段先把最基础的政策效应跑清楚,不急于叠加中介和调节模型
- 高层次人才集聚作为传导机制较直观;“政府干预”容易与试验区政策本身重叠,如保留应收窄为财政科技支持等更明确的变量
⏭️ 下次预期(下一次组会)
- [ ] 导出完整事件研究表和图,分别标记政策前系数、当期系数和政策后系数,确认究竟是前趋势不平行还是政策后效应不显著
- [ ] 核对每个试点城市的处理年份、是否重复入选、样本缺失和事件时间编码,并人工抽查至少 5 个城市
- [ ] 建立“主规格—合理替代规格—仅用于诊断的规格”清单,为每次变换写明理论理由,不以显著性作为唯一筛选标准
- [ ] 核实高层次人才集聚与财政科技支持的数据来源、年份覆盖和城市口径,暂缓正式中介检验
🤖 AI 实操建议
① 先把两个问题拆开:前趋势是否成立,政策后效应是否存在
“平行趋势没通过”和“政策实施后不显著”不是同一个结论。建议做一张事件时间检查表:
| 检查项 | 需要回答的问题 |
|---|---|
| 政策前系数 | 是否整体接近 0,联合检验是否拒绝平行趋势 |
| 政策当期 | 是否存在提前实施、公告期或建设期 |
| 政策后系数 | 方向是否一致,置信区间是否过宽,是否可能存在滞后 |
| 样本量 | 每个事件时间点还有多少处理城市和对照城市 |
如果只是政策后置信区间很宽,可能是统计功效不足;如果政策前已经出现系统趋势,就要优先检查处理组和对照组是否可比,而不是直接加变量。
② 把“一键显著”改造成规格敏感性检查
可以让程序遍历少量事先允许的方案,例如 Y 值的两种成熟口径、控制变量的理论分组、事件窗口和极端值处理,但要保留全部结果。最终主模型应由理论和数据生成过程决定,而不是从几十个模型中挑一颗星最多的模型。
多期 DID 和平行趋势预检可对照 Callaway 与 Sant’Anna 的 did 方法文档。
③ 中介变量先画因果位置图
可先写成:试验区政策 → 人才吸引/财政科技支持 → 算力技术创新。每个候选中介都回答三问:政策能否改变它?它能否影响算力创新?它是否其实属于政策处理本身?“政府干预”如果只是财政支出强度,可以改名为“地方财政科技支持”,并明确不是再次用一个政策虚拟变量解释另一个政策虚拟变量。
⚠️ 风险预警
- 为了显著而反复更换控制变量、样本和变换方式,会形成选择性报告风险
- 政策实施后才变化的变量若直接作为控制变量,可能截断真实政策效应
- 分期实施政策若只使用传统双向固定效应,需额外检查异质处理效应和权重问题
🎯 三、朱丹晨:双试点联合效应与城市绿色创新效率选题
📚 研究历程
朱丹晨前期的主线是后 Transformer 时代新兴技术弱信号识别,围绕 BERTopic、多源数据融合和新颖性、关注度、成长性等属性积累了较多数据与方法经验。进入大论文选题阶段后,她开始主动把研究问题拉回公共管理领域,从城市创新韧性、政策冲击和 DID 设计中筛选可落地的题目。
6 月以来,她逐渐聚焦到两个政策试点的联合影响:一项是 2016 年“互联网+政务服务”试点,用来刻画政府数字化转型;另一项是分批推进的低碳城市试点,用来刻画环境规制。相比上次只提出候选题,本周已经补出了研究意义、双试点与单试点比较、政策实施顺序、中介机制和城市异质性等论文模块,但“协同”概念是否成立、结果变量选创新还是创新效率、数据是否可得,仍需在正式收集前锁定。
📝 本次(2026-08-06)
你的汇报(双试点选题框架)
- 拟研究政府数字化转型与环境规制共同实施对城市绿色创新效率的影响,分别以“互联网+政务服务”和低碳城市试点作为政策冲击
- 已找到两类政策分别影响城市绿色创新的文献,并准备比较双试点城市、单试点城市和未试点城市,同时讨论政策实施顺序
- 计划在基准结果之后补充传导机制、城市规模异质性和因地制宜的政策建议
- 被解释变量仍在“绿色创新数量”和“绿色创新效率”之间取舍:前者常用绿色发明与实用新型专利衡量,后者需要用 DEA 处理多投入、多产出
林老师指导
- 题目总体逻辑可以继续推进,但必须说清楚政府数字化转型、环境规制与城市绿色创新之间为什么形成一条完整关系链
- “协同”不能只表示两个政策同时存在,需要说明两者如何互补;如果暂时只能证明政策叠加,题目表述也要相应收敛
- 文献新颖性不能只看近两年的论文,应追溯最早的相似研究,判断这个题目究竟新在哪里
- 下次先展示完整论文结构和书面理由,同时提前核查城市绿色创新效率的测度方法、投入产出指标及数据可得性
⏭️ 下次预期(下一次组会)
- [ ] 写一页机制说明,分别解释数字化转型的作用、环境规制的作用,以及二者为何可能互补而非简单相加
- [ ] 做一条相似研究时间线:最早研究、代表性研究、2024-2026 年新研究,并标出企业层面与城市层面的差异
- [ ] 比较“绿色创新数量”和“绿色创新效率”两套 Y 值方案,列出公式、数据字段、年份覆盖和缺失风险
- [ ] 画出论文目录与实证路线图,明确双试点、单试点、实施顺序、机制和异质性各自回答什么问题
🤖 AI 实操建议
① 先决定题目用“协同效应”还是“联合政策效应”
如果只能证明双试点城市比未试点城市表现更好,最稳妥的表述是“联合政策效应”或“政策叠加效应”。要使用“协同”,至少需要一条可检验的互补逻辑,例如:数字化政府提高环境信息获取、跨部门协调和政策执行精度,环境规制则把这些治理能力转化为企业与城市的绿色创新压力和需求。
一段可直接修改的研究问题表述:
本文关注政府数字化转型与环境规制的联合实施能否提升城市绿色创新效率,并进一步检验数字化治理能力是否通过改善环境政策的信息基础与执行效率,放大低碳试点的创新激励作用。
如果后半句暂时没有文献和变量支撑,题目就先不用“协同”。
② 把 Y 值选择变成数据审计,而不是偏好选择
绿色创新数量方案需要城市—年份绿色专利口径;绿色创新效率方案除绿色专利产出外,还需要研发人员、研发资本或财政科技投入等投入指标,并处理 DEA 对样本、极端值和前沿面的敏感性。先抽 10 个城市、5 个年份做一张小样本表,能填齐再决定用效率。
③ 双试点设计先固定四类城市
建议显式标记:未进入任何试点、仅数字政务试点、仅低碳试点、两个试点均进入。然后再为双试点城市记录先后顺序和首次同时处于政策状态的年份。处理时间和对照组选择可对照多期 DID 方法文档。
⚠️ 风险预警
- “A 对 C 显著、B 对 C 显著”不能自动推出 A 与 B 存在协同
- 低碳试点分批实施、数字政务试点时间不同,若处理时间编码不清,会把先后顺序效应混进主结果
- 城市绿色创新效率研究较少可以构成场景贡献,但不能替代理论贡献和数据可行性
🎯 四、王硕:结题报告自动目录、编号体系与合稿排版
📚 研究历程
王硕的存算一体小论文已经走过企业筛选、BERTopic 主题识别、TOE 框架、fsQCA 组态分析、会议反馈和投稿前修改等阶段。与此同时,他持续参与国社科结题材料的合稿与排版,负责把多位成员提供的章节、图表、参考文献和格式要求整合进同一份可维护文档。
7 月下旬,他已经按照学校模板处理标题层级、正文样式、缺失图件和匿名投稿版。本周的工作进一步从“把格式改对”升级为“让格式可以自动维护”:正文前后使用两套页码,目录、图目录和表目录使用自动域,四级标题使用自定义多级编号。只要样式、题注和分页规则稳定,后续合稿就可以通过更新域自动联动,而不必逐页手改。
📝 本次(2026-08-06)
你的汇报(自动化排版与合稿)
- 已搭建目录、图目录和表目录,并设置为可更新域;正文前使用罗马数字页码,正文使用阿拉伯数字页码
- 图目录已经预留题注接口,后续插图后可自动绑定章节编号;表格样式也开始统一
- 删除中英文摘要中与实际报告不一致的访谈描述,并用分页符保证摘要和章节从新页开始
- Word 缺少现成四级标题格式,已用自定义多级列表实现“4.4.2.1”等编号,并验证增删章节后可联动更新
林老师指导
- 自动编号方案可直接复用于后续大论文排版;还需排查正文中未两端对齐的段落
- 当前缺失内容主要来自成员尚未提交的章节与图表,老师将继续催办;收到后按既定合稿顺序整合
- 表格样式只要全文统一即可,但必须做打印检查,避免边框、宽度或分页在纸面上出现问题
- 图表名称、正文引用和实际论文内容必须一致;每章另起一页,后续统一使用分页符处理
⏭️ 下次预期(下一次组会)
- [ ] 接收并整合李浩铭的内容和缺失图表,再衔接李山岚修改第一章,保留清晰的版本号与合稿日志
- [ ] 统一标题样式、多级编号、正文两端对齐、题注样式和章节分页,并检查是否存在手工编号
- [ ] 在副本中执行一次“全选—更新域”,核对目录、图表目录、交叉引用、页码和四级标题是否同步
- [ ] 导出 PDF 并抽查打印效果,重点检查宽表、跨页表格、图题位置和每章起始页
🤖 AI 实操建议
① 把文档结构固定为“样式—编号—题注—目录”四层
一级到四级标题只通过样式连接多级列表,不直接敲编号;图题和表题只通过“插入题注”生成;目录和图表目录只读取这些样式与题注。这样章节移动后,编号、交叉引用和目录才能一起更新。
Microsoft 的图表目录说明建议先为图表添加题注,再生成图表目录,内容移动后使用“更新整个目录”。
② 不要用空行控制版面
表格前后“空一行”如果靠回车实现,后续分页时容易多出空白页。建议把间距写进表题、表后正文或专用段落样式;每章另起一页则在一级标题样式中设置“段前分页”,比逐章插入手工分页符更稳定。
③ 每次合稿按固定顺序验收
推荐顺序:保存版本副本 → 检查样式异常 → 更新全部域 → 更新图表目录 → 检查交叉引用 → 导出 PDF → 抽查打印。内部可留一张“对象—来源—当前位置—状态”表,尤其记录缺失图件由谁提供、最终放在哪一节。
⚠️ 风险预警
- 多级编号若与标题样式脱钩,复制其他文档内容后容易突然从 1 重新开始
- 全选更新域前必须留副本,避免旧的手工引用或异常域在更新后难以恢复
- 屏幕显示正常不代表打印正常,宽表、浅色边框和跨页表头必须在 PDF 或纸面复核
🎯 五、马婧怡:论文题目用词、研究主线与指标体系取舍
📚 研究历程
马婧怡一直在政策文本、专利文本和新能源汽车技术演化之间寻找稳定的公共管理问题。她先后整理过中美政策文本、动力电池与固态电池政策,也精读过政策文本与专利文本相似度研究。6 月以后,方向逐渐收束为产业政策如何影响企业技术创新,并计划用 DID 建立因果识别框架。
7 月的核心争论是题目中的概念究竟叫“治理效应”“导向效应”“激励效应”还是更中性的“影响”,以及处理组如何用政策前信息客观划分。本周她进一步意识到,“激励效应”通常更容易让人联想到专利数量等创新产出,而自己的特色可能在政策与专利文本内容的匹配。与此同时,中美同一企业专利对比又引出了“策略性迎合”这一新问题。最终,本周做出的关键决定是先保留传统 DID 主线,不把两套识别逻辑强行塞进一篇论文。
📝 本次(2026-08-06)
你的汇报(题目与研究路径取舍)
- 讨论大论文题目是否使用冒号,并准备调整语序,使研究对象和核心关系在主标题中直接呈现
- 认为“激励效应”与当前以专利文本内容为主的测度不完全匹配;“政策导向”虽然贴近想法,但缺少成熟文献支撑
- 比较标杆论文后提出一个新方向:对比同一企业在中国和美国申请的专利文本,观察企业是否可能策略性贴近政策目标
- 意识到“策略性迎合”与当前传统 DID 主线存在逻辑冲突,最终选择先推进 DID,并开始准备论文大纲和指标体系
林老师指导
- 大论文题目尽量不用冒号拆成两段,可通过调整语序把研究对象、政策和结果变量放进一个完整题目
- 题目用词应采用领域内已有、含义稳定的概念;“政策导向”如果没有文献依据,不宜为了追求新颖而自行创造
- 传统 DID 与跨国专利文本“策略性迎合”回答的是不同问题,应二选一作为主线;既然选择 DID,就不要让美国数据继续牵动当前框架
- 指标体系不能只模仿一篇顶级期刊论文;参考文献只需在指标大类上提供依据,不要求研究方法与自己的设计完全一致
⏭️ 下次预期(下一次组会)
- [ ] 提交一版完整论文大纲,每章写明研究问题、数据、变量、方法和预期输出
- [ ] 建立指标体系表,列出政策处理、结果变量、机制变量、控制变量的定义、计算方式和文献来源
- [ ] 扩充标杆文献库,至少覆盖“产业政策影响”“专利文本测度”“企业创新 DID”三个方向,不再依赖单篇论文
- [ ] 将中美专利与“策略性迎合”想法单独写入备忘录,保留数据和研究问题,但不放进当前 DID 主线
🤖 AI 实操建议
① 先用一句话钉住 DID 到底识别什么
可以先写:
本文识别新能源汽车产业政策实施后,高政策暴露企业相对于低政策暴露企业,其专利技术方向与政策目标的贴近程度是否发生更明显变化。
如果这句话成立,结果变量就可以是政策文本—专利文本相似度或目标技术专利占比,“影响”比“激励效应”更稳妥。若结果变量改成专利数量、发明专利占比或被引水平,再考虑使用“创新激励效应”。
② 指标体系先做成五列表
| 变量角色 | 概念 | 操作化 | 时间窗口 | 文献依据 |
|---|---|---|---|---|
| 处理变量 | 政策暴露 | 政策前目标技术专利占比或预先确定的资格 | 仅政策前 | 待补 |
| 结果变量 | 技术方向变化 | 政策—专利文本相似度 | 政策前后 | 待补 |
| 稳健性结果 | 创新产出 | 专利数量、发明占比等 | 政策前后 | 待补 |
这样可以立刻检查题目中的每个词有没有一个真正对应的变量。
③ 把“策略性迎合”视为另一篇论文的起点
中美同一企业专利文本对比很有意思,但它需要回答企业为何在不同制度环境中改变文本、申请主体如何匹配、同族专利如何排除、迎合与真实研发变化如何区分。这已经是一套新的理论和识别设计。把它单独保存,比在 DID 论文末尾加一个解释不清的补充检验更有价值。
多期 DID 的设计与平行趋势检查可先参考 did 方法文档。
⚠️ 风险预警
- 题目使用“影响”,也仍需明确影响的是专利数量、质量还是技术方向,不能只靠中性词掩盖变量不清
- 政策暴露度必须由政策前信息构造,不能用政策后文本贴近度反向划分处理组
- 美国数据已经投入过精力不等于必须放进当前论文,避免让沉没成本破坏主线
🎯 六、南迪柯:层次聚类、动态主题模型与自有数据试验
📚 研究历程
南迪柯在完成本科论文答辩后,开始系统补充文本分析方法。从 LDA、困惑度曲线,到 Sentence Transformers、BERTopic 和主题可视化,她的学习路径已经从理解概念逐渐转向独立配置环境、运行代码、保存结果和解释输出。
7 月中旬,她已经生成主题条形图、主题地图和散点分布,并准备继续层次聚类等教程实验。本周又推进到层次聚类和动态主题模型,同时补充 BERT 等基础理论。方法菜单正在变得丰富,下一步真正重要的是把教程数据换成一份自己理解的文本,检验从输入、向量、聚类、主题表示到时间演化的整条链路能否稳定复现。
📝 本次(2026-08-06)
你的汇报(算法学习与实验推进)
- 继续完成层次聚类、动态主题模型等教程实验,并同步学习 BERT 等文本表示理论
- 已经能够在现有示例和环境中推进多种主题分析与可视化步骤
- 当前工作仍以教程数据和教程流程为主,尚需用自有数据验证方法是否真正可迁移
林老师指导
- 继续把相关实验往下推进,保持已有环境和代码流程稳定
- 尽快替换一份自己的数据进行测试,不只以教程运行成功作为学习完成的标准
- 用自有数据观察模型是否能给出可解释的主题、层次结构和时间变化,再判断哪些方法适合后续研究
⏭️ 下次预期(下一次组会)
- [ ] 选择一份规模可控、内容熟悉且带时间字段的自有文本,说明数据来源、字段和预处理方式
- [ ] 用同一份数据完成向量化、聚类、主题表示、层次结构和动态主题分析,保存代码、参数与中间结果
- [ ] 为每项输出写一段解释:它回答什么问题、图中元素代表什么、结果是否符合原文
- [ ] 固定当前 Python 环境,导出依赖版本和运行命令,避免教程更新或包升级导致流程失效
🤖 AI 实操建议
① 用“只换数据、不换流程”的方式做第一次迁移
第一次换自有数据时,先保持模型、参数和代码步骤不变,只替换 documents 和 timestamps。如果结果异常,才能判断主要问题来自数据。第二轮再调整最小主题规模、时间分箱或向量模型,避免一次改变太多条件。
② 做一张最小实验记录表
| 项目 | 本次记录 |
|---|---|
| 文档数量与时间范围 | 多少篇、覆盖哪些年份 |
| 向量模型 | 名称与版本 |
| 聚类参数 | 最小簇规模、离群点数量 |
| 主题数量 | 调整前后各多少 |
| 时间分箱 | 每箱文档数是否足够 |
| 人工抽查 | 每个主题抽 5 篇原文是否一致 |
这张表比只保存图片更重要,因为它能说明结果是如何产生的。
③ 动态主题模型先理解“主题不重新聚类”
BERTopic 的 topics_over_time 是在已有全局主题基础上,按时间计算主题表示变化;它不等于每年独立训练一个全新模型。可对照动态主题模型官方示例。如果年份很多、每年文本很少,可先合并为较少的时间箱。
⚠️ 风险预警
- 教程数据跑通不等于自有数据能产生有效主题,必须回到原文抽样验证
- BERT 或 Sentence Transformers 提供文本表示,不等于它们自动完成了主题建模
- 时间箱过细会让少量文档的偶然词频看起来像“主题演化”
散会
本周六位同学看似分别在处理专利、DID、选题、Word 和主题模型,实际都遇到了同一个问题:中间结果已经出现,但还不能让结果替代研究设计。管明露要区分连续得分与最终入选,李山岚要区分平行趋势与政策后效应,朱丹晨要区分联合实施与真正协同,王硕要让格式依附于样式和域,马婧怡要让题目用词对应真实变量,南迪柯则要让教程输出接受自有数据检验。
下一次组会最值得期待的,不是更多“跑出来的结果”,而是六个可以复核的接口:一套专利去重规则、一张事件研究诊断表、一页双政策机制说明、一份可自动更新的合稿、一张变量指标体系,以及一次只替换数据的完整复现实验。
🎭 本周彩蛋
📢 本周金句
“零一数据不适合画热度图。”
一句很具体的制图意见,背后却是通用的方法原则:展示方式必须保留数据真正拥有的信息。连续得分能讲高低变化,0/1 结果只能讲是否入选;如果先把信息压扁,再用颜色装回去,图再漂亮也不会增加证据。
🧠 本周新词,一句生活化类比
- 专利文献种类代码:像同一份申请在受理、公开、授权阶段盖上的不同印章,尾码不同不一定是两项不同发明。
- 平行趋势:像两辆车在比赛前应大致同速;如果发令枪响前一辆已经加速,赛后差距就不能全算作政策作用。
- 联合政策效应:像两味药一起服用后的总体效果;只有证明它们相互增强,才能进一步称为“协同”。
- Word 域:像文档里的自动公式,章节和页码变化后重新计算,比手工改目录可靠得多。
- 动态主题模型:像追踪同一支球队各赛季战术如何变化,而不是每年把所有球员重新分成一支新队。
🔮 下周占卜
基于本周轨迹,纯属虚构;如有雷同,纯属命中注定。
- 管明露会在 53,127 条专利组成的双重门廊里辨认 A 与 B 的印章。她不再让蓝白格子假装有温度,而是召回连续得分,给 69 个主题逐一领取中文姓名。
- 李山岚会驾驶多期 DID 列车回到政策发生前。每一站都要检查两条轨道是否平行;“一键显著”在终点挥舞广告牌,但她只收下完整规格表,不购买单程星号票。
- 朱丹晨会让数字政务与低碳试点坐到同一张谈判桌前。两个政策必须先说清各自能做什么、为何彼此互补,城市绿色创新效率才肯在论文标题上签字。
- 王硕会成为 Word 王国的域法师。四级标题、图目录和罗马页码在按下更新键后自动归位,只有一张超宽表格试图从打印边界偷偷逃走。
- 马婧怡会把“激励”“导向”“影响”三个词放到变量秤上。美国数据在远处挥手,但被妥善送进下一篇论文的保险箱,当前 DID 主线终于只剩一个方向。
- 南迪柯会把教程数据请下舞台,让自己的文本第一次登场。层次聚类搭起树屋,动态主题沿时间轴点亮灯串,而她拿着原文样本逐盏检查:这盏灯究竟照见了什么。
林超然 · 整理于 2026-08-06