汇报顺序:
硕 3: 李浩铭 → 管明露 → 李山岚 →
硕 2: 王硕 → 朱丹晨 → 马婧怡 →
硕 1: 南迪柯 → 杨瑞豪
注:本期组会记录由 AI 基于录音转文字稿与各位同学的历史组会档案归纳整理。文章按每位汇报同学分节,包含「研究历程」「本次要点」「下次预期」「AI 实操建议」四部分。若学生或老师在发言中存在可核验的事实、概念或方法错误,AI 实操建议会直接指出并给出更正依据;AI 自身仍可能出错,请以原始材料、方法文献和正式通知为准。
2026-09-09 组会记录
本期讨论 7 位(按汇报顺序)
- 🎯 李浩铭:专利图文信息分解、多模态方案与投稿收尾
- 🎯 管明露:缺失值处理、稳健性检验与研究对象收束
- 🎯 李山岚:平行趋势、安慰剂、PSM 与中期推进
- 🎯 王硕:小论文修改回应与产业链安全开题准备
- 🎯 朱丹晨:双政策协同、绿色创新效率与开题框架
- 🎯 南迪柯:LDA 复现、BERTopic 学习与论文阅读
- 🎯 杨瑞豪:首次汇报、BERTopic 实验与计量基础
🎯 一、李浩铭:专利图文信息分解、多模态方案与投稿收尾
📚 研究历程
李浩铭的小论文围绕创新链—产业链融合与关键核心技术识别展开,已经历主题识别、双层网络构建、链路预测、图件重绘和投稿结构收束等阶段。最近几周,他把原先难以阅读的单层网络图改造成上下分层的双层网络,并增加层间连通性分析、附录图表和关键技术评分表,论文已经接近投稿版本。
与此同时,他开始拓展专利多模态研究。前期重点是辨别 ViT、CLIP 与 DINO 等模型的训练目标;本周进一步把问题明确为:专利图像与文本既有共享信息,也可能各自包含独有信息,还可能存在只有结合二者才能理解的关系信息。研究思路由“找一个更好的图像编码器”推进到“如何定义、分离并验证不同信息成分”,这比单纯选择模型更接近可发表的研究问题。
📝 本次(2026-09-09)
你的汇报(多模态方案与投稿附件)
- 用苹果纹理、机械局部图和视图名称解释图像独有信息、图文共享信息及联合关系信息
- 初步选择 DINO 作为视觉编码器,考虑以 MAE 式遮挡重建保留局部信息,再与文本编码器形成共享和独有分支
- 为现有小论文制作网络图与关键技术评分附件,优化主题名称、跨层节点标注和层间连通性描述
- 计划完成最后检查后投稿,并继续推进大论文数据收集
林老师指导
- 先验证图文联合分支在工程上能否实现;若难度过高,可退回到“图像中超出文本描述的信息”这一仍具增量的研究问题
- 双层网络图要在“完整但看不清”和“清楚但只是示意”之间取得平衡,让读者能够从图中读出实际信息
- 下次向组内演示 Gephi 双层网络的布局、插件和绘图流程,沉淀为可复用方法
- 小论文完成附件和格式核验后尽快结束修改,转入投稿与大论文推进
⏭️ 下次预期(下一次组会)
- [ ] 提交“共享—图像独有—文本独有—联合关系”四类信息的操作定义、正例和反例
- [ ] 用一批专利图文对跑通最小实验,比较 DINO、CLIP 及简单图文融合基线,而不是先搭完整复杂架构
- [ ] 演示 Gephi 双层网络图的输入表、布局参数、层间边标记和导出流程
- [ ] 完成投稿检查表:正文、附件、数据声明、图表编号、英文要素和系统材料逐项核对
🤖 AI 实操建议
① 本次发言纠错:DINO 不是通过“旋转、模糊、切成很多图”来恢复被遮挡图块
DINO 的核心是无标签自蒸馏:教师网络和学生网络接收同一图像的不同视图,使其输出保持一致;多裁剪是训练策略,但“遮住 patch 后重建原像素”是 MAE 的任务。原始方法分别见 DINO 与 MAE。因此方案图要把两种损失分开:DINO 类损失负责跨视图一致性,MAE 类损失负责遮挡重建,不能把二者写成同一原理。
② 本次发言纠错:完成局部重建,不等于已经获得“图像相对文本的独有信息”
MAE 重建成功只能说明表征保留了足以预测缺失像素的信息;这些信息可能与文本语义重合,也可能只是低层纹理,不能自动证明其对专利任务有增量。真正的检验应是条件增量:先用文本完成一个下游任务,再加入视觉表征,观察在时间外或专利族外测试集上是否稳定提高;同时用打乱图文配对、遮蔽标注文字、只保留结构线稿等消融判断增量来自哪里。
③ 先做“可证伪的最小实验”,再讨论共享—独有分解网络
直接可用的实验矩阵是四行:Text only、Image only、CLIP/简单拼接、DINO + Text;三列任务可选分类、相似专利检索和技术关系预测。每个模型统一训练/测试划分并报告增量及置信区间。若 DINO + Text 不稳定优于 Text only,就应先修正“图像提供任务相关新增信息”的前提,而不是继续增加正交损失和残差分支。
④ 图中的“联合关系信息”必须落到可标注对象
例如说明书写“图 3 为驾驶室俯视图”,图像展示部件形状;这一信息确实依赖文本指代和图像内容共同解释。可先人工标注 100—200 个“图号—部件—视角—功能”关系,建立一个小型验证集。如果没有可观察标签,“联合信息”容易只停留在概念图里。
⚠️ 风险预警
- 专利附图中的编号、箭头和文字本身也是文本信号,必须区分 OCR 增量与纯视觉结构增量
- 随机拆分可能让同族专利或高度相似附图同时进入训练集和测试集,造成信息泄漏
- 投稿前继续增加方法会挤压收尾时间,多模态新线与当前小论文应分开管理
🎯 二、管明露:缺失值处理、稳健性检验与研究对象收束
📚 研究历程
管明露的大论文由集成电路新兴技术识别延伸到产业政策效应评估,已完成专利—企业映射、企业年报政策证据定位、错时处理构造及一轮 DID。此前她把处理组从宽松的税率判断收紧到政策名称、文件号和实际适用表述,并陆续完成基准回归、事件研究、安慰剂、PSM-DID 与若干口径比较。
本周工作进一步扩展到缺失值处理、排除其他政策、企业性质和产业链环节异质性。但论文题目仍突出“新兴技术”,主体分析却使用总体技术创新数据,概念与实证的错位尚未解决。眼下最重要的不是继续累加检验,而是冻结主规格、审计数据处理,并决定究竟研究总体技术创新,还是把新兴技术识别真正贯穿全文。
📝 本次(2026-09-09)
你的汇报(DID 完整流程与题目调整)
- 将部分缺失面板变量由前后填充改为线性插值,重新运行基准结果、平行趋势和安慰剂分析
- 增加 PSM-DID、替代专利口径、剔除部分城市以及排除其他政策影响等稳健性分析
- 按产业链环节、企业所有制和产业集群进行分组比较
- 讨论删除题目中的“新兴技术”,或重新识别新兴技术专利并重跑全文主结果
林老师指导
- 现有识别流程对于“全国政策、企业选择性受影响”的处理组构造具有可迁移价值,应把证据链完整保留
- 如果全文主体能够支撑总体技术创新,可以考虑收紧题目,不必为保留一个概念而机械增加章节
- 若新兴技术识别已有较高代码化程度,可先估算工作量并试跑,但不能仅依据结果是否显著决定最终题目
- 中期临近,应优先完成主线闭环,再处理可选扩展
⏭️ 下次预期(下一次组会)
- [ ] 提交缺失值审计表,逐变量说明缺失位置、插值条件、插值比例和不插值样本的结果
- [ ] 形成一页主规格登记表,冻结处理组、结果变量、估计器、标准误、样本期和排除规则
- [ ] 直接检验各分组处理效应之差,并报告系数、置信区间与样本量
- [ ] 对题目做一次“概念—变量—章节—证据”映射,决定总体技术创新版或新兴技术版
🤖 AI 实操建议
① 本次发言纠错:线性插值不天然优于前后填充
二者都在用不可观察年份两侧的信息构造数值,哪一种更合理取决于变量的生成过程。资产、员工数、补贴等企业变量可能发生跳变,线性插值会制造本来不存在的平滑路径;更关键的是,如果插值使用了政策实施后的值,就可能把处理后的信息带回政策前。主结果优先使用观测值完整的样本,插值版作为敏感性分析,并逐项报告插值比例和最长连续缺口。
② “结果仍然显著”不是缺失值方法、排除政策或稳健性检验通过的统一标准
稳健性应判断估计对象和数据处理在合理替代下是否保持方向、量级和不确定性,而不是只看星号。排除其他政策也不能只靠年报关键词:小巨人、高新技术企业等资格应尽量连接官方名单、认定批次与年份,避免把“年报提到政策”误作“当年首次受政策处理”。
③ 分组中“一组显著、另一组不显著”不等于两组效应显著不同
这是常见统计误读。必须直接检验两组系数差异,或在统一样本中加入处理变量与组别的交互项;同时报告差值及置信区间,而不是比较两边星号。可参考 Gelman 与 Stern 关于“显著与不显著之差本身未必显著”的方法说明。
④ 不能根据新兴技术专利重跑后“结果好不好”决定题目
如果理论问题是新兴技术,主结果就应使用事先定义的新兴技术识别规则,不论结果是否显著;如果理论问题已经转为总体创新,就应据此改题。建议先写一句不含方法和结果的研究问题,再检查每个核心变量是否回答它。探索过的两种版本都可保留,但主版本的选择理由必须来自理论、测量效度与开题承诺,而不是 p 值。
⑤ PSM 后要报告平衡,不是只报告 DID 又显著了
至少提供匹配前后标准化差异、共同支持、被删除样本和倾向得分分布。标准化差异比协变量 t 检验更适合诊断平衡,可参考 Austin(2009)。PSM 仍不能解决未观测的企业选择,宜作为稳健性而非因果识别的补丁。
⚠️ 风险预警
- 同一份结果经过多种填补、样本删除、分组和口径筛选后,研究者自由度会迅速扩大
- 政策资格、年报披露与实际享受年份若未对齐,会直接污染处理时点
- 新兴技术识别若事后按显著性调整阈值,会形成第二层规格搜索
🎯 三、李山岚:平行趋势、安慰剂、PSM 与中期推进
📚 研究历程
李山岚的大论文从算力技术创新的概念与专利检索边界出发,已经完成大规模专利清洗、城市匹配、指标构建和第一轮 DID。近期她先处理控制变量角色和回归报告规范,本周转向事件研究、安慰剂、PSM-DID 与异质性分析,实证章节已形成较完整的外观。
这一阶段的新问题是:图画出来、系数带星,并不自动意味着检验“通过”。她在汇报中把安慰剂分布、事件研究系数和 PSM 平衡图的判断标准混在了一起,也准备继续增加中介、调节和空间计量。临近中期,最有价值的工作是先解释清楚现有每张图检验的假设,再决定哪些扩展真正服务研究问题。
📝 本次(2026-09-09)
你的汇报(实证检验与中期安排)
- 重画安慰剂检验和事件研究图,调整政策前各期的合并方式,获得更易解释的动态结果
- 完成 PSM 后的协变量平衡展示和匹配样本 DID
- 按城市人口规模中位数开展异质性分析,目前两组结果的显著性表现不同
- 计划补充中介、调节与可能的空间计量分析,并在中期前完成正文
林老师指导
- 以九月底前完成中期材料为倒排节点,优先补齐当前设计中尚未完成的核心部分
- 数据处理主体已经成形,先把必要结果和文字闭环,再判断是否有时间加入空间分析
- 大论文的数据收集与实证推进优先级高于继续横向增加方法
⏭️ 下次预期(下一次组会)
- [ ] 为安慰剂、事件研究和平衡图各写一页“检验对象—横纵轴—判断依据—本次结论”
- [ ] 报告事件期系数、95% 置信区间、联合事前趋势检验和各事件期样本构成
- [ ] 对城市规模两组直接检验处理效应差异,补样本量与置信区间
- [ ] 提交中期最小闭环目录,把空间计量列为满足明确理论条件后的可选扩展
🤖 AI 实操建议
① 本次发言纠错:安慰剂估计不要求“服从正态分布”,两条线也没有必须重合的通用标准
随机置换处理组或政策年份后,核心是观察真实估计在置换分布中是否异常、随机估计是否大多围绕零,以及伪处理得到同样大效应的比例。分布形状由样本与置换方案决定,不必强行正态。真实系数对应的竖线是否“穿过某条曲线”也不是统一的通过规则;请明确图中的每条线究竟表示真实估计、核密度、p 值还是零点。
② 本次发言纠错:平行趋势不能按“政策前过零、政策后不过零”机械判定
政策前系数接近零且置信区间覆盖零,是与无明显预趋势相容的证据;政策后系数是否显著描述动态效应,不是平行趋势条件本身。还应报告政策前系数的联合检验,并注意“未显著”可能只是检验力不足。错时处理下,建议并行使用适配多期处理的估计方法,例如 Callaway 与 Sant’Anna(2021),而不是只依赖传统 TWFE 事件图。
③ 本次发言纠错:PSM 散点更靠近零,不足以证明“PSM 通过”
如果展示的是标准化偏差图,应逐变量报告匹配前后绝对标准化差异,并说明共同支持与丢弃样本;如果展示的是倾向得分分布,则要看处理组和对照组重叠,而不是“点都靠近一条线”。可使用 Austin(2009)的平衡诊断框架制作一张规范表。
④ 一组显著、一组不显著不能直接写“存在异质性”
请在全样本中估计 Treat × Post × LargeCity,或对两组处理效应差异进行 Wald 检验。只有差值本身具有统计证据,才能说规模组之间存在差异;同时要解释为什么人口中位数是理论阈值,并用连续规模交互或替代阈值检验稳健性。
⑤ 不要把中介、调节和空间计量当成待补齐的标准套餐
空间模型需要先说明可能的跨城溢出机制、权重矩阵与识别含义;中介变量要有明确的政策后传导顺序;调节变量要来自理论。中期版本可先完成“主效应—识别诊断—稳健性—一项有理论依据的扩展”,这比多个解释不清的模型更完整。
⚠️ 风险预警
- 反复改变事件窗和尾期合并方式可能改变样本构成,应并列展示并说明选择规则
- PSM 与 DID 叠加不会自动消除未观测混杂或政策选择性
- 空间权重矩阵若依据结果调试,容易把扩展分析变成规格搜索
🎯 四、王硕:小论文修改回应与产业链安全开题准备
📚 研究历程
王硕的小论文以存算一体企业为对象,结合扎根编码、TOE 与 fsQCA 分析多条件组态,已进入投稿前压缩、结构审阅与概念校准阶段。他本周逐条回应 AI 预审,接受摘要去重和因果措辞收敛,进一步区分相近条件维度,并把“潜在替代关系”调整为更克制的组态差异探索。
大论文则逐步转向产业政策工具与集成电路产业链安全。他已获取前期材料并开始仿照既有学位论文搭目录,但“产业链安全”的概念、维度和可测量结果仍未定型。开题在即,当前顺序应是先完成小论文投稿,再用权威文献和小样本数据验证大论文的概念—政策—处理—结果链条。
📝 本次(2026-09-09)
你的汇报(预审意见回应与大论文目录)
- 对 AI 预审意见逐项筛选:保留更具体的题目,接受摘要去重和弱化因果表述等修改
- 将“潜在替代性关系分析”改为“组态差异的探索性比较”,并把结论收敛为对潜在关系的推测
- 核验一条 AI 未检出的参考文献,确认本地已保存来源材料
- 参考既有学位论文搭建大论文目录,开始检索产业链安全的定义与构成维度
两位老师指导
- AI 意见可以吸收,但正文必须由本人理解后改写,并完成查重、AI 文本风险和期刊格式核验
- 小论文已经进入收尾,应优先完成投稿;大论文开题只要核心问题与数据路径能够立住即可继续细化
- 产业链安全不能从相邻概念或 AI 归纳直接推出,应继续查找权威定义与可操作化研究
- 已取得的课题材料可作为背景资源,但需按研究问题重新整理,而不是直接替代论证
⏭️ 下次预期(下一次组会)
- [ ] 完成小论文终稿核验清单,标出每条 AI 建议的采纳、部分采纳或不采纳理由
- [ ] 提交产业链安全概念表:定义、分析层级、维度、指标、数据源和代表文献
- [ ] 画出“政策框架—具体政策工具—企业处理事件—产业链安全结果”的层级图
- [ ] 用少量企业—年份样本验证处理日期、结果指标和对照组是否能够实际连接
🤖 AI 实操建议
① 对 AI 预审最好的回应不是“接受/不接受”,而是建立证据化决策表
建议使用四列:意见、原文问题、决定与依据、修改后位置。对于“无法实现”的意见,再加一列说明数据、方法或篇幅约束。这样既能避免 AI 重复提出已经修改的问题,也能让导师快速判断不采纳是否合理。
② 本次方向修正是对的:fsQCA 的组态关系不能写成通常意义上的净效应因果
fsQCA关注条件组合、等效路径与因果非对称,和回归中“其他条件不变时某变量的平均净效应”不是同一种表述。把“替代关系”降为“组态差异所提示的潜在关系”更稳妥;还应检查校准锚点、必要性、充分性、一致性、覆盖度、稳健性和预测效度。实践规范可参考 Pappas 与 Woodside(2021)。
③ 本次发言纠错:学位论文目录不能“大部分直接照抄”后只做局部调整
目录结构也承载研究逻辑。即使不构成逐字复制正文,沿用他人章节设计会把对方的概念层级、变量顺序和识别策略一起带入你的研究。可以借鉴模板,但应先独立写出一页研究问题、理论机制、处理事件、结果变量和数据接口,再由这些内容反推目录;同时保留借鉴来源,避免结构性模仿变成学术规范风险。
④ “产业链安全”必须先固定分析层级
企业层的供应链集中度、断供风险或恢复能力,行业层的进口依赖、关键环节缺口与网络韧性,以及国家层的战略自主可控不是同一个结果变量。直接可用的筛选表是:定义对象—风险来源—可观察结果—政策可影响机制—数据频率—是否能形成反事实。只有同一行能够全部填实,才适合作为大论文主结果。
⑤ 参考文献“本地能下载”只证明文献存在,不证明引用合适
还要核对作者、题名、期刊、年份、卷期页码或 DOI,以及正文引用是否准确支持当前句子。AI 检索不到中文数据库文献很常见,但这不能替代语义匹配检查。建议把该条文献的元数据和引用页码一并写入核验表。
⚠️ 风险预警
- 组态语言若在摘要和结论中又被改回“促进、导致、替代”,前文的克制表述会失效
- 产业链安全概念过大,而数据只落在企业财务层,会形成题目与测量层级错配
- AI 改写后的文字仍需逐句核对含义、来源和期刊格式,不能以查重率代替学术质量
🎯 五、朱丹晨:双政策协同、绿色创新效率与开题框架
📚 研究历程
朱丹晨的大论文已由双政策选题探索推进到政府数字化转型、环境规制与城市绿色创新效率的开题框架。她此前重点处理绿色创新效率的投入产出指标、城市层数据缺失和渐进 DID;本周已完成大部分开题报告,开始细化概念界定、理论基础、研究假设、Super-SBM 测算、政策效应与机制分析。
当前最难的并不是把目录补齐,而是证明两类政策为什么能够构成“协同”,以及协同的估计量是什么。组内讨论提出了开题答辩的现实风险:单独存在 A→C 与 B→C 的研究,并不能直接证明 A×B→C;但没有完全相同的既有论文,也不意味着新组合不能研究。下一步需要同时准备理论机制、制度依据、识别设计与备选题,避免把“有人写过”或“回归显著”当作协同成立的唯一依据。
📝 本次(2026-09-09)
你的汇报(开题结构与双政策设计)
- 开题报告主体已完成,尚缺文献综述、创新点和框架图,参考文献暂以脚注方式逐条对应
- 以数字赋能、政策协同和波特假说组织理论基础,并考虑 Super-SBM 测算绿色创新效率
- 计划构造双政策状态进行 DID,并继续筛选中介变量与异质性维度
- 已确认主要数据可获得,同时准备在协同逻辑无法被答辩认可时替换政策组合
林老师及组内建议
- 理论章节不能只列名称,必须在研究假设、变量或机制中真正使用;标题层级和假设标题按本校论文规范调整
- 开题阶段不要求全部估计完成,但必须确认数据和算法结构能够支撑研究设计
- 双政策协同要找到足够的制度或理论依据,同时准备一个可替换方案,现场根据专家意见调整
- 机制变量不能与绿色创新效率投入产出指标机械重叠,需避免重复测量和过度控制
⏭️ 下次预期(下一次组会)
- [ ] 完成双政策协同证据表:制度关联、理论机制、既有组合研究、可观测交互和反例
- [ ] 明确四类城市状态与进入时点,写出协同效应的估计式和对照比较
- [ ] 选取 20—30 个城市跑通 Super-SBM 与政策变量合并,检查年份覆盖和效率值分布
- [ ] 准备主方案与一套替代政策方案,各用一页说明研究价值、数据和识别条件
🤖 AI 实操建议
① 本次讨论纠错:没有“一模一样的协同论文”,不等于该研究在方法上不能成立
既有研究可以分别支持 A→C、B→C、政策协同机制或相似制度组合;新研究本来就可能填补尚未直接检验的组合。真正必需的是:说明 A 与 B 为什么在制度或机制上互补,并设计能区分“两个单独效应相加”与“额外协同效应”的估计。答辩策略上找到相近先例很有帮助,但不应把“必须找到完全同题文献”写成方法规则。
② 两项政策同时生效,不自动等于协同
如果模型只放 PolicyA 和 PolicyB,估计的是各自条件平均效应;若要讨论额外协同,至少需要明确 PolicyA × PolicyB 的含义及比较对象。错时实施时还要区分从未处理、仅 A、仅 B 和 A+B 四类状态,并防止已经受一项政策影响的城市被当作另一项政策的干净对照。可参考多期 DID 的组别—时期框架 Callaway 与 Sant’Anna(2021),但具体双政策估计仍需按状态转换重新推导。
③ 波特假说不能只作为“环境规制有利于绿色创新”的背景句
需要说明你采用的是哪一种命题:规制引致创新、创新补偿,还是更严格规制下的效率改善;然后把它连接到政策变量、机制和可检验假设。如果后文既没有规制强度、创新补偿,也没有企业行为机制,波特假说应删去,避免理论陈列。
④ 人才与研发投入若已经进入效率测算,再作为中介会产生定义重叠
结果变量由投入与产出共同构成,再用同一投入项解释该效率的变化,可能得到机械关系,也可能控制掉政策影响效率的组成部分。建议先画出 DEA/SBM 生产过程,再选模型外部的机制变量,例如政务数据开放、监管执行协调或绿色金融可得性;任何中介都要说明时间顺序与数据来源。
⑤ Super-SBM 使用年限不是换模型的理由
方法是否适合取决于研究对象、非期望产出、规模报酬假设和跨期可比性,而不是“已经用了十多年”。可以检索网络 DEA、动态 SBM、全局参比或三阶段 DEA 等扩展,但只有在它们修复了本研究的明确问题且数据能够支撑时才升级。直接可用的比较表为:方法新增假设—需要新增数据—解决当前哪一项偏差—结果如何解释。
⚠️ 风险预警
- 两项政策选择城市的机制可能相似,协同系数会混入共同选择和同期治理能力
- 效率指标、政策处理与机制变量若都依赖同一批政府投入数据,可能形成机械相关
- 为开题临时换政策虽可降低答辩风险,但必须重新检查时点、样本与理论,不能只替换变量名
🎯 六、南迪柯:LDA 复现、BERTopic 学习与论文阅读
📚 研究历程
南迪柯在完成本科论文后,开始系统学习文本分析方法,已从 LDA、困惑度曲线推进到 Sentence Transformers、BERTopic、嵌入缓存和参数实验。本周她使用李浩铭提供的数据重新跑通 LDA 预处理、主题生成与可视化,并继续学习 BERTopic;同时结合课程精读三方演化博弈论文,开始注意摘要结构、研究对象、方法、结论与启示之间的对应关系。
她目前仍处于“先跑通、再理解”的训练阶段,这一安排适合硕一开端,但下一步要开始留下可复现记录:每次实验不只展示图,还应保存数据版本、主题数选择依据、关键词、代表文档和人工解释。课程论文阅读也可从复述推导过程升级为判断假设是否合理、参数如何落地以及结论是否由模型设定预先决定。
📝 本次(2026-09-09)
你的汇报(主题模型与演化博弈论文)
- 用示例数据复现 LDA 预处理、主题输出和二维可视化,把高度重叠的主题数量调整为便于观察的测试版本
- 绘制困惑度曲线,尝试通过下降趋势和拐点选择主题数
- 继续学习 BERTopic 的示例流程,并复述一篇政产学研绿色技术创新联盟的三方演化博弈研究
- 总结课程中论文摘要的目的意义、研究内容、对象方法、结论及对策启示结构
林老师指导
- 当前训练的重点是确认全流程能够跑通,示例数据的主题数暂不必追求最终最优
- 换成真实研究数据后再扩大候选主题数范围,并重新判断主题质量
- 课程中讲授的摘要结构很重要,应在后续写作中主动使用
- 继续学习方法的同时逐步进入小论文训练,不能长期停留在教程复述
⏭️ 下次预期(下一次组会)
- [ ] 提交一份 LDA 实验卡:语料、预处理、随机种子、主题数、困惑度、主题一致性和代表文档
- [ ] 固定同一语料比较 3—5 个主题数,人工解释每个主题并标出重叠或碎片化问题
- [ ] 用自己的话写 300—400 字结构化摘要,再与原论文逐项对照
- [ ] 为演化博弈论文列出三方策略、收益参数、稳定条件和至少一个现实中可能不成立的假设
🤖 AI 实操建议
① 本次讨论纠错:LDA 主题数不能只取困惑度最低点,也没有最低点时也不能只凭“拐点”定稿
困惑度衡量模型对留出文本的预测能力,不等同于人能否解释主题。已有研究发现,预测指标更好的主题模型可能反而更难被人理解,见 Chang 等(2009)。训练阶段可用困惑度缩小范围,但正式选择还要结合主题一致性、主题间差异、代表文档和人工判断。
② 二维图“分成三坨”只是可视化结果,不证明三主题最合理
二维降维会扭曲高维距离,主题点云是否分开受投影方法和参数影响。不要为了让图好看而把主题数从八调到三;更稳妥的流程是先在原模型输出上比较指标与文本,再把二维图作为解释辅助。此次仅为跑通流程,可以清楚标记为 demo,不要把它当研究结论。
③ 一份可直接复用的主题解释表
每个主题记录:Top 15 词、5 篇最高概率文档、人工标签、与相邻主题的区别、明显错分文档、是否保留/合并。如果无法用一句话区分两个主题,应回查停用词、词组和主题数,而不是只改图的颜色或布局。
④ 演化博弈论文要区分“算出了稳定点”和“解释了现实稳定性”
三方都参与可能成为模型中的演化稳定策略,往往依赖收益、成本、激励和违约损失满足特定不等式;仿真参数若只是为了展示预期轨迹而设定,不能独立验证现实结论。下次重点讲清楚:哪些参数来自数据,哪些来自假设,结论在哪些参数区间会反转。
⚠️ 风险预警
- 教程小语料上的漂亮主题不能外推到真实大语料
- 每次改预处理和主题数却不保存实验记录,会无法解释结果变化来自哪里
- 摘要字数和结构应服从课程或期刊要求,不能把“300—400 字”当所有场景的统一标准
🎯 七、杨瑞豪:首次汇报、BERTopic 实验与计量基础
📚 研究历程
杨瑞豪本周首次进行完整组会汇报。他已用约 23 万条外文专利练习 BERTopic,经历本地算力不足、在线平台运行和更换设备,完成嵌入、主题生成、层次聚类、主题合并与动态主题展示。初始模型产生较多主题,合并后主题数明显下降,但参数组合仍主要依靠反复尝试,结果稳定性与解释性尚未建立。
他同时介绍了本科阶段的计量研究经验:围绕商业银行数字化转型与 ESG 表现,使用双向固定效应、中介和调节分析,能够较完整地说明指标、模型与检验。组内据此提出,可在继续学习文本方法的同时保留计量优势,逐步承担团队计量方法交流,并把两类能力结合为后续小论文方向。
📝 本次(2026-09-09)
你的汇报(BERTopic、技术路径与本科研究)
- 对大规模外文专利建立 BERTopic 模型,初始得到较多细碎主题,使用层次聚类合并后继续观察主题结构
- 多轮调整参数但尚未形成有依据的搜索逻辑,二维聚类图仍存在明显重叠
- 初步关注中美半导体若干子领域的技术路径分叉,尝试用先导信号和断点等方法刻画时序变化
- 回顾本科阶段银行数字化转型与 ESG 的面板计量研究,展示双向固定效应、中介和调节分析基础
两位老师指导
- 文本模型下一步要从“能运行”转向理解各环节和参数,并在组会上系统介绍方法
- 保留并继续强化计量基础,未来可与团队成员形成方法互补
- 研一阶段课程较多,但应尽早形成固定学习节奏、工位协作和小论文训练
- 研究方向可在文本分析与计量优势的交叉处逐步收束,不必第一次汇报就仓促定题
⏭️ 下次预期(下一次组会)
- [ ] 提交 BERTopic 实验日志:嵌入模型、UMAP、HDBSCAN、主题缩减规则、随机种子与运行成本
- [ ] 为合并后的主题输出关键词、代表专利、主题规模和人工标签,抽样检查合并是否损失语义
- [ ] 用稳定性、主题一致性、离群值比例和人工解释比较 3 组预先设定的参数方案
- [ ] 准备一次 10 分钟计量方法分享,说明本科研究的识别假设、标准误和最值得修正的一点
🤖 AI 实操建议
① 本次发言纠错:BERTopic 的二维主题点重叠,不足以判定模型效果差
BERTopic通常先用预训练模型生成文档嵌入,再降维、聚类,并以 c-TF-IDF 表示主题;二维可视化只是对高维结构的再次投影,可能出现视觉重叠。原始方法见 Grootendorst(2022)。判断质量应回到代表文档、主题一致性、离群点、重复主题和下游任务,而不是只看图是否“散开”。
② 166 个主题也不一定是错误,38 个也不一定更好
主题数量应匹配研究问题的粒度。若目标是识别细分技术路径,过度合并可能把真正的技术分叉抹平;若目标是描述宏观版图,166 个主题又难以解释。建议先为研究输出规定粒度,例如“能否对应可命名的技术组件或路径”,再制定合并规则。层次聚类只能提供候选合并,最终仍要审计代表专利。
③ 把随机调参改成小型、可比较的实验设计
固定嵌入后,一次只改变一个关键参数:UMAP 的邻居数/维度、HDBSCAN 的最小簇大小、主题缩减阈值。每次记录主题数、离群值比例、主题一致性、重复关键词比例和抽样人工评分。这样三到六组实验就能回答“哪个环节导致碎片化”,比大量无记录组合更有效。
④ 技术路径分叉要防止“先做出主题,再事后找拐点”
先导信号、断点与主题合并都含有阈值。应预先定义分叉事件、时间窗口和验证对象,并用已知技术转折作为外部校验;否则主题模型噪声、专利申请量变化或参数调整都可能制造假分叉。先选一个子领域做完整案例,再扩到六个领域。
⑤ 计量经验可以成为优势,但本科模型也值得复盘
双向固定效应不因加入个体和年份固定效应就自动获得因果解释;中介和调节也需要时间顺序与识别假设。下一次分享可主动回答:处理变量为何外生、标准误如何聚类、缺失年份如何处理、结果能否解释为因果。这个复盘会把“会跑模型”升级为“会审计模型”。
⚠️ 风险预警
- 23 万条专利的清洗、语言模型和硬件成本都高,正式调参前应缓存嵌入并保存数据哈希
- 层次合并若只依据主题向量距离,可能合并术语相近但技术路径不同的主题
- 同时铺开六个子领域、动态主题、断点和计量设计,容易在研究问题未定时过早扩张
散会
本周的共同主题不是“又多跑了几个模型”,而是开始区分模型输出、方法检验与研究证据。两位新同学正式进入组会节奏后,团队将保持每周一次交流;每位同学都要逐步形成一篇小论文,能使用工位时尽量到组内共同学习。正大杯由王硕牵头组织,数学建模问题可与李浩铭交流,选题同时参考往届获奖项目和已经正式发布的“十五五”规划纲要,但仍要把热点落实为可研究的问题、数据和方法。
下一次组会建议每个人至少带一份“可检查产物”:实验矩阵、规格登记表、变量差异检验、概念证据表、开题备选方案或可复现实验卡。比起“结果更好了”,更重要的是说明为什么这一版更可信。
🎭 本周彩蛋
📢 本周金句
“如果实现不了,就是稍微从这个退后一步,单独分析那些非文本信息也足够做创新点。”
—— 林老师,专利多模态研究
这是很实用的研究策略:先保住一个清楚、可验证的增量,再决定是否挑战更复杂的联合表征。研究设计可以有雄心,但每一步都要留下一条能落地的退路。
🧠 本周新词
- DINO:让学生网络学习教师网络对不同图像视图的稳定表示,是无标签视觉表征方法,不是“恐龙模型”
- MAE:把图像的一部分遮住,再训练模型重建缺失像素,像给模型出一张高难度拼图
- 平行趋势:没有政策时,处理组和对照组本应沿着可比较的趋势变化;它不是看一张图“顺不顺眼”
- 组态差异:关注多项条件如何组合对应结果,不等于某一个条件可以替代另一个条件
本周的软件们也完成了组内分工:DINO 负责“看图”,MAE 负责“补图”,Gephi 负责“把线理顺”,Stata 负责“给星星”。至于研究者,负责提醒它们——图好看、星星多、主题分得开,都还只是答题纸,不是答案。
林超然 · 整理于 2026-09-09