汇报顺序:
硕 3: 李浩铭 → 管明露 → 李山岚 →
硕 2: 王硕 → 朱丹晨 → 马婧怡 →
硕 1: 南迪柯 → 杨瑞豪
注:本期组会记录由 AI 基于录音转文字稿与各位同学的历史组会档案归纳整理。文章按每位汇报同学分节,包含「研究历程」「本次要点」「下次预期」「AI 实操建议」四部分。若学生或老师在发言中存在可核验的事实、概念或方法错误,AI 实操建议会直接指出并给出更正依据;AI 自身仍可能出错,请以原始材料、方法文献和正式通知为准。
2026-08-13 组会记录
本期讨论 6 位(按汇报顺序)
- 🎯 李浩铭:ViT、CLIP、DINO 与专利图像研究接口
- 🎯 管明露:子公司税率识别、专利检索与 DID 分组
- 🎯 李山岚:平行趋势、
log(1+Y)变换与事件期长度 - 🎯 王硕:大论文选题筛选、产业链安全与全球价值链测度
- 🎯 朱丹晨:双政策协同逻辑、绿色创新效率与数据可得性
- 🎯 南迪柯:BERT 中文句向量与 BERTopic 后续实验
🎯 一、李浩铭:ViT、CLIP、DINO 与专利图像研究接口
📚 研究历程
李浩铭的小论文早期围绕 AI 芯片关键核心技术识别和创新链—产业链融合展开,先后经历图网络构建、GCN/LSTM 链路预测、阈值选择和可视化优化。进入多模态方向后,他开始把文本分析经验扩展到专利图像:从 Transformer 与 Sentence Transformers 的基本原理,逐步推进到 Vision Transformer、CLIP、DINO 等视觉表征模型。
这条学习路线正在从“能讲清一个模型”转向“能否形成研究设计”。本周已经能够用图像切块、图文对比学习、师生网络和多视图裁剪解释三个模型的基本机制,也尝试运行 CLIP 分类演示。下一步需要把模型能力、专利附图的领域差异和论文中的技术融合识别目标连成一条完整证据链。
📝 本次(2026-08-13)
你的汇报(视觉 Transformer 路线)
- 梳理了从 Transformer、ViT 到 CLIP、DINO 的演进路线,重点解释 ViT 如何把图像切成 patch 并加入位置信息
- 用图文配对和相似度矩阵说明 CLIP 的对比学习与零样本分类流程,并运行汽车图片分类演示
- 用不同裁剪视图、student/teacher 网络、交叉熵和指数移动平均解释 DINO 的无标签自蒸馏过程
- 注意到自然照片与专利线稿在纹理、颜色和结构表达上存在域差异,预训练模型不能未经验证直接迁移
林老师指导
- 下一步不要继续把模型逐个横向罗列,而要同时回答“论文要识别什么”“模型分别提供什么能力”“算法层面的创新在哪里”
- 把模型、创新点和论文目标有机连接,形成可被题目、研究问题、数据和实验共同支撑的完整故事
- 专利图像并非不能使用 DINO 或 CLIP,但需要先验证自然图像预训练表示对专利线稿的迁移效果,并设计有针对性的处理
⏭️ 下次预期(下一次组会)
- [ ] 提交一张“研究目标—数据对象—模型能力—预期输出—评价指标”对照表,明确 ViT、CLIP、DINO 各自是否真正必要
- [ ] 选取 50—100 张专利附图做小样本试验,比较原图、二值化图和局部裁剪图的向量近邻或分类结果
- [ ] 用一页图讲清拟解决的论文问题,避免把“介绍了三个模型”误当作研究创新
- [ ] 列出至少两种可发表的算法贡献路径:领域适配、图文融合、弱监督标注或结构级相似性,并说明验证方法
🤖 AI 实操建议
① 本次发言纠错:三处模型表述不准确
李浩铭本次把“CNN 不能掌握全局信息”“CLIP 最后把一对图文合成一个向量”“DINO 只需一张图片就可以反复训练”作为模型解释,这三项都不准确。正确口径是:卷积网络可以通过层叠卷积、下采样等扩大感受野并汇聚全局信息,只是其建立远距离关系的机制不同于自注意力;CLIP 使用图像编码器和文本编码器,把两类输入分别投影到可比较的共享表征空间,并没有把一对图文合并成同一个向量;DINO 依赖大量无标签图像及其多视图增强进行自蒸馏,不能用单张图片完成有通用性的模型训练。
② 用“最小可行实验”决定模型,而不是先决定模型再找问题
先选一个明确任务,例如“同一技术主题的专利附图能否聚到一起”。固定同一批样本,依次比较:CLIP 图像编码、DINO 特征、简单 CNN 基线;输出 Top-k 近邻、类内/类间距离和人工判断正确率。若三种模型差异不大,就说明论文创新不能只写“用了新模型”;若 DINO 在结构相似性上明显更好,再讨论域适配或局部结构建模。
③ 把论文故事压缩成一句可检验的话
直接可用版本:
面向专利附图缺少稳定文本描述、自然图像预训练模型存在领域偏移的问题,本文构建图像结构表征与专利文本语义表征的联合空间,用于识别跨专利的潜在技术融合关系,并通过人工标注样本和链路预测指标验证其有效性。
这句话中的每一个名词都必须在实验中有对应对象:领域偏移要有对比,联合空间要有融合方法,技术融合要有操作性定义,有效性要有基线和指标。
⚠️ 风险预警
- 组会中的模型解释仍有若干口径误差,正式写作必须回到原论文,不要引用二手视频中的简化说法
- 专利线稿与自然照片的域差异只是待验证假设,不能在没有实验时写成确定结论
- 算力不足不等于只能训练分类头;参数高效微调、特征提取和小规模领域适配仍有多种方案,但应先看任务是否需要
🎯 二、管明露:子公司税率识别、专利检索与 DID 分组
📚 研究历程
管明露的小论文从集成电路专利主题识别起步,逐步形成 BERTopic、层次主题模型、新兴度评价和成熟度惩罚相结合的技术路线。经过论文修改、会议汇报和专家意见回应后,她的关注点已经从算法运行推进到样本边界、指标含义和结果解释。
大论文沿着“识别新兴技术—构建企业面板—评估政策激励”的路径推进。上周她已完成约 5.3 万条企业专利的第一轮下载和去重,并开始处理 DID 分组。本周进一步发现上市公司下属子公司在业务范围、专利申请和所得税优惠上并不一致,于是把研究单位、企业别名、税率备注和政策受益时间重新拆开。这个发现让分组更复杂,也让政策暴露的识别更接近真实企业结构。
📝 本次(2026-08-13)
你的汇报(企业税率、子公司与专利样本)
- 从 CSMAR 企业所得税字段及备注中查找 0%、10%和 12.5%等优惠税率,尝试据此识别受政策影响的上市公司
- 121 家公司中约 80 多家有相关记录,手工初筛约 15 家可作为处理组,但不同子公司的适用税率和生效年份并不一致
- 从三千余家境内子公司中按经营范围筛到约三百家集成电路相关主体,并将母、子公司名称一起加入专利检索式
- 新检索式加入较窄的集成电路分类号后得到约 2.4 万条专利,预计去重后不足 2 万条;样本规模尚可,但召回率需要审计
林老师指导
- 通过实际披露税率反向识别政策受益企业,是比单纯按地理位置划分处理组更深入的数据入口
- 若一家上市公司的任一相关子公司享受政策优惠,可以先在母公司层面将其视为受到政策影响,以降低子公司级匹配的复杂度
- 下一步把优惠税率、政策生效年份和专利申请人完成匹配,即可形成分期处理的企业—年份 DID 数据
- 子公司问题同时暴露了原专利检索只使用母公司名称的遗漏,应保留本次扩展后的主体清单和筛选依据
⏭️ 下次预期(下一次组会)
- [ ] 生成“股票代码—母公司—子公司—税率—依据备注—起始年份—证据状态”主表,并区分明确、推定和缺失三类证据
- [ ] 对约 15 家处理组逐家保存原始披露依据,核对优惠税率是否确由目标政策产生,而非其他高新技术企业优惠
- [ ] 从处理组和对照组各抽样 5 家,人工核验专利申请人召回率、业务相关性和 IPC/CPC 过滤造成的漏检
- [ ] 同时保留“母公司任一子公司受益”和“仅明确受益子公司专利”两种口径,为稳健性检验预留接口
🤖 AI 实操建议
① 本次发言纠错:分类号名称和处理组推定都需要改口径
管明露发言中多次出现“IBC 分类号”,标准名称应为 IPC(International Patent Classification,国际专利分类);如果只是转录误差,也应在检索式和论文中统一纠正。林老师提出“只要一家上市公司的一个子公司享受优惠,就可以认为整个公司都受到政策影响”,这只能作为一种待检验的简化口径,不能直接判定为方法上合理:优惠是否传导到母公司其他业务、专利是否由受益主体产生,都需要证据。建议把“任一子公司受益”放在宽口径,把“专利申请主体本身明确受益”放在严格口径,两者并行报告。
② 先做政策暴露证据表,不要把税率数值直接等同于政策资格
建议为每条处理记录增加四个字段:tax_rate_observed、policy_name_in_note、effective_year、evidence_grade。其中证据等级可设为 A(备注明确写出目标政策及时间)、B(税率吻合但政策名不完整)、C(仅根据公司属性推定)。主结果先用 A,A+B 作为扩展样本,避免 10%税率实际上来自另一项优惠政策。
③ 把企业名称匹配拆成可复核的别名词典
直接可用表头:
| stock_code | parent_name | subsidiary_name | historical_name | short_name | start_year | end_year | source |
|---|
检索时保留“命中了哪个名称”的字段;聚合时再映射回股票代码。这样可以发现同名企业误匹配、历史更名漏检和子公司在样本期中途并表等问题。专利分类号建议回到 WIPO IPC 官方入口逐项核验,不要直接使用生成式 AI 给出的完整分类清单。
④ 用三组数字判断 2 万条是不是“太少”
总量本身不能回答问题。请分别计算:每家企业每年的专利中位数、处理组/对照组的零值比例、人工抽样中与集成电路真正相关的精确率。再比较“宽分类号”和“窄分类号”在同一批企业上的新增与丢失主题。如果窄式精确率明显提升但关键主题仍被覆盖,2 万条完全可能优于 5 万条噪声样本。
⚠️ 风险预警
- 名义税率、实际税率和政策规定税率不是同一概念,变量名与论文表述必须和数据库字段一致
- “任一子公司受益即母公司受益”会带来处理强度误差,必须准备更严格口径作稳健性检验
- AI 推荐的 IPC/CPC 代码可能漏掉封装、材料、设备等关键环节,必须人工核验分类说明和样本专利
🎯 三、李山岚:平行趋势、log(1+Y) 变换与事件期长度
📚 研究历程
李山岚的大论文经历了从 GPU 技术融合、区域算力创新到城市算力技术创新的多轮收束,最终形成“人工智能创新发展试验区政策—城市算力技术创新”的多期 DID 主线。6 月以来,她完成了算力专利检索、约 17 万条中国样本清洗、城市匹配和六项指标构建,并用熵权 TOPSIS 合成第一版被解释变量。
上周的第一版实证已经通过相关性和多重共线性检查,但事件研究未显示理想的平行趋势。本周她尝试调整控制变量,并针对约 27%城市—年份观测为零、变量右偏的问题,将 Y 值变换为 log(1+Y);新结果的政策前置信区间覆盖零,但政策后轨迹不像范文那样整齐。研究已经进入最需要克制的阶段:不是继续“调到好看”,而是区分有理论依据的数据处理、必要的模型诊断和以显著性为目标的事后筛选。
📝 本次(2026-08-13)
你的汇报(事件研究与变量变换)
- 删减部分控制变量后结果没有明显改善,改用
log(1+Y)处理大量零值和右偏分布后,政策前事件期置信区间开始覆盖零 - 当前图形形式上可视为未拒绝政策前平行趋势,但政策后系数没有呈现其他论文中常见的连续上升轨迹
- 由于最晚一批试验区在 2021 年设立,且控制变量目前只能整理到 2024 年,政策后最多只有三期年度观测
- 基准结果整体显著,但个别控制变量与 Y 值不显著;小论文退稿后尚未继续处理,准备重新发送最新版
林老师指导
- 平行趋势检验不要求政策后系数单调上升,图形是否“漂亮”不能替代识别假设和正式统计判断
log(1+Y)必须有处理零值、右偏或异方差的先验理由与文献依据,不能因为变换后通过检验才倒推理由- 逐个尝试控制变量、只保留显著结果容易落入 p-hacking;所有合理设定都应保留并解释
- 三个政策后年度可以使用,只要政策确有实际影响且论文对观测窗口限制诚实说明;现阶段不必为尚不可得的 2025 年控制变量停下
⏭️ 下次预期(下一次组会)
- [ ] 提交 Y、
log(1+Y)和其他预先有依据口径的分布图、描述统计与事件研究并列表,不覆盖任何旧结果 - [ ] 写一段 200 字的变量变换依据,明确零值比例、偏度、系数解释变化和使用该口径的文献支持
- [ ] 报告正式的政策前联合检验结果,并说明处理时点、基准期、置信区间和标准误聚类层级
- [ ] 把小论文最新版重新发给林老师,同时列出退稿后的下一步处理选项
🤖 AI 实操建议
① 本次发言纠错:平行趋势并不是“政策前跨零、政策后不跨零”
李山岚把判定规则概括为“政策实施前的置信区间包括零,政策实施后不包括零,就代表平行趋势通过”,这个说法不准确。平行趋势假设针对的是处理前:处理前各期相对效应应与零相容,并通常结合处理前系数的联合检验、图形趋势和检验功效判断;处理后是否显著属于政策动态效应,不是平行趋势成立的必要条件,也不要求单调上升。至少应报告政策前系数图、联合检验、不同处理批次样本量和基准期。分期实施政策可对照 Callaway 与 Sant’Anna 的 group-time ATT 方法:R did 包文档与论文 DOI。
② 建一张“设定宇宙表”,给每次调整留下理由
| 版本 | Y 口径 | 控制变量 | 样本期 | 调整前理由 | 结果摘要 |
|---|---|---|---|---|---|
| M0 | 原始综合值 | 基础组 | 2010—2024 | 原始设计 | 待填 |
| M1 | log(1+Y) |
基础组 | 2010—2024 | 27%零值、右偏 | 待填 |
| M2 | 原始综合值 | 精简组 | 2010—2024 | 缺失率/共线性规则 | 待填 |
“调整前理由”必须在看结果前成立。最终正文可以只放主模型和两组稳健性,但附录或研究日志要保留全部合理模型。
③ 三个政策后年度不必人为拉长,但要改变问题表述
三期更适合回答“短期内是否出现政策效应”,不适合宣称长期演化。可以把政策后动态汇总为短期 ATT,同时诚实写明截至 2024 年的窗口限制。若明年补到 2025 年,只需按冻结的清洗和回归脚本增量更新,不要重新根据显著性挑模型。
⚠️ 风险预警
log(1+Y)会改变系数尺度,也可能压缩高值城市差异;不能只报告它改善了显著性- “政策前各点不显著”不等于平行趋势已被证明,应结合联合检验、检验功效和处理前走势判断
- 控制变量本身是否显著不是保留或删除的唯一标准,关键是其理论角色、是否受政策影响以及缺失情况
🎯 四、王硕:大论文选题筛选、产业链安全与全球价值链测度
📚 研究历程
王硕的存算一体小论文已经走过企业筛选、BERTopic 主题识别、TOE 框架、fsQCA 组态分析、会议反馈和投稿前修改等阶段,并在必要条件不足但充分性组态较丰富的结果中积累了方法反思。他同时负责国社科结题材料的合稿排版,已将目录、图表目录、页码和多级编号改造成可自动维护的体系。
本周工作转向大论文选题。他希望选择一个政策节点清晰、公共管理属性明确、无论正负结果都能解释的 DID 题目,初步聚焦国家集成电路产业投资基金、产业政策、产业链安全和全球价值链地位。相比直接接受 AI 给出的题目,现在更关键的是逐项判断因果故事是否显而易见、Y 值能否测量、数据能否覆盖、政策处理如何定义,以及与已有研究相比新增了什么问题。
📝 本次(2026-08-13)
你的汇报(大论文候选题)
- 倾向使用 DID,以清晰政策或事件为节点,优先考虑集成电路领域,同时保留其他公共管理政策题目作为备选
- 首选方向之一是国家集成电路产业投资基金对集成电路产业链安全的影响,设想以 2014 年前后企业变化识别政策效果
- 第二个方向是产业政策对集成电路企业全球价值链地位的影响;另有大基金不同期次、政策组合三重差分和城市 AI 创新等备选
- 计划先检查前两个方向的数据可得性;小论文等待进一步反馈,结题报告排版已完成当前可做部分
林老师指导
- 产业链安全方向既可能存在“补齐原本不可盈利节点”的正面机制,也可能存在选择性投资造成节点集中化的风险,但论文叙事要避免结论过于显然或只围绕质疑政策展开
- 产业链安全不是现成字段,需要借助创新链—产业链网络及其稳定性、冗余度等指标构造可解释的评价体系
- 全球价值链地位更难测量,往往需要跨国、跨产业数据;在确定题目前先找成熟测度方法,并明确具体是哪一项产业政策
- 每个候选题先写成摘要式可行性说明,交代研究问题、数据、Y 值、政策处理和分析流程,再与吴老师沟通决定
⏭️ 下次预期(下一次组会)
- [ ] 为前两个候选题各写一页可行性备忘录,包含机制图、处理变量、Y 值、数据源、样本期和最大风险
- [ ] 搜集至少 5 篇产业链安全或全球价值链地位的成熟测度论文,整理“指标—数据—研究层级—能否复现”表
- [ ] 对大基金方向列出被投企业、投资轮次和对照组来源,判断“2014 年后”是否足以构成处理,还是需要企业级投资时点
- [ ] 与吴老师确认是否必须限定集成电路领域;收到林老师的小论文反馈后同步推进修改
🤖 AI 实操建议
① 本次发言纠错:“政策无效也能写”不是选题安全垫
王硕提出“DID 分析有效可以证明政策有效,无效则分析政策失效原因”,这个判断缺少关键前提。统计上不显著只能说明当前设计没有提供足够证据拒绝零效应,原因可能是政策确实无效,也可能是处理组定义错误、样本量不足、测量误差、识别假设不成立或检验功效太低;不能直接把“不显著”解释成“政策失效”。只有在识别设计、数据质量和功效均可信时,零结果才具有较强解释力。
② 用五问筛选题目,任何一问答不上来就暂不定题
- 政策把谁处理了,具体从哪一年开始?
- 未被处理但可比的对象是谁?
- Y 值能从什么原始记录计算,而不是只停留在概念?
- 政策影响 Y 的正反机制各是什么?
- 现有文献已经做到哪一步,你新增的是数据、测度、识别还是机制?
每个答案限制在三句话,并附一个可打开的数据入口或文献。这个动作比先下载二十年数据更能快速排除不可做题目。
③ 产业链安全优先从网络韧性操作化
可先考虑四类指标:关键节点集中度、替代路径数量、网络连通性、单点失效后的最大连通子图变化。再判断现有“双链融合”数据能否形成企业或技术节点之间的年度网络。直接可用的研究问题可以写成:
国家大基金投资是否通过补齐关键技术节点和增加替代路径,提高了集成电路产业链网络抵御局部中断的能力?
这里的“提高”不能只用专利总量代替,必须对应网络结构变化。
④ 全球价值链方向先检查研究层级是否匹配
OECD 的全球价值链数据入口提供跨国投入产出和增加值贸易指标,适合国家—产业层面,不一定能直接评价单家上市公司。如果题目写“企业全球价值链地位”,还需要企业进出口、海外销售、投入来源或跨国供应关系等微观数据。若只能拿到国家—产业数据,就应同步下调题目的分析层级。
⚠️ 风险预警
- “政策发布后的所有企业”不是天然处理组,大基金投资具有选择性,可能存在严重的选择偏差和反向因果
- 产业链安全与全球价值链地位都不是单一财务指标,过早定题会把后期工作压在不可得数据上
- “结果不显著也能写”并不能替代识别质量;无效结果只有在处理定义、检验功效和数据质量可信时才有解释价值
🎯 五、朱丹晨:双政策协同逻辑、绿色创新效率与数据可得性
📚 研究历程
朱丹晨前期围绕后 Transformer 时代新兴技术弱信号识别,积累了 BERTopic、多源数据融合和新颖性、关注度、成长性测度经验。进入大论文阶段后,她主动把研究问题拉回公共管理领域,逐渐聚焦“互联网+政务服务”试点与低碳城市试点共同影响城市绿色创新效率的选题。
上周她已提出双试点、单试点与未试点城市的比较思路,并开始讨论政策顺序、机制与异质性。本周进一步完成五章目录、研究摘要式说明和投入产出指标的数据摸底,尝试用数字赋能理论、政策协同理论和波特假说串起作用机制。当前最大的风险也更清楚了:协同不能只是把两个政策分别回归一次,绿色创新效率不能在缺少创新产出的情况下被一般经济或生态产出替代,数据平台的便利性也不能代替来源可信度。
📝 本次(2026-08-13)
你的汇报(开题框架、协同机制与指标数据)
- 按五章结构搭建了概念、理论、研究假设、研究设计、实证和政策建议,初步选择数字赋能、政策协同和波特假说作为理论基础
- 以城市高质量发展为背景,论证数字政务可提高环境监管效率,低碳治理又会倒逼跨部门数据共享和政府数字化转型
- 初步设计直接效应、人才引进、财政支持、产业结构升级等机制,以及城市规模、区位和主导产业等异质性分析
- 从城市年鉴、城乡建设数据库和 EPS 平台摸排绿色创新效率投入产出数据,但部分环境指标在 2019—2020 年后中断,绿色专利和第三方马克数据的可信度仍需核验
林老师指导
- 绿色创新效率的指标体系是后期最难返工的环节;必须先回答没有绿色创新产出的城市能否被一般经济产出推成“高效率”
- 指标体系需要大量高水平中英文论文支撑,普通期刊可补充引用,但不宜作为核心口径的唯一依据
- “两个政策协同影响 C”不能退化成分别估计 A 和 B;应查找一般性的“A、B 协同对 C”研究,明确协同的操作化和识别方法
- 第三方数据平台是否可信,可以反向检索使用该平台数据的高水平论文,并与统计年鉴或官方样本抽查对照
⏭️ 下次预期(下一次组会)
- [ ] 整理 10—15 篇高水平绿色创新效率论文,形成“投入—期望产出—非期望产出—模型—数据源”证据表
- [ ] 为每个候选产出指标做极端案例检验,尤其检查绿色专利为零但 GDP 或生态产出高时,效率值是否出现反常结果
- [ ] 找 3—5 篇“A、B 两政策协同对 C”的方法论文,写清双试点增量效应究竟如何定义和估计
- [ ] 对 EPS、马克数据和官方年鉴做同城市同年份抽样核对,记录字段定义、缺失年份、单位和来源链
🤖 AI 实操建议
① 本次发言纠错:学生和老师对“绿色创新效率”的表述都过于绝对
朱丹晨说绿色创新效率“包含经济和生态两方面”,如果据此认为只要有经济与生态产出就足够,这个说法过宽:指标体系仍必须出现可识别的创新投入或创新产出。林老师根据词义判断它“只是和绿色创新有关的效率”,进而质疑经济与生态产出为何能进入,这个说法又过窄。现有绿色创新效率研究常用 DEA/SBM,把研发人员和研发经费作为投入,把绿色专利、新产品销售或经济产出作为期望产出,并把污染排放作为非期望产出;经济与环境结果可以进入,但不能挤掉“创新”这一核心环节。可对照开放获取的方法实例:Heliyon 2024,DOI 10.1016/j.heliyon.2024.e25085和基于 SBM/EBM 的绿色技术创新效率指标说明。
因此,更准确的检查不是“经济、生态产出一律不能用”,而是验证:创新链条是否被显式测量、每项投入产出有何理论角色、极端样本会不会被非创新产出推成虚假的高效率。
② 先画“理论—政策—变量—检验”映射,不急着增加第四个理论
| 理论 | 解释哪条机制 | 可观测变量 | 对应检验 |
|---|---|---|---|
| 数字赋能 | 数据共享提升环境监管 | 数字治理/监管效率 | 中介或机制证据 |
| 政策协同 | 两政策共同实施产生增量 | 双试点状态与先后顺序 | 联合处理效应 |
| 波特假说 | 环境规制诱发绿色创新 | 绿色专利/创新效率 | 主效应与机制 |
若某个理论没有对应变量和可检验命题,就先不写入核心理论框架。理论数量不是质量,闭环才是。
③ 用四种政策状态定义“协同”,不要只做两个回归
把城市—年份状态编码为:未实施、仅数字政务、仅低碳试点、两者同时存在。核心问题是“双政策状态相对于两个单政策状态,是否存在额外增量”,同时处理不同城市进入政策的年份。可以借鉴多期 DID 的 group-time 思路,但最终估计式要与数据结构匹配;Callaway–Sant’Anna 方法文档可作为起点,而不是直接照搬结论。
④ 对效率指标做三层审计
第一层是概念:每个产出是否真的包含“创新”和“绿色”。第二层是数据:年份、单位和城市口径是否连续。第三层是模型:当绿色创新产出为零时,模型是否仍给出反常高效率。直接可用写法:
本研究不以一般经济增长替代绿色创新产出。经济与生态绩效若进入模型,应说明其在绿色创新过程中的理论角色,并通过替代指标与极端样本检验验证结果不由非创新产出主导。
⚠️ 风险预警
- “共同服务于城市高质量发展”只能证明宏观关联,不能自动证明两项政策存在可识别的协同效应
- 第三方数据库被论文使用过不等于所有字段都可靠,仍需抽查原始年鉴和字段口径
- 机制变量和异质性分组不要先固定为“三个一组”;应由理论和数据可得性决定,否则容易形成模板化论文
🎯 六、南迪柯:BERT 中文句向量与 BERTopic 后续实验
📚 研究历程
南迪柯在完成本科论文答辩后,开始系统补充文本分析方法。从 LDA、困惑度曲线,到 Sentence Transformers、BERTopic、主题可视化、层次聚类和动态主题模型,她的学习路径已经从理解概念逐渐转向独立配置环境、运行代码、保存结果和解释输出。
上周她继续用教程流程推进多种主题分析方法,并准备替换自有数据。本周转向 BERT 编码基础:使用 bert-base-chinese 对一千个句子进行分词和批量计算,获得 768 维表示。下一步需要把“模型输出张量”与“可用于句子相似度或主题聚类的句向量”区分开,再把缓存、降维、聚类、离群值处理和主题表示串成一条可复现流程。
📝 本次(2026-08-13)
你的汇报(BERT 编码复现)
- 学习并复现了使用
bert-base-chinese将文本分词、输入模型和转换为向量的教程流程 - 将约一千个句子分成批次运行,得到每个句子对应的 768 维表示
- 当前重点是理解 BERT 编码与文件加载,后续准备继续学习向量缓存、其他词嵌入模型和主题聚类
- 计划补做 BERTopic 的离群值减少和参数调整等此前未完成步骤
林老师指导
- 按参考视频把后续实验继续做完,尤其补齐已经进入主题聚类之后的降噪和调参步骤
- 不要重复停留在已完成的主题聚类,要把减少离群值等后处理跑通并观察结果变化
- 保留现有学习节奏,在代码能运行的同时逐步说清每一步输入、输出和作用
⏭️ 下次预期(下一次组会)
- [ ] 说明当前 768 维向量具体取自
[CLS]、平均池化还是其他位置,并用两个相似句和两个不相似句做余弦相似度检查 - [ ] 将一千句向量缓存为带文本 ID 的文件,重新载入后验证形状、顺序和数值一致
- [ ] 在同一份数据上比较原始 BERT 表示与句向量模型的聚类结果,展示主题数、离群值比例和代表文本
- [ ] 至少运行两种 BERTopic 离群值归并策略,并记录参数、归并前后主题变化和错误案例
🤖 AI 实操建议
① 本次发言纠错:BERT 原始输出不能直接称为“每句一个 768 维词向量”
南迪柯把 bert-base-chinese 的结果概括为“一千个句子,每个句子对应一个 768 维词向量”,这个说法混淆了词元向量、句向量和“词向量”。BERT 首先为每个 token 输出 768 维隐藏状态;若一句话有 32 个 token,原始隐藏状态通常类似 32 × 768。只有再指定 [CLS]、平均池化或其他 pooling,才能得到单个 768 维句向量,而且不同池化方式的语义质量并不相同。请在代码里打印 input_ids.shape、last_hidden_state.shape和最终 embeddings.shape,并对照 bert-base-chinese 模型页记录处理方式。
② 用一个小测试判断向量有没有语义意义
准备四句话:“政策促进绿色创新”“数字治理推动绿色技术创新”“今天天气很好”“猫正在窗边睡觉”。计算两两余弦相似度。如果前两句没有比跨主题句更接近,就先检查池化、截断、attention_mask和模型是否处于 eval() 状态,不急着进入聚类。需要直接得到句向量时,可参考 Sentence Transformers 快速入门。
③ 离群值处理要记录前后变化
BERTopic 官方提供 .reduce_outliers(docs, topics) 等接口,见官方文档。建议固定同一模型和随机种子,输出:原始 -1 数量、归并后数量、每个主题新增文本、人工判断错误的 10 个样本。减少离群值不是越多越好;错误归并会让主题词看似丰满却失去边界。
⚠️ 风险预警
- BERT 的 768 维隐藏状态不自动等于高质量句向量,池化方法会直接影响相似度和聚类
- 缓存向量时必须同时保存文本 ID、模型名和预处理版本,否则重新载入后无法追溯
- 为追求较低离群值比例而强行归并,会掩盖真实噪声或小众主题;必须抽样人工检查
散会
本周六位同学虽然分处视觉模型、企业政策、城市计量和文本分析等不同阶段,但都碰到了同一个问题:工具或结果能跑出来,只是研究的起点;真正决定论文质量的是概念、变量、数据和方法能否一一对应。下一次组会,请大家尽量带来对照表、证据表和小样本结果,让每一个关键选择都能被复核。
🎭 本周彩蛋
📢 本周金句
“就极力避免的就是 AB 协同对 C 的影响就是 A 做一下、B 做一下,不能这样,就一定是有一套方法在中间起作用。”
—— 林老师,讲双政策协同的识别
这句话不只适用于 DID:图像模型不能“CLIP 做一下、DINO 做一下”,选题也不能“数据找一下、显著性调一下”。真正的研究设计,就是把 A、B 和 C 连接起来,而且中间每一步都允许别人检查。
🧠 本周新词
- 共享表征空间:像给图片和文字使用同一套地图坐标;位置接近表示模型认为它们相似,不表示二者被合成了同一个向量
- 分期 DID:不同城市在不同年份陆续进入政策,像分批入场;比较时不能随手把早入场者当成后来者的普通对照
log(1+Y):先加一保留零值,再取对数压缩大数值;它能改变分布和解释尺度,但不是让结果自动显著的按钮- 政策协同:关注两项政策共同实施后是否产生超出各自作用的额外效果,而不是把两个单独回归并排摆放
🎬 会后一分钟小剧场
散会后,几个术语没有走,偷偷在会议室加开了一场澄清会。
平行趋势图第一个举手:“我再说明一次,我负责处理前趋势,不参加政策后曲线选美。”
IPC 把桌牌转过来:“还有我,名字是 IPC,不是 IBC。虽然只差一个字母,但检索式真的会翻脸。”
CLIP 的图像向量和文本向量一起来了:“我们只是住进同一个表征空间,没有合并户口。”
BERT 抱着一摞 768 维数组站在门口:“你们先聊。我现在最想知道,大家叫的是 token、句子,还是‘反正先聚类看看’。”
DID 翻了翻签到表,补上最后一句:“以后谁想把‘不显著’直接登记成‘政策失效’,请先到隔壁窗口提交处理组定义、检验功效和识别假设复印件。”
会议室灯灭了。证据表还亮着。
林超然 · 整理于 2026-08-13