汇报顺序:
硕 3: 李浩铭 → 管明露 → 李山岚 →
硕 2: 王硕 → 朱丹晨 → 马婧怡 →
硕 1: 南迪柯 → 杨瑞豪
注:本期组会记录由 AI 基于录音转文字稿与各位同学的历史组会档案归纳整理。文章按每位汇报同学分节,包含「研究历程」「本次要点」「下次预期」「AI 实操建议」四部分。若学生或老师在发言中存在可核验的事实、概念或方法错误,AI 实操建议会直接指出并给出更正依据;AI 自身仍可能出错,请以原始材料、方法文献和正式通知为准。
2026-08-20 组会记录
本期讨论 6 位(按汇报顺序)
- 🎯 李浩铭:目标期刊、论文结构与黑白网络图
- 🎯 管明露:专利—企业映射、政策暴露识别与 DID 零结果
- 🎯 王硕:大论文选题收束、产业链安全与 TFP 测度
- 🎯 朱丹晨:绿色创新效率指标与双政策协同识别
- 🎯 马婧怡:新能源汽车政策选题、语义测度与章节结构
- 🎯 南迪柯:BERTopic 预计算嵌入与缓存复用
🎯 一、李浩铭:目标期刊、论文结构与黑白网络图
📚 研究历程
李浩铭的小论文围绕 AI 芯片关键核心技术识别与创新链—产业链融合展开,先后经历图网络构建、GCN/LSTM 链路预测、阈值选择、热力图和网络图优化。近期,他一面学习 ViT、CLIP、DINO 等多模态模型,寻找专利图像进入既有研究的接口;一面把已经形成的成果转向正式投稿,开始根据目标期刊重组标题层级、图表和论证方式。
这周的重点从“继续加方法”回到“让现有论文适配期刊并把结果讲清楚”。他初步考虑《科研管理》《情报杂志》《情报理论与实践》等期刊,并把彩色年度网络图改为黑白版本。当前图件已经能够区分新增边与延续边,但节点筛选、布局和透明度仍削弱了跨年比较,下一步需要先明确每张图究竟让读者看出什么。
📝 本次(2026-08-20)
你的汇报(期刊适配与网络图修改)
- 初步把稿件按《科研管理》的要求调整,并继续比较《中国软科学》《系统工程理论与实践》《中国管理科学》等期刊的选题与方法适配度
- 注意到投稿说明与期刊实际刊文结构可能不同,准备进一步查看最近几期同类论文的一级、二级标题安排
- 将原先依靠颜色区分的网络图改为黑白图,计划突出当年新增边以及上一年新增、下一年仍保留的边
- 目前只保留与新增关系相关的节点,各年份位置虽固定,但部分灰色边被遮挡,布局也没有形成可直接解释的结构信息
林老师指导
- 目标期刊不能只看投稿模板,要反查近年已发表的同题材、同方法论文,确认文章结构、图表密度和表达习惯
- 先回答网络图要支持什么结论,再决定是否投入较大工作量重画,避免仅把网络“放上去”却不传递信息
- 可选节点最全、边最多的一期先用力导向布局自动确定坐标,再固定该坐标绘制其他年份,使跨期变化出现在同一空间参照中
- 提高重点边的可见性,并检查节点筛选是否导致不同年份看似可比、实际展示对象却发生变化
⏭️ 下次预期(下一次组会)
- [ ] 建一张目标期刊对照表,至少抽取每本期刊近三年 5 篇相近论文,记录题目、方法、篇章结构、图表风格和审稿周期信息
- [ ] 选定一个主投期刊,并提交“现稿结构—目标期刊常见结构—拟修改动作”三级对照表
- [ ] 以节点和边最完整的一期生成基准布局,固定坐标重画全部年份,同时保留未筛节点版用于核验
- [ ] 为每张网络图写一句预期结论;若图中看不出该结论,就继续调整编码或改用汇总指标、局部子图
🤖 AI 实操建议
① 期刊适配先做“证据化反推”
不要凭印象判断某本期刊“行不行”。可以给每篇样本文献编码:研究对象是否相近、是否使用网络分析或链路预测、方法创新占比、结果图类型、正文标题层级、篇幅和发表时间。若一本期刊近三年几乎没有相近研究,即使投稿指南允许,也要把它列为高风险选择。
② 固定布局不等于天然可比
同一节点跨年使用同一坐标,确实有助于比较;但如果每年先删除不同的一批“无关节点”,读者看到的结构仍可能由筛选规则而不是网络演化造成。建议先在全期节点并集上生成坐标,再分别用线型、灰度和粗细编码“新增、延续、其他”三类边。Gephi 的 Layouts 教程介绍了 ForceAtlas2 等布局及大图近似斥力设置,可作为参数记录模板。
③ 直接可用的图件检查表
每张图导出前逐项回答:同一节点是否同位?黑白打印后边类型是否还能区分?图例能否独立解释?透明度是否让细边消失?节点大小代表什么?正文是否引用了图中至少一个具体结构?答不上来的项目,就是下一轮修改入口。
⚠️ 风险预警
- 只照投稿须知改格式,可能与期刊真实刊文习惯不一致
- 每期分别自动布局会把坐标变化误当成网络变化;固定坐标后又要防止节点筛选改变比较总体
- 黑白图若只靠浅灰深灰区分,屏幕上可见、打印后仍可能丢失,最好同时使用线型或粗细
🎯 二、管明露:专利—企业映射、政策暴露识别与 DID 零结果
📚 研究历程
管明露的小论文从集成电路专利主题识别起步,逐步形成 BERTopic、层次主题模型、新兴度评价和成熟度惩罚相结合的技术路线。完成会议汇报与多轮修改后,她的大论文沿着“识别新兴技术—构建企业面板—评估 2020 年政策激励”的路径推进,研究重心已经从算法结果转向样本主体、政策暴露和因果识别。
前两周,她把母公司与境内子公司纳入专利检索,并尝试根据企业所得税税率及备注识别真正享受政策的企业。本周进一步完成专利申请人与股票代码、动态子公司关系及企业—年份面板的合并,得到第一版专利产出指标并跑出 DID。结果不显著并非终点,它首先暴露了处理组仅约 15 家、上市前子公司信息缺失、税率可能对应其他优惠政策等识别问题。
📝 本次(2026-08-20)
你的汇报(企业专利面板与处理组重构)
- 使用母子公司名称并结合 25 个 IPC 分类号重新检索,得到约 7.4 万条记录;优先保留授权公开、处理申请公开重复后约 5.4 万条
- 将专利申请人与“股票代码—年份—子公司”映射表匹配,删除约 1.4 万条无法落到相应企业年份的记录,最终保留约 4 万条并汇总为企业—年份专利数量
- 依据税率下降、0%、10%、12.5%及备注中的政策文字,手工标出约 15 家处理企业;第一版 DID 未得到显著结果
- 意识到零税率可能来自亏损或其他政策,CSMAR 对上市前子公司披露不足,准备评估上市公司年报批量下载与 AI 辅助抽取
林老师指导
- 先区分专利申请公开、授权公开、同族或分案等不同重复来源,明确分析表究竟按申请、公开文献还是发明计数
- 处理组识别和回归模型是两个问题:一边完善税率与政策证据,一边系统检查变量变换、控制变量和模型设定
- 可从其他行业寻找在政策外但企业特征相近的对照企业,也可评估用上市公司年报直接识别税收优惠依据
- 批量读取年报的主要瓶颈是合法、稳定地下载材料;先用少量年报验证目标信息是否存在,再估算全量工作量和模型成本
⏭️ 下次预期(下一次组会)
- [ ] 输出专利去重审计表:申请号、公开号、kind code、优先权、保留规则、删除原因及各步骤样本量
- [ ] 为 15 家候选处理企业建立证据表,逐条保存政策名称、税率、适用主体、起始年份、年报页码和证据等级
- [ ] 抽取 10—20 份年报做可行性试验,报告下载成功率、目标段落命中率、单份处理成本与人工复核时间,再决定是否扩到全样本
- [ ] 预先写明主规格与有限的稳健性规格,完整保留显著和不显著结果,并报告处理组企业数、处理后观测数与置信区间
🤖 AI 实操建议
① 本次发言纠错:不能以“让结果符合”为目标调规格
林老师提出让 AI 尝试控制变量组合、对 X/Y 取对数,直到结果“符合”,这项表述不准确。变量变换和控制变量调整可以用于诊断与稳健性分析,但不能以显著性为筛选标准,更不能只报告合意结果。正确做法是先依据理论和数据生成过程限定主规格,再列出少量合理替代规格,完整保存所有结果并解释差异。对数变换还会改变系数含义,log(1+专利数)也不是单纯的“显著性按钮”。多期 DID 的识别、分组—时期效应和条件平行趋势可对照 Callaway 与 Sant’Anna(2021)。
② 本次发言纠错:只下载中国专利也仍需区分重复层级
管明露认为“都是中国专利,所以不用考虑专利族”,这个说法过于绝对。同一申请可能先公开申请文本、后公开授权文本;国内也可能存在分案等相关申请。它们是否应被合并,取决于研究单位。WIPO 的专利数据字段指南明确区分申请公开、授权公开、kind code 与专利族。建议原始层全部保留,分析层至少并行生成“按申请号计数”和“按简单专利族/优先权计数”两种口径。
③ 把年报抽取做成有证据的分类任务
直接可用字段:stock_code、report_year、entity_name、policy_name、tax_rate、effective_period、verbatim_evidence、page、model_label、human_label。先让模型只做“定位候选段落”,再由人工判定是否为目标政策;不要让模型在没有页码和原文证据时直接给出处理组标签。
⚠️ 风险预警
- 处理状态若由政策后的税率或创新结果反推,可能引入后处理偏差和选择偏差
- 年报披露更丰富不等于天然完整,母子公司、合并报表与优惠主体仍可能错位
- 处理组只有约 15 家时,不显著可能来自统计功效不足;不能据此直接判定政策无效或分组一定错误
🎯 三、王硕:大论文选题收束、产业链安全与 TFP 测度
📚 研究历程
王硕的存算一体小论文已经走过企业筛选、BERTopic 主题识别、TOE 框架、fsQCA 组态分析和投稿前修改,同时还完成了国社科结题材料的目录、图表目录、页码及多级编号自动化。进入大论文选题阶段后,他把注意力集中到国家集成电路产业投资基金、产业链安全、全球价值链地位和政策效应转化等方向。
上周还是多个候选题并列,本周已经根据数据可得性和识别逻辑主动排除两个方向:出口技术复杂度受海关数据约束,多个发布时间高度重合的政策也难以拆出各自作用。目前相对可行的主线是“大基金投资—产业链安全”,但企业韧性不能直接替代产业链安全,一期与二期的 TFP 差异也必须先说明为什么值得比较。
📝 本次(2026-08-20)
你的汇报(候选题与测度方案)
- 因海关数据申请周期和可得性问题,暂时放弃用出口技术复杂度测量全球价值链地位的选题
- 因两个政策发布时间接近、作用难拆分,暂时放弃原三重差分方案
- 为“大基金对产业链安全的影响”寻找企业韧性测度和企业—年份固定效应模型,尝试把韧性作为产业链安全的代理
- 另考虑比较大基金一期、二期对全要素生产率的影响,并准备参考 LP 法估计企业 TFP,但尚未说清期次差异的理论价值
林老师指导
- 比较一期与二期只有在两期政策工具存在可识别、可解释的差异时才有意义;若两期都是多种手段的不同组合,结果很难回溯到具体机制
- 企业韧性与产业链安全相关但不等同:单个企业受冲击后恢复得快,不代表产业网络没有单点故障或关键节点风险
- 可借用李浩铭已经构建的创新链—产业链网络,从冗余、关键节点、抗毁性等网络属性寻找产业链安全的可测口径
- 为“大基金为什么影响产业链安全”写出一段机制论证,区分政策目标直接包含安全与政策虽非以安全为名但能影响安全两条路径,再与吴老师确认选题
⏭️ 下次预期(下一次组会)
- [ ] 写一页“大基金—产业链安全”选题说明,包含政策目标原文、作用机制、处理时点、对照组、结果变量和最大识别风险
- [ ] 建立“企业韧性—供应链韧性—产业链安全—网络稳健性”概念边界表,列明层级、定义、指标和不可互换之处
- [ ] 在李浩铭现有网络上试算 2—3 个指标,并用删除关键节点、随机删除节点等小实验说明指标含义
- [ ] 若保留一期、二期比较,逐条列出两期投资目标、行业分布、工具和时点差异;若无法形成可检验机制则暂时搁置
🤖 AI 实操建议
① 本次发言纠错:三重差分不要求三个政策必须在时间上彼此错开
王硕说“三重差分要求三个政策在时间和个体维度上交错”,这个说法不准确。DDD 的关键是第三个差异维度能够形成有意义的反事实比较并满足相应识别假设;它并不机械要求“三项政策错时发布”。不过,如果两个政策在样本中始终同时发生、处理变量完全共线,就确实无法分别识别它们各自的效果。应把放弃理由改为“现有样本缺少可分离的处理变化”,而不是“DDD 规定政策必须错时”。
② 本次发言纠错:企业韧性不能直接命名为产业链安全
企业韧性通常描述企业承受冲击、恢复或适应的能力;产业链安全则涉及网络层的关键依赖、替代路径、集中度和系统性中断风险。可以把企业韧性作为一个组成维度或稳健性变量,但不能只改变量名称就完成概念替换。更直接的设计是:把企业放在供应—技术关联网络中,模拟随机节点失效与关键节点失效,观察最大连通分量、可达性或关键技术覆盖的下降幅度。
③ LP 法先复现,再决定是否使用
LP 法利用中间投入代理不可观测生产率冲击,以缓解投入选择的同时性问题;它不是简单把某个变量“替代进去”就得到 TFP。建议先在公开示例数据上复现生产函数,记录产出、资本、劳动、中间投入及价格平减口径,再审计自己的企业数据是否具备同样字段。直接可用的决策句是:“若关键投入缺失或行业价格平减无法统一,本研究不把 TFP 作为主结果变量。”
⚠️ 风险预警
- 用企业层指标回答产业网络层问题,会出现分析层级错配
- 两期基金覆盖对象、行业与宏观环境均不同,简单比较系数不等于识别政策工具优劣
- 从现成论文复制公式但没有统一变量定义、平减基期和样本筛选规则,TFP 结果不可复现
🎯 四、朱丹晨:绿色创新效率指标与双政策协同识别
📚 研究历程
朱丹晨前期围绕后 Transformer 时代新兴技术弱信号识别,积累了 BERTopic、多源数据融合及新颖性、关注度、成长性测度经验。进入大论文阶段后,她把研究问题拉回公共管理领域,逐渐聚焦“互联网+政务服务”试点与低碳城市试点共同影响城市绿色创新效率的选题。
前两周,她完成了五章框架、双政策作用逻辑和绿色创新效率数据摸底。本周进一步比较劳动力、资本、能源投入,经济与技术期望产出,以及污染非期望产出,并开始从参考论文反推双政策协同的实证形式。现在的关键不是继续增加指标,而是给每一项指标明确生产过程中的角色,并把“两个政策同时存在”与“两个政策产生超出单独效应的协同”区分开。
📝 本次(2026-08-20)
你的汇报(指标体系与协同模型)
- 检索中外文研究后认为城市绿色创新效率常同时考虑创新投入、经济或技术期望产出以及污染非期望产出
- 倾向用新产品销售收入而非地区生产总值表示创新成果的经济转化,并继续寻找建成区绿化覆盖率的替代指标
- 注意到现有数据库难以提供“绿色创新活动本身产生的污染”,准备对工业废水、二氧化硫、颗粒物和固废等代理指标补充局限说明
- 参考双试点论文,拟把两个政策均已在同一城市生效的状态记为 1,并进一步比较双政策、单政策和无政策城市
林老师指导
- 建成区绿化覆盖率体现绿色结果但不直接体现创新,不宜仅因数据容易获得就放入创新产出
- 期望产出的分类应避免“经济产出—创新产出”这种上下位概念混用,可按经济转化与技术成果划分
- 污染排放能否作为非期望产出,要解释它与所设定创新生产过程的对应关系,并坦诚城市层面数据无法细分到绿色创新活动
- 双政策协同的估计流程应寻找权威方法依据,除双政策组外还要与两个单政策组和无政策组形成清晰比较
⏭️ 下次预期(下一次组会)
- [ ] 完成指标证据矩阵,逐项记录变量角色、单位、城市覆盖、年份、来源、采用文献和概念局限
- [ ] 用 10 个城市、5 个年份搭建小样本 DEA/SBM 表,检查新产品销售收入、绿色专利和污染指标的缺失与量纲问题
- [ ] 把政策状态拆成无政策、仅数字政务、仅低碳、双政策四类,并画出各城市状态随年份变化的时间线
- [ ] 写出包含两个政策主效应与交互项的候选模型,明确“联合效应”“增量效应”“协同效应”分别对应哪个估计量
🤖 AI 实操建议
① 本次发言纠错:双政策同时为 1 的系数不能自动证明协同
朱丹晨把“双政策均生效记为 1,再看该系数是否显著”解释为协同效应,这个口径不充分。该虚拟变量首先识别的是双政策状态相对基准组的联合差异;要讨论统计意义上的协同,至少要同时建模两个政策的主效应与交互项,并明确协同是相对于加法基准还是其他反事实。若只有“双政策 vs 无政策”,无法区分效果来自政策 A、政策 B,还是两者额外的互补作用。分期实施时还要处理不同采用时点,不能机械套用传统双向固定效应;可参考多期 DID 原始方法论文。
② 本次发言纠错:非期望产出不必严格限定为“新产品产生的污染”
林老师提出污染必须是“新产品的废水、新产品的二氧化硫”,这个要求对城市层面的标准 DEA/SBM 生产可能过窄。非期望产出应与研究者定义的生产可能集合一致:若评价的是城市研发—成果转化—产业化的综合绿色创新效率,工业污染可以作为产业化阶段的环境代价;若只评价研发阶段,它就可能错位。关键是明确边界并做替代口径,而不是要求现实统计中通常不存在的“逐项新产品污染”。一项三阶段网络 SBM 研究就把新产品销售收入作为期望产出、工业污染作为产业化阶段的非期望产出,见指标与模型说明。
③ 直接可用的四组比较框架
先生成 A_it(数字政务生效)、B_it(低碳试点生效)和 A_it × B_it。报告 A、B 的单独关联,交互项的增量,以及四种政策状态的预测结果;再逐一核对处理前趋势、样本构成和共同支持。论文里可先使用“联合政策效应”,只有理论机制与增量检验都支持时再升级为“协同效应”。
⚠️ 风险预警
- 新产品销售收入通常有统计对象范围限制,不能不核对口径就当作所有城市、所有企业的创新收入
- DEA/SBM 会把指标选择直接写进效率前沿,概念错位不能靠后续回归修复
- 四类城市的政策时点与样本量可能很不均衡,交互项显著也不等于识别假设自动成立
🎯 五、马婧怡:新能源汽车政策选题、语义测度与章节结构
📚 研究历程
马婧怡一直在政策文本、专利文本和新能源汽车技术演化之间寻找公共管理问题。她先后整理中美政策,梳理动力电池、固态电池等技术方向,并精读政策文本与专利文本贴近度研究。近期,选题逐渐收束到“新能源汽车产业政策如何影响企业技术创新”,同时保留用文本相似度识别政策导向与策略性响应的可能性。
前一次汇报主要解决“治理效能、导向效应、激励效应”如何命名,本周则把问题推进到题目必须明确影响对象、企业层级是否必要、DID 与语义模型如何连接,以及硕士论文各章应承担什么研究任务。当前不是把所有方法都放进目录,而是先决定核心结果变量,再让语义测度和 DID 各自在识别链条中有清楚位置。
📝 本次(2026-08-20)
你的汇报(题目、策略性响应与论文目录)
- 提交了两个题目版本,但“新能源汽车产业政策影响研究”“对企业技术的影响”仍未说清具体结果变量
- 观察到相近研究常落到企业层面,开始思考是否需要把专利匹配到企业;目前企业在理论和实证中的角色尚未确定
- 希望在 DID 识别政策影响后,再用政策—专利文本相似性和专利质量讨论企业是否存在策略性迎合
- 搭建了理论、产业现状、语义向量构建和 DID 等章节,但方法名称与章节研究目的尚未对齐,部分内容仍停留在“把模型放在哪一章”
林老师指导
- 题目必须写清政策影响谁、影响技术的哪个方面;不能因为参考论文省略了对象,就在自己的题目中继续保持模糊
- 企业和地区只有在理论机制、样本单位或异质性分析中承担明确角色时才需要加入,不能仅因其他论文都写企业就机械跟随
- 传统政策效应与策略性响应可以先视为两条路线,再判断能否形成“先识别总体影响、再辨别响应性质”的递进章节
- 目录标题应表达该章解决什么问题,而不是罗列“向量构建”“DID”等工具;理论、概念和现状也要为后文分析服务
⏭️ 下次预期(下一次组会)
- [ ] 提交 3 个完整题目版本,分别对应技术创新数量、技术方向贴近度、策略性响应,并为每个题目写一句可检验研究问题
- [ ] 画出“政策文本—企业专利—语义相似度—政策冲击—创新质量”的变量图,标明每个变量在 DID 中的角色
- [ ] 用 20 家企业做小样本,验证专利申请人匹配、政策前后文本相似度和至少两类质量指标是否可计算
- [ ] 参照本校已公开学位论文重写二、三、四章标题,每章注明研究目的、输入数据、方法和输出结论
🤖 AI 实操建议
① 本次发言纠错:DID 与语义分析并不是“有一个就不用另一个”
林老师说“只做 DID 的话,第三章和语义没关系”,这在结果变量是普通专利数量时成立,但不是一般结论。如果论文研究政策是否改变企业技术方向,政策—专利语义相似度可以用来构造结果变量或政策暴露度,DID 则负责估计政策冲击前后的差异。两者分工是“测量什么”与“如何识别影响”,并不天然冲突。真正需要删除的是没有进入变量、机制或检验的孤立语义章节。
② 策略性迎合不能只靠“文本像、引用少”判定
高政策相似度加低引用可能与策略性响应一致,但也可能来自技术较新、引用窗口短、行业引用习惯不同或专利组合策略。OECD 的专利质量指标研究使用固定 5 年或 7 年前向引用窗口,并把引用、权利要求、专利族规模、续费等多类信息组合比较。建议把“迎合”操作化为预先定义的多指标模式,而不是一条引用阈值。
③ 三个可直接修改的题目版本
- 稳妥版:新能源汽车产业政策对企业技术创新的影响研究——基于企业专利数据的准自然实验
- 导向版:新能源汽车产业政策的技术导向效应研究——基于政策—专利语义贴近度的证据
- 递进版:新能源汽车产业政策如何改变企业技术响应?——创新产出、技术导向与策略性响应的检验
先选择一个主问题。若使用递进版,必须证明三个结果之间是逻辑递进而非简单堆叠。
⚠️ 风险预警
- 企业层分析会引入申请人别名、子公司归属和企业进入退出等数据工程
- 用政策后相似度定义处理组,再用 DID 估计政策效果,会把结果信息泄漏进处理变量
- 专利质量评价若没有固定引用窗口和多指标校验,会系统性低估较新的专利
🎯 六、南迪柯:BERTopic 预计算嵌入与缓存复用
📚 研究历程
南迪柯在完成本科论文答辩后,开始系统补充文本分析方法。从 LDA、困惑度曲线到 Sentence Transformers、BERTopic、主题可视化、层次聚类和动态主题模型,她的学习路径已经从理解概念逐渐转向独立配置环境、运行代码、保存结果和解释输出。
上周她用 bert-base-chinese 练习批量编码,并开始区分 token 隐藏状态与句向量。本周继续跟随 BERTopic 实战教程,学习预先计算并缓存文档嵌入,再在多轮降维、聚类和参数调整中复用。这个步骤看似只是提速,实际上也是实验可比性的基础:只有固定同一批文档表示,后续参数变化才能更清楚地归因于 UMAP、HDBSCAN 或主题表示环节。
📝 本次(2026-08-20)
你的汇报(预计算嵌入)
- 学习了 BERTopic 预计算嵌入的用途:文本编码成本较高,反复调参时可一次计算、多次复用
- 按教程加载数据和编码模型,使用 pipeline 生成向量,再把向量交给 BERTopic 完成聚类
- 初步理解缓存嵌入能够跳过重复编码、缩短后续实验时间
- 本周因无法共享屏幕,主要口头汇报流程,尚未展示缓存文件、数组形状和自有数据结果
林老师指导
- 预计算嵌入对后续反复调参非常重要,应把它固定为正式实验流程的一部分
- 在继续做下一个教程实验的同时,换用自己的数据把前面流程重新跑一遍
- 不能只复述视频步骤,要能够重新加载缓存、复现实验并解释每一步输入输出
⏭️ 下次预期(下一次组会)
- [ ] 用一份自有文本生成文档嵌入,保存文本 ID、模型名、向量维度、生成时间和预处理版本
- [ ] 关闭编码模型后从缓存重新加载,在 BERTopic 中复现主题数、离群值比例和代表文档
- [ ] 固定同一嵌入,仅改变 UMAP 或 HDBSCAN 的 2—3 组参数,形成参数—结果对照表
- [ ] 打印并解释
documents数量、embeddings.shape、主题标签长度和索引顺序,证明文本与向量没有错位
🤖 AI 实操建议
① 本次发言纠错:pipeline 输出不一定已经是文档向量
南迪柯把 pipeline 概括为“创建词向量模型并加载词向量”,这个表述不够准确。feature-extraction pipeline 常先返回 token 级隐藏状态;是否得到一篇文档一个向量,取决于教程是否做了 pooling。BERTopic 接受的是与文档逐行对应的预计算文档嵌入。正式文档说明可见 fit(docs, embeddings) 接口。下次必须展示最终数组是否为 文档数 × 向量维度,而不是只看到程序能运行。
② 缓存的不只是数组,还要缓存实验身份
建议同时保存:文本 ID 顺序、原始文本文件哈希、模型完整名称、最大长度、pooling 方法、是否归一化、软件版本和随机种子。否则下周看到一个 embeddings.npy,无法判断它对应哪批文本、哪种预处理,也无法证明新旧实验可比。
③ 直接可用的最小验证
保存后立刻做三项检查:len(docs) == embeddings.shape[0];随机抽 5 个文本 ID 与向量行号核对;重新加载后用 allclose 检查数值一致。然后只改一个聚类参数,比较主题数、离群值比例和代表文本。这样才能把“运行更快”升级为“实验可复现”。
⚠️ 风险预警
- 文本清洗后顺序变化而沿用旧缓存,会造成无报错的文本—向量错位
- 更换编码模型、pooling 或归一化方式后不能继续共用旧嵌入
- 固定嵌入只控制了编码环节;UMAP、HDBSCAN 的随机性和参数仍需单独记录
散会
本周六位同学看似分别在改图、跑回归、选题、搭指标、改目录和学缓存,实际都碰到了同一个问题:一个方法只有在研究对象、变量口径和证据链上找到位置,才算真正进入论文。下一次组会少带一点“模型能运行”,多带一点“它为什么必须在这里”。
🎭 本周彩蛋
📢 本周金句
“企业韧性强的话,间接表示产业链安全,但是也不完全是。”
—— 林超然,讨论企业指标与产业网络指标的边界
这句话适用于本周几乎所有议题:税率不完全等于政策处理,双政策同时出现不完全等于协同,文本相似不完全等于策略性迎合,缓存成功也不完全等于实验可复现。研究常常从“像”开始,最后要靠定义和证据走到“是”。
🧠 本周新词
- 基准布局:先用一张信息最完整的网络确定所有节点位置,再让其他年份沿用同一张“地图”。
- 规格搜索:尝试多种回归设定;若按显著性挑结果就是风险,若事先限定并完整报告则可用于敏感性检查。
- 生产可能集合:DEA/SBM 中对“投入如何转化为期望与非期望产出”的边界定义,指标只有放进同一生产故事才有意义。
- 预计算嵌入:先把文本统一编码并存盘,后续调聚类参数时不用让模型反复“背同一篇课文”。
本周实验室的研究对象可以概括为六种“不要急”:网络图不要急着上色,DID 不要急着找星,选题不要急着改名,指标不要急着塞满,目录不要急着安放模型,BERTopic 不要急着重复算向量。至于导师回微信这件事——日志显示,它也进入了一个尚未公开参数的异步队列。
林超然 · 整理于 2026-08-20