本期组会成员(按年级;实际汇报者依发言顺序):
硕 3: 李浩铭 → 管明露 → 李山岚
硕 2: 朱丹晨(请假) → 王硕 → 马婧怡
硕 1: 南迪柯 → 杨瑞豪
本科生(大二): 张恩豪 → 李政杰(请假)
本记录由 AI 依据 2026-09-30 两份时间轴转录及既有研究档案整理。南迪柯单独沟通已在其个人章节标为“会外单独沟通”;李政杰负责的工行杯修订依据 2026-09-27 现场办公录音,另列“会外专项工作”。两段会外材料均不计入 9 月 30 日组会发言。具体事实请按各自原始转录核对;AI 实操建议与导师当场意见分开。
2026-09-30 组会记录
本期讨论 8 位(按汇报与交流顺序)
- 🎯 李浩铭 — 双试点、控制变量与城市合作网络
- 🎯 管明露 — 集成电路政策论文的主线收束
- 🎯 李山岚 — 异质性、机制指标与中期稿
- 🎯 王硕 — 小论文投稿与结题报告修订
- 🎯 马婧怡 — 新能源汽车政策与专利技术布局
- 🎯 南迪柯 — 主题建模复现、运行环境与会外选题讨论
- 🎯 杨瑞豪 — 技术分叉早期预警文献复核
- 🎯 张恩豪 — 交易核验与融资价值报告
另附:李政杰负责的 9 月 27 日工行杯现场办公修订工作,作为会外专项记录,不计入本次 8 位组会汇报者。
一、李浩铭
双试点、控制变量与城市合作网络
📚 研究历程
李浩铭此前从城市创新与专利数据出发,逐步将双试点政策、跨城市联合申请和合作网络连接起来。上次组会要求明确联合专利的判定、网络节点与边,并尽快形成图表。本周进入数据来源与变量补齐阶段:研究从“网络能否构造”推进到“何种关系构成何种网络指标”。
📝 本次(2026-09-30)
本次汇报:城市控制变量与专利关系网络
- 补充人均 GDP、产业结构等城市控制变量,并说明 CNRDS 与城市统计年鉴的关系。
- 在联合申请之外加入专利引用关系,讨论关系嵌入与结构嵌入;第三章已写,第四章因变量补齐待重跑。
林老师指导
- 核实数据来源,待实证跑通后再修改第一、二章;网络概念应与实际关系定义相符。
⏭️ 下次预期(暂定 2026-10-08)
- [ ] 带来控制变量来源及覆盖年份表、第四章首轮结果、联合申请与引用网络的边定义。
🤖 AI 实操建议
① 先拆开两类关系。 联合申请连接的是共同申请主体,专利引用连接的是知识引用事件;二者不能直接合成同一个“关系嵌入性”而不说明含义。分别写清城市映射、边方向、权重、年份及自引处理,再决定是否组合。
② 今天即可执行。 先用十条专利人工核验申请人城市、共同申请和引用城市,再跑全量程序。可直接使用表头:专利号|申请年|申请人城市|被引专利号|被引城市|关系类型|边权|原始来源。CNRDS 若转录了统计年鉴数据,应注明实际使用的数据库和原始统计口径,避免把二者并列成两个独立数据来源。
③ 验收与分支。 抽样记录能回到专利号和城市字段、每项网络指标都能由边表重算,才进入回归。若引用关系缺少可靠的城市或年份映射,先保留联合申请网络,引用网络作为待核扩展。网络计算可核对 NetworkX 官方文档(具体指标定义需甄别)。
⚠️ 风险预警
- 控制变量新增后样本年份或城市可能变化,报告加入前后的样本数,不能把规格变化误说成“控制后更稳健”。
- 引用边有方向且可能跨期,不能沿用无向联合申请边的中心性解释。
二、管明露
集成电路政策论文的主线收束
📚 研究历程
管明露此前围绕集成电路创新基地政策、发明专利与新兴技术口径反复调整论文结构。上次讨论提出先让章节和结果变量对齐,再决定题目是否保留“新兴技术”。本周将研究主线暂时收束到较明确的集成电路产业政策与技术创新,留出中期之后再考虑扩展的余地。
📝 本次(2026-09-30)
本次汇报:去掉新兴技术口径后的论文结构
- 整理第三至第五章,报告政府支持的中介分析及融资约束、研发人员占比的调节分析;相关结果为学生现场汇报,尚需核对表格。
- 目前全文已不以新兴技术为对象,第一、二章仍需同步改写。
林老师指导
- 认为聚焦集成电路政策的题目可以成立;先完成全文,中期后再决定是否增加新兴技术分析,完稿后共同过细节。
⏭️ 下次预期(暂定 2026-10-08)
- [ ] 带来不含新兴技术的完整稿、章节—变量对应表及当前模型结果表。
🤖 AI 实操建议
① 固定研究对象。 把题目、摘要、研究假设、结果变量和结论中的“技术创新”逐处核对;若变量仍是发明专利数量,应解释它测的是创新产出的一种口径,不能自动代表创新质量或所有新兴技术。
② 今天即可执行。 建一个四列表:章节|研究问题|变量与样本|对应结果表。逐章标出仍保留“新兴技术”的句子,先删去不再支持的承诺,再改引言和理论。把机制变量的测度、时间顺序和结果附在表后。
③ 验收与分支。 全文概念与结果表一致,机制和调节分别有明确模型与解释,才算中期稿闭合。若政府支持与政策处理同期共同变化,需谨慎解释中介,不能仅以显著性证明机制。分期政策估计可参考 Stata 异质性 DID 说明(方法适用性需甄别)。
⚠️ 风险预警
- 转录中的“都显著”只是一场汇报的描述;公开结论仍须回查版本、样本和表格。
- 去掉新兴技术后,图表标题、英文摘要与政策建议也要同步,避免正文口径漂移。
三、李山岚
异质性、机制指标与中期稿
📚 研究历程
李山岚此前已重画事件研究和安慰剂图,完成 PSM-DID 与城市规模分组;导师要求直接检验组间处理效应差异,并先形成中期稿的最小闭环。本次汇报扩展了城市分组结果,机制指标仍在核查,异质性文字尚待完成。
📝 本次(2026-09-30)
本次汇报:城市分组结果与机制检验
- 按行政等级、地区、投资强度和人口规模做分组;报告部分组显著、部分组不显著,文字解释尚未完成。
- 尝试科技支出、科技人才和互联网用户等机制代理指标,当前中介分析未得到预期结果。
林老师指导
- 继续参考同类论文核查指标定义及不同处理方式;中期前争取完成文字,必要时向有经验的同学讨论。
⏭️ 下次预期(暂定 2026-10-08)
- [ ] 提交分组定义与样本量表、异质性文字稿、机制指标及全部尝试结果记录。
🤖 AI 实操建议
① 直接纠正一个判断口径。 讨论中把“一组显著、一组不显著”视为异质性可用,这不能证明两组效应存在显著差异;必须在同一模型里检验组间系数差或交互项。两个分开的 p 值不能替代差异检验。这是统计解释问题,与研究方向偏好无关。
② 今天即可执行。 为四种分组建表:分组阈值|各组城市数|各组样本数|两组效应估计|效应差|差异检验 p 值。机制另建 理论路径|指标定义|来源|预定符号|样本覆盖|模型结果 表。先记录已试过的所有口径,再按理论与数据质量决定保留项。
③ 验收与分支。 若组间差异检验不支持异质性,就写“分组估计有差别但差异未获统计支持”;若机制变量对政策有响应而对结果的路径证据不足,就如实报告,不强求“两条显著中介”。分期处理效应可用 Stata 异质性 DID 官方说明 检查模型前提(需甄别)。
⚠️ 风险预警
- 反复按显著性换分母、对数或样本,容易形成选择性报告;保留完整规格日志。
- 科技支出等机制代理指标须与结果变量的构造项、政策处理定义逐项核对,避免变量角色重叠后机械解释为机制。
四、王硕
小论文投稿与结题报告修订
📚 研究历程
王硕持续修改存算一体相关小论文及配套结题报告。此前组会已把引言逻辑、研究思路图和参考文献核验列为重点。本周汇报小论文进入投稿环节,结题报告也按论文当前表述更新,工作重点由新增分析转为跨文档一致性与投稿后反馈。
📝 本次(2026-09-30)
本次汇报:投稿稿与结题报告对齐
- 口头报告小论文已投稿;调整研究思路图、引言措辞、标题与结论中的实践表达。
- 更新结题报告的样本、变量校准表位置、机构名称、局限性以及中英文摘要。
林老师指导
- 讨论 TOE(技术—组织—环境)框架与 fsQCA(模糊集定性比较分析)组合的文献使用;投稿后先等待反馈,再考虑标题如何突出实质创新。
⏭️ 下次预期(暂定 2026-10-08)
- [ ] 带来投稿状态或回执核验、与投稿稿一致的结题报告及版本差异清单。
🤖 AI 实操建议
① 区分“已有使用”与“创新”。 TOE 加 fsQCA 是否少见,不能只靠一次检索结果判断。更重要的是说明 TOE 怎样规定条件选择,fsQCA 怎样回答配置问题,专利文本或数据处理具体新增了什么。方法组合出现次数少本身不等于方法创新。
② 今天即可执行。 保存投稿系统状态截图或回执编号;对照投稿稿和结题报告,制作 位置|投稿稿表述|结题报告表述|是否一致|修订理由 清单。引用文献逐项核验题名、年份、DOI 与该句是否被原文支持。
③ 验收与分支。 若期刊退稿,再根据正式意见和目标期刊字数规则修题目;若进入后续审稿,保持投稿版本冻结,不把会后修改误作已提交稿。文献核对可使用 Crossref 官方检索(检索结果仍须回原文甄别)。
⚠️ 风险预警
- 组态分析讨论的是条件组合与结果的关联或充分性,不应被写成某单一条件的净效应因果证明。
- 口头称“已投稿”与系统回执核验是两件事;本记录保留这一状态区别。
五、马婧怡
新能源汽车政策与专利技术布局
📚 研究历程
马婧怡此前在新能源汽车产业政策、技术演化与专利文本之间寻找公共管理研究问题,并考虑双重差分(DID)设计。本周从宽泛的“技术演化”转向政策所关注的技术与企业专利布局,但概念命名、专利范围和处理组划分仍需先形成可检查的方案。
📝 本次(2026-09-30)
本次汇报:政策技术关注与专利技术布局的开题设计
- 展示题目备选、政策编码、专利聚类及向量表示思路;现有尝试先选企业再取其专利,并做了初步回归。
- 询问全国政策是否具备对照组,以及政策时间点和企业技术布局如何连接。
林老师指导
- 查“技术关注”是否为有依据的术语;先界定新能源汽车技术领域,再检索专利并由申请人识别企业。
- 写清政策编码、专利分类、向量、DID 处理与对照组的技术方案,发导师确认后再写代码和开题大纲。
⏭️ 下次预期(暂定 2026-10-08)
- [ ] 提交术语检索记录、专利检索边界、政策—企业—技术—年份映射与 DID 方案一页纸;导师核对后再形成开题大纲。
🤖 AI 实操建议
① 先确认可识别的处理,并纠正现场的一处方法表述。 林老师提出用未被新能源汽车政策重点关照的汽车企业作对照,这是可以检验的候选方案,但仅凭“不在政策重点领域”不能断定它们就是有效对照;两组在政策前的结果趋势、政策暴露与同时发生的其他变化仍须核查。林老师随后说政策实际执行力度与发布时间不完全一致是 DID 的共性问题,“不需要考虑”。作为对本研究的操作指引,这句话不准确:双重差分仍需清楚定义处理时点和处理暴露;无法观察执行强度时应说明估计对应的是政策发布或资格暴露的效果,并做可行的敏感性检验,不能把实际执行效果直接等同于发布效果。核验依据是 DID 对处理组、对照组和处理时点的识别要求;见 Stata 异质性 DID 文档(具体研究适用性仍需甄别)。
② 今天即可执行。 建两张表。政策表:文件名|机关|发布日期|生效日|针对技术|适用对象|原文条款;专利表:专利号|申请年|技术分类|申请人|企业归属|是否属于预定义领域。先固定领域检索式并人工抽样核对,再批量编码。概念检索同时记录“技术关注”近义说法的原文与定义。
③ 验收与分支。 若找不到稳定的处理时点与可信对照组,应改为描述性技术布局研究或重新选政策,不把普通回归称为因果效应。若能明确受影响技术、可比未受影响单元及政策前趋势,再讨论 DID 和分期处理方法。参看 Stata 异质性 DID 文档(适用性需甄别)。
⚠️ 风险预警
- 先选少数企业会遗漏领域内专利,也可能纳入这些企业在领域外的专利。
- 讨论中“专利主题至少上百个”是探索性判断,不是通用阈值;主题数要由数据规模、稳定性和人工解释共同决定。
六、南迪柯
主题建模复现与会外选题讨论
📚 研究历程
南迪柯此前练习 LDA 与 BERTopic,逐步从跑通示例转向理解分词、嵌入、主题数及可复现性。上次组会重点讨论文献阅读和中文分词规则。本周将切词结果和向量保存后复用,运行速度已有改进,但同一环境随后报错,形成了需要留痕的工程问题。
📝 本次(2026-09-30)
本次汇报:向量缓存、随机种子与环境报错
- 复用上周切词结果并保存中间向量;固定随机数以减少结果波动。
- 重开内核后仍遇到运行失败,尚未确认是依赖冲突、资源不足还是其他原因。
林老师指导
- 保存详细报错和依赖信息;已有流程跑通过,可在真实数据阶段继续排查,并考虑可复现的环境配置。
📎 会外单独沟通(同日,另份录音)
组会后,林老师与南迪柯另谈一个专利文本研究切口:从明确的技术瓶颈出发,探索专利资料能否提示替代技术或解决路线。这是会外提出的候选题目,尚未用真实数据验证,也没有确定最终识别算法。林老师建议先取得适用的专利数据,完成专利文本的主题分类,并为每个主题生成向量;随后再比较基于技术网络和不依赖网络的识别路线。网络若以文本相似性连边,必须解释边所代表的技术关系,不能把相似直接当作可替代。跨领域非近邻替代、图像相似性等被留作后续探索,首篇论文先跑通最小流程。导师谈到可提供已有专利数据,但录音不能证明数据已经交接;假期另约讨论的日期也未确定。
⏭️ 下次预期(暂定 2026-10-08)
- [ ] 带来最小复现代码、完整报错、环境依赖记录和缓存数据说明。
- [ ] **会外讨论事项:**核对专利数据的交接与使用范围,带来主题分类、主题向量的最小实验记录;具体选题和算法待后续讨论。
🤖 AI 实操建议
① 不把猜测写成诊断。 “环境里的包损坏”“随机数导致崩溃”都只是现场猜测。同一数据复现失败,需要先记录异常栈、操作系统、Python 与包版本、内存峰值,再定位是哪一步失败。
② 今天即可执行。 用十条脱敏样本依次运行读取、分词、嵌入、降维和聚类,每步保存输入行数、耗时与错误。最小日志字段:步骤|输入哈希|包版本|随机种子|输出形状|耗时|错误栈。在同步目录外新建独立环境,再用冻结的依赖文件重跑;参看 Conda 官方环境管理文档(具体命令需与安装版本核对)。
③ 验收与分支。 最小样本连续两次得到相同的主题分配与关键输出,再扩大数据;若只在大样本失败,优先排查内存与批量处理。固定随机种子不保证所有平台和并行算法逐位一致,因此还要保存模型、版本及输入哈希。
④ 会外选题的最小验证。 在同一专利样本上比较“单篇专利向量取均值”和代表专利向量等主题表示,人工审读各主题的代表专利与最近邻候选。直接可用的记录字段:技术瓶颈|主题编号|主题代表专利|向量构造方式|候选替代技术|替代机制证据|人工判断。若只有语义接近而缺少功能替代依据,成果只能称“候选检索”,不能称已找到替代方案。主题向量表示与网络连边各自设验收标准;会外方案仍需真实数据检验。
⚠️ 风险预警
- 缓存的切词和向量若与原始文本版本不一致,会得到看似快速但不可解释的结果。
- 不在同步目录创建环境、依赖或缓存;环境修复与研究数据版本应分别记录。
- 讨论中提及的专利数据、后续选题与假期会谈尚未核验为已交接、已定题或已排期。
七、杨瑞豪
技术分叉早期预警文献复核
📚 研究历程
杨瑞豪此前学习 BERTopic、计量识别及随机试验文献。本周转向一篇技术分叉早期预警研究,检查指标来源、面板门槛结果与样本外验证。阅读重点已从“模型能否算出阈值”推进到“阈值是否真能提前预警”。
📝 本次(2026-09-30)
本次汇报:预警指标、引文与验证结果
- 发现若干引文与被支持的叙述未直接对应;讨论某个转录为“TPBI/TTBI”的原创指标是否有充分方法依据,缩写待回原文核实。
- 报告门槛两侧斜率变化,但滚动窗口的预测表现有限;论文自身将结论定位为提示性证据。
林老师指导
- 逐条核对缺少摘要的文献是否真能支持对应说法;与导师线下讨论更贴合经管问题的后续分析设计。
⏭️ 下次预期(暂定 2026-10-08)
- [ ] 带来引文—原文逐项核对表、指标原文定义及备选验证方案;线下讨论时间另定。
🤖 AI 实操建议
① 直接纠正指标单位。 转录把 AUC 说成“0.5%”、召回率说成“0.714%”。若原文表格分别是 0.5 和 0.714,这些通常是 0–1 的比例,换成百分比应为 50% 和 71.4%;不能原样加百分号。必须回原论文确认数值、样本和指标定义,再写公开结论。AUC 约 0.5 仅表示该次验证中接近随机排序,不能推出所有设置均无预测价值。
② 今天即可执行。 建 论文句子|所引文献|原文页码或段落|是否直接支持|可替换来源 表;预警结果另建 训练窗口|测试窗口|阳性率|AUC|精确率|召回率|阈值 表。缺摘要的数据库记录需查原出版物,不能让 AI 凭题名补写研究内容。
③ 验收与分支。 引文每条可回原文、预测指标有清楚分母和样本外划分,才可讨论实用性。若样本外表现弱,就如实保留“提示性证据”定位;若要声称可用的预警规则,需与简单基线比较并复核误报成本。指标定义可查 scikit-learn 官方平均精确率文档(与论文具体算法需甄别)。
⚠️ 风险预警
- 门槛模型中两侧斜率不同不等于预警有样本外领先性。
- 原转录的指标缩写和小数点可能误识别,正式稿须以论文原文为准。
八、张恩豪
交易核验与融资价值报告
📚 研究历程
张恩豪上次与李政杰参与供应链交易核验讨论,重点涉及合同付款规则、履约证据、金额核对及融资中的核验责任。本次报告沿着“交易事实怎样进入融资判断”继续推进,呈现为四步结构。
📝 本次(2026-09-30)
本次汇报:交易证据到融资价值的四步报告
- 报告多源材料统一与交易画像、合同和履约匹配、融资价值转换、融资后风险管理四部分。
- 在 LaTeX 稿中标出语言不妥处,报告已能完成初次编译。
林老师指导
- 对反复出现的表达问题,可归纳成可复用的提示词规则;若只需完成当前稿,可直接修订 LaTeX 并重新生成。
⏭️ 下次预期(暂定 2026-10-08)
- [ ] 提交修订后的报告、标黄问题处理记录,并先核对本段汇报人身份。
🤖 AI 实操建议
① 给四步各设一项可检验的输出。 交易画像应有材料来源清单,合同—履约匹配应有差异记录,融资价值转换应写清银行实际使用的信息,融资后管理应界定预警触发与核验人。这样报告不会只有流程名称。
② 今天即可执行。 从标黄段落抽出五类常见问题,使用表头 原句|问题类型|事实来源|修改句|是否改变原意;每修改一处就回到原材料核查。LaTeX 中文引号统一使用 Unicode 弯引号,并按项目规范设置 XeCJK 字符类别。
③ 验收与分支。 报告编译成功、四步都有输入和输出、每项事实能回到来源,即可提交当前版;若银行核验成本或责任分配仍缺依据,标为待核问题,不在公开报告中当作已证实结论。排版问题可查 LaTeX 项目官方文档(具体发行版需甄别)。
⚠️ 风险预警
- 合同约定不等于已经履约,凭证缺失时不能直接认定真实交易。
- 报告中关于真实交易、融资价值和风险控制的事实陈述,仍须逐项核对来源;汇报人归属确认不等于报告内容已获核验。
📎 会外专项工作:李政杰负责工行杯报告修订
来源与归属。 以下来自文件名日期为 2026-09-27 的工行杯筹备现场办公录音,与 9 月 30 日组会转写分开。录音没有可用于逐句确认李政杰发言的说话人轨道;导师于 9 月 30 日明确将录音中讨论的报告修订工作分配给李政杰。因此这里记录的是李政杰负责的工作,不是他在 9 月 30 日组会上的汇报,也不表示修订已经完成。
现场讨论的修订重点
- 先定位录音所审的报告版本,再调整封面与摘要,核对“脱核”等术语的正式定义;理顺章节标题、第二章的问题与需求对应关系,并在第六章后补独立结论。
- 第一章须把市场数据与中小供应商融资需求之间的证据链写清,不能用规模以上工业数据直接证明中小供应商的融资需求;第二章扩写问题表现和业务后果,以问题—业务需求关联图替换原表 2.1。
- 图表统一白底和标题口径,正文解释图中关系与步骤,并补银行端、供应商端流程图;第五、六章核对案例标注、推广路径与风险控制表述,清理口语化句式。
- 全文核对缩写释义、引文格式和参考文献对应关系;合成案例必须保留准确标识,不能写成已验证的真实案例。
李政杰的执行与验收。 按上述现场意见整理修订稿,交付版本定位记录、修改清单、关键图表和引用核对表。当前报告稿路径及修订完成情况尚未核验;详细分工保存在内部工行杯项目任务表。
AI 核查提示。 现场讨论指出报告的证据和表达边界,并不能据此把原稿问题直接归为李政杰个人发言错误。修订时须逐项标明数据支持的对象、案例性质和图表所表达的关系;录音中的图号、模型名称及术语近音转写应回到当前稿和正式材料核对。
散会
本次反复出现的共同问题是先固定研究对象、数据口径与检验标准,再解释模型结果。南迪柯的专利瓶颈候选题目已在其章节以“会外单独沟通”单列;李政杰负责的 9 月 27 日工行杯修订另作会外专项记录。下次组会暂定 10 月 8 日,具体时间另议。
🎭 本周彩蛋
📢 本周金句
“你先定义新能源企业的这个技术边界……然后由这个范围去确定检索式。”
—— 林超然,讨论马婧怡的专利样本构造(据时间轴转录整理标点)
从研究对象反推检索边界,比先抓一批熟悉的企业更容易说明样本究竟代表什么。
🧠 本周新词
- 关系嵌入:看城市之间有没有共同申请或引用等联系;不同联系须分别定义。
- 结构嵌入:看城市处在网络什么位置,离不开已定义的节点和边。
- AUC:把阳性排在阴性前面的总体排序能力指标;应先核对数值单位和测试样本。
这周最受欢迎的研究助理大概是“先存好中间结果”;它不会替大家写论文,但至少愿意让下一次运行早点下班。
林超然 · 整理于 2026-09-30