组会记录 2026-07-23

汇报顺序:
硕 3: 周书发 → 文柘青 →
硕 2: 李浩铭 → 管明露 → 李山岚 →
硕 1: 王硕 → 朱丹晨 → 马婧怡 →
准硕 S2026: 南迪柯 → 杨瑞豪

注:本期组会记录由 Claude Opus 4.7 基于录音转文字稿与各位同学的历史组会档案归纳整理。文章按每位汇报同学分节,包含「研究历程」「本次要点」「下次预期」「AI 实操建议」四部分。可能存在由音频转换、AI 幻觉造成的错误(特别是 AI 实操建议节中的论文 DOI、工具名、政策文件号),请阅读时甄别,以实际组会过程中的表达为准。


2026-07-23 组会记录

本期讨论 3 位(按汇报顺序)

  1. 🎯 管明露:小论文专家意见收束与大论文专利数据补齐
  2. 🎯 李山岚:算力创新 Y 值成形与实证数据入口
  3. 🎯 王硕:国社科结题排版与小论文投稿前检查

🎯 一、管明露:小论文专家意见收束与大论文专利数据补齐

📚 研究历程

管明露的小论文从集成电路新兴技术识别一路推进到会议汇报和投稿前检查。早期她围绕 BERTopic、HTM、轮廓系数、新兴度和成熟度惩罚机制构建识别流程,后续又不断补充高质量文献、流程图、创新点表述和公式细节。最近几次组会,她的工作重点从“方法能不能讲清楚”转向“外部专家听完之后,还会追问哪些口径”。

大论文则沿着小论文识别结果继续往政策计量方向走:以集成电路政策、上市公司面板数据、专利识别结果和 DID/中介效应为主线。本周的状态很清楚:小论文专家意见总体可控,不需要推倒重算;大论文已经搭起企业面板框架,下一步要把 121 家集成电路上市公司在 2015-2025 年的中国专利数据补进来,完成“先识别、再计量”的接口。

📝 本次(2026-07-23)

你的汇报(专家意见与大论文数据)

  • 会议专家主要追问指标构建、新兴度定义、轮廓系数成熟性,以及授权发明专利存在滞后性的问题
  • 小论文数据中曾排除中国受理局,导致当前 14 万条样本主要来自国外专利;若补中文检索式和中国样本,需要重新合并至约 16 万条并重跑
  • 大论文面板数据框架已建立,包含企业字段、处理组虚拟变量、X/Y 变量和年份等信息
  • 下一步需要在智慧芽中检索 121 家集成电路上市公司 2015-2025 年中国受理局专利,并下载后用 Python 标注新型/普通技术

林老师指导

  • 专家提出的指标构建、新兴度、轮廓系数问题都可以通过文献依据和方法说明回应,不构成实质性障碍
  • 授权发明专利的滞后性可在文中说明;如果数据实际覆盖到 2025 年初,基本可视为 2024 年底前应授权的专利已较充分体现
  • 小论文不建议为中国样本重新大规模重算,可把研究目的表述为从全球其他国家专利中识别中国之外的新技术动向,为国内关键领域预警提供借鉴
  • 大论文专利可先扩大到全部专利类型下载,若数据量约 5-8 万条仍可处理;先完成新型技术识别,再与企业面板合并进入计量

⏭️ 下次预期(下一次组会)

  • [ ] 在小论文方法或数据说明中补一句“使用授权发明专利可能存在公开/授权滞后”的限定
  • [ ] 重写国外专利样本的研究定位,说明其用于发现中国之外的新技术动向和预警意义
  • [ ] 下载 121 家上市公司 2015-2025 年中国受理局专利,优先保留可用于识别和匹配的字段
  • [ ] 用现有代码标注新型/普通技术,生成企业-年份层面的专利指标并与面板数据合并

🤖 AI 实操建议

① 小论文的数据口径可以改成“全球预警视角”

不要把“排除了中国受理局”解释成防重复,这个理由确实容易被追问。更稳妥的写法是把样本边界转成研究目的:

鉴于关键核心技术突破往往首先在国际专利布局中留下信号,本文以中国之外的全球授权发明专利为样本,识别集成电路领域潜在新兴技术方向。该样本并不用于刻画中国本土专利活动全貌,而是用于观察国际技术前沿变化,并为我国关键领域技术预警提供参照。

这样写的好处是承认边界,同时把边界变成研究问题的一部分。

② 大论文下载前先做字段清单

建议先固定一张字段表,避免下载后发现关键字段缺失:

字段 用途 必要性
申请人/专利权人 匹配 121 家上市公司及其简称 必要
申请日/公开日/授权日 生成年份口径,处理授权滞后 必要
标题、摘要、权利要求 新型技术识别输入 必要
专利类型 发明、实用新型、外观等口径对比 必要
IPC/CPC 分类 技术领域控制或补充识别 推荐
引用/被引 质量或稳健性指标 可选

如果下载平台限制批量导出,优先保证必要字段,不要为了可选字段牺牲可复现性。

③ “先识别、再计量”要保存中间表

建议输出三张表:patent_raw.csv 保存原始专利,patent_labelled.csv 保存新型/普通技术标注,firm_year_panel.csv 保存企业-年份聚合结果。后续 DID 出问题时,可以快速判断是检索口径、识别算法,还是面板合并导致的。

方法资源可对照 WIPO 的 IPC 分类入口:https://www.wipo.int/classifications/ipc/en/ 。如果后续进入多期 DID 或政策暴露度设计,可先看 Callaway & Sant’Anna 的 DID 方法和 R 包入口:https://bcallaway11.github.io/did/ 。

⚠️ 风险预警

  • 小论文数据口径只能“转化解释”,不能在文中暗示包含了中国专利全貌
  • 企业简称匹配容易误匹配到子公司、关联公司或同名主体,需抽样核验申请人字段
  • 全部专利类型可以先下载,但主结果最好准备“发明专利口径”和“全类型口径”的稳健性对比

🎯 二、李山岚:算力创新 Y 值成形与实证数据入口

📚 研究历程

李山岚的大论文已经从“算力创新能不能作为公共管理选题”进入实证准备阶段。前期她经历过 GPU 技术融合、府际协作、区域算力创新、城市算力技术创新等多次题目收束,核心变化是把技术对象从过微观的硬件,推到更能承接政策冲击的城市算力技术创新。6 月以来,她先处理检索式和专利下载,随后进入数据清洗、城市匹配、指标合成和 DID 数据结构搭建。

本周的进展非常实质:专利年份筛到了 2010-2025 年,既保留了 2019 年政策前足够的观测期,也没有让早期稀疏专利拖累数据质量;六个指标已经逐步汇总,综合 Y 值也用熵权 TOPSIS 算出一版。现在论文真正来到“结果会不会支持理论”的门口。下一步不是继续讨论概念,而是找控制变量、中介变量,跑出第一版多期 DID,再反过来检验指标体系和研究目的是否咬合。

📝 本次(2026-07-23)

你的汇报(Y 值与实证入口)

  • 将算力专利样本筛选至 2010-2025 年,保留约 16 万多条数据,以覆盖 2019 年政策前后的城市-年份面板
  • 对六个指标进行了城市-年份汇总,部分指标采用城市当年均值相对于全国当年均值的处理,以削弱时间积累差异
  • 被引数量处理后已经变成相对值,需要进一步确认文献中相同处理方式的命名是否仍可称为“被引次数”
  • 使用熵权 TOPSIS 合成综合 Y 值,后续若计量结果不理想,可切换合成方法作为替代口径

林老师指导

  • 2010-2025 年口径可以先保留,尽量多下载和整理数据,防止后续政策前期样本不足
  • 被引指标经过全国当年均值标准化后,名称最好核对参考论文,避免“次数”和“相对值”不一致
  • 指标体系要大量引用成熟论文,尤其说明城市创新或数字技术创新指标如何迁移到 AI 算力技术创新
  • 控制变量和中介变量可从数据库中寻找,必要时购买 CNRDS 等数据并在组内共享;同时要警惕指标体系与研究目的之间的贴合度

⏭️ 下次预期(下一次组会)

  • [ ] 整理“六个指标-计算公式-原始字段-标准化方式-文献来源”表
  • [ ] 核对被引相对值的变量命名,准备 2-3 个可选名称并附参考论文
  • [ ] 从 CNRDS 或统计年鉴类数据库中筛选控制变量和中介变量,形成候选变量清单
  • [ ] 跑出第一版多期 DID 基准结果,并同时保留熵权 TOPSIS、等权或单项指标稳健性接口

🤖 AI 实操建议

① 先把 Y 值做成“可答辩表”

建议现在就整理这张表,后面写第三章和第四章都能直接用:

维度 指标 城市-年份计算方式 标准化/相对化 变量名建议 文献依据
数量 专利申请量 城市当年算力专利数 可取 log(1+x) patent_count 待补
质量 被引表现 城市当年被引均值/全国当年均值 相对化 relative_citation_intensity 待核
宽度 知识宽度 IPC 分布或类别数 标准化 knowledge_breadth 待补

这张表要回答两个问题:每个指标为什么属于算力创新,为什么这样处理不会把时间早晚差异误当作城市能力差异。

② 被引指标不要硬叫“次数”

如果已经除以全国当年均值,可以考虑这些名称:相对被引强度、标准化被引水平、城市专利相对影响力。直接可用写法:

为削弱不同申请年份带来的引用积累时间差异,本文将城市-年份层面的平均被引数量除以全国同年平均被引数量,得到相对被引强度。该指标反映某城市算力专利在同一年份背景下的相对影响力,而非原始引用次数。

这样答辩时就不容易被“你这已经不是次数了”卡住。

③ 控制变量先按机制分组,不要从数据库乱捞

可以先列 4 类:城市经济基础、创新资源投入、数字基础设施、产业结构。每类先找 2-3 个变量,再去 CNRDS、城市统计年鉴或《中国城市统计年鉴》里核对可得性。CNRDS 入口可先从官网核对:https://www.cnrds.com/ 。综合指标构建可参考 OECD/JRC 综合指标手册:https://doi.org/10.1787/9789264043466-en 。

⚠️ 风险预警

  • 熵权 TOPSIS 可以作为主方法试跑,但要准备等权合成或单项指标检验,防止结果被认为是权重方法驱动
  • 算力技术创新的定义必须回到检索式和文献支撑,不能只说“参考别人指标体系”
  • 控制变量越多不一定越好,先保证变量和机制有关、时间跨度完整、城市口径一致

🎯 三、王硕:国社科结题排版与小论文投稿前检查

📚 研究历程

王硕的主线一边是存算一体典型企业 fsQCA 小论文,一边是国社科结题材料和相关报告的合稿排版。小论文已经走过企业筛选、BERTopic 主题识别、TOE 框架、fsQCA 组态解释、AIGC 痕迹处理和专家意见吸收等环节,最近的任务集中在投稿前收束:匿名化、字数、摘要、参考文献和格式细节。

国社科结题材料则更像一次大型版本整合。前面李浩铭、李山岚、王硕分别负责不同部分,图表、章节、字体、标题层级、参考文献和正文格式很容易在合稿中漂移。本周王硕已经把格式规范查到学校研究生院模板,并发现 Word 版本缺图、正文未两端对齐、引用格式还需最后统一等问题。接下来的关键是先把缺图和合稿顺序处理好,再做全文级排版,避免重复返工。

📝 本次(2026-07-23)

你的汇报(结题排版与论文投稿)

  • 按学校研究生院官网格式调整了结题材料标题层级和正文样式;四级标题暂按三级标题小一号处理
  • 发现 Word 版本中正文图件缺失,虽然目录有图号,正文没有对应图片
  • 将异常段落样式统一成正文,并准备后续统一表格样式、参考文献角标和引用格式
  • 小论文已按目标期刊投稿信息隐去作者姓名,字数压到 11500 多字,准备会后发老师审阅

林老师指导

  • 缺失图件不是内容丢失,PDF 中有图,后续会把图打包发到结题群里供插入
  • 正文需要设置两端对齐,先在 Word 段落设置中统一检查
  • 参考文献角标、表格样式等可等最后合稿后统一处理,避免其他部分更新后重复改
  • 合稿顺序大致为:李浩铭部分完成后交给王硕整合,随后交给李山岚更新第一章,最后由王硕做全文排版和参考文献插入

⏭️ 下次预期(下一次组会)

  • [ ] 接收并插入缺失图件,核对图号、图题和正文引用是否一致
  • [ ] 统一正文两端对齐、标题层级和段落样式,先保留一份排版前备份
  • [ ] 等李浩铭内容合并后生成完整版,再交李山岚更新第一章
  • [ ] 将小论文匿名版发老师审阅,重点检查字数、作者信息、摘要和参考文献格式

🤖 AI 实操建议

① 合稿先做“图表引用核对表”

建议用一张表把缺图问题一次性查清:

编号 正文引用位置 图/表标题 当前状态 来源文件 处理动作
图 3-1 第三章第 X 页 待补 Word 缺失/PDF 有 老师图包 插入并重排
表 X-X 待核 待核 已有 当前 Word 统一格式

这张表的作用不是好看,而是防止“目录有、正文没”“正文有、目录不更新”“图题改了、文中还引用旧名”三种常见问题。

② Word 排版尽量靠样式,不要手工刷格式

正文、一级标题、二级标题、三级标题、四级标题、图题、表题、参考文献各设一个样式。之后需要改字号或行距时,只改样式定义,不逐段手工改。四级标题如果模板没有规定,可以临时定义为“三级标题字号减小一档”,但要在内部说明中记下,便于最后统一口径。

③ 小论文投稿版做一轮“匿名化清单”

直接检查这些位置:封面、页眉页脚、作者贡献、基金项目、致谢、文件属性、图表注、参考文献中的自引表述。Zotero Word 插件说明可查:https://www.zotero.org/support/wordprocessorplugin_usage ,参考文献样式可从 Zotero Style Repository 检索:https://www.zotero.org/styles 。

⚠️ 风险预警

  • Word 和 PDF 版本内容不一致时,不要只看目录,应逐图逐表核对正文实际对象
  • 参考文献角标最好等全文稳定后统一处理,否则插入/删除段落会反复改变编号
  • 匿名投稿不仅是删作者名,文件属性、基金信息和图表注释也可能泄露身份

散会

本周的共同主题,是把“已经能做出来的东西”改成“别人能相信的证据链”。管明露要把小论文的数据边界解释清楚,并把大论文专利识别接入面板;李山岚要让 Y 值、指标名称和文献依据互相对上;王硕则要把结题报告和小论文都收束到可提交版本。

下一次组会最值得期待的产物也很具体:一张企业专利字段清单,一张算力创新指标依据表,一张图表引用核对表。研究和合稿走到这一步,靠的不是更多灵感,而是每个接口都不掉链子。


🎭 本周彩蛋

📢 本周金句

“数据别改了,找一个方式,把这件事说明白就行。”

这句话说的是管明露的小论文数据口径,其实也是本周的共同方法论:不是所有问题都要靠重算解决。有些时候,真正需要补的是研究边界、变量命名和版本说明。

🧠 本周新词,一句生活化类比

  • 授权滞后:像成绩单要等教务系统审核后才显示,考试已经发生了,但正式记录会晚一点出现。
  • 相对被引强度:像不直接比谁收到的掌声多,而是看同一场演出里你比平均掌声高多少。
  • 熵权 TOPSIS:像先看每个指标能不能拉开差距,再把选手排到理想答案附近。
  • 图表引用核对表:像给论文里的每张图办登机牌,图号、标题、正文引用和实际文件都要对得上。

🔮 下周占卜

基于本周轨迹,纯属虚构;如有雷同,纯属命中注定。

  • 管明露会进入一座专利检索迷宫。121 家上市公司排成一列等候验明正身,申请人字段在门口反复变脸;她手里拿着“新型/普通”的双面印章,先把 8 万条专利送进识别炉,再把企业-年份面板从另一端接出来。
  • 李山岚会坐上多期 DID 星舰,船舱里六个指标争着给 Y 值命名。被引次数举手说自己已经不是原始次数,熵权 TOPSIS 默默推来一张排名表,控制变量则在数据库星门外排队等待下载许可。
  • 王硕会成为结题报告的排版指挥官。缺失图件从 PDF 城堡里陆续归队,正文段落接受两端对齐检阅,参考文献角标暂时按兵不动,直到最终合稿的钟声敲响。

林超然 · 整理于 2026-07-23