本期组会成员(按年级及固定顺序):
硕 3: 李浩铭 → 管明露(请假) → 李山岚
硕 2: 朱丹晨 → 王硕 → 马婧怡
硕 1: 南迪柯 → 杨瑞豪
大 2: 张恩豪 → 李政杰
本记录由 AI 依据 2026-10-08 组会转录及既有研究档案整理。报告采用固定顺序;逐段识别稿保留录音原顺序。AI 实操建议与导师现场意见分开,转录中段内多人混合的部分保留核对标记。
本期讨论 9 位
- 🎯 李浩铭 — 双政策效应辨析与网络机制写作
- 🎯 李山岚 — 机制指标依据与中期文字闭环
- 🎯 朱丹晨 — 绿色创新效率的劳动投入与双政策样本
- 🎯 王硕 — 结果变量选择、基金进入识别与估计对象
- 🎯 马婧怡 — 政策—技术匹配与研发方向变化的测量
- 🎯 南迪柯 — BERTopic 参数理解与真实专利抽样
- 🎯 杨瑞豪 — 新闻语料合并与技术路径研究的数据准备
- 🎯 张恩豪 — OpenAlex 小样本检索与元数据入库
- 🎯 李政杰 — 中文文献跨库匹配与开放获取类型
一、李浩铭
双政策效应辨析与网络机制写作
📚 研究历程
自 2025 年秋已有的研究记录以来,李浩铭持续围绕政策与技术创新展开工作。早期学位论文从双试点政策组合切入,逐步把政策评价与城市创新联系起来;另一条学术论文线则积累了专利分析和网络建模经验。到 2026 年 9 月,组会重点转向政策年份、联合专利口径、城市合作网络的构建及首轮实证图表。9 月 30 日继续讨论双试点与网络指标,本周进入回归解释、网络嵌入测度和章节写作的衔接。当前需要区分“网络指标已经算出”“机制检验已经运行”和“机制解释已经成立”三个进度层次。历次交流常按数据、模型、图表依次展开,可以转化为方法与结果的写作结构;本次口头汇报仍不能替代对代码和回归表的核验。
📝 本次(2026-10-08)
本次汇报:双政策效应辨析与网络机制写作
- 报告城市样本因缺失值而缩减,询问样本覆盖的说明方式。
- 讨论双政策回归结果与预期的差异、事件研究图和网络嵌入指标;关系嵌入与结构嵌入已经计算,机制检验尚待进一步核实。
- 散会后的补充交流继续讨论效应方向及数据处理,纳入本节。
林老师指导
- 说明样本缺失原因和保留样本的地区覆盖;核对双政策系数究竟代表哪一种比较。
- 查明平行趋势检验的判断条件,保留画图数据;将过程型标题改成围绕机制解释的标题。
- 现场也提出了对效应方向的期待以及调整数据处理的想法;相应方法边界见下方 AI 核查。
⏭️ 下次预期(暂定 2026-10-14 下午)
- [ ] 提交样本删减说明、模型方程与系数含义对照表,说明政策组合相对单项政策及无政策状态的比较。
- [ ] 补充事件研究检验说明、可重画图件的原始输出和以机制目的命名的章节稿。
🤖 AI 实操建议
① 先纠正“结果该是什么样”的判断标准。 林老师提出组合效应最好满足某种大小次序、整体负效应“不好解释”,李浩铭也因结果违背预期而考虑修改处理。负向结果本身不是模型错误,政策效应并无必须为正的统计规则;不得以把结果改成理想方向作为删样本、换指标或处理离群值的依据。此处纠正的是判断规则,不能据此断言当前回归已经正确,也不认定当事人已经实施不当修改。方法选择须有独立理由并完整披露,参见 ASA 关于统计显著性的声明(需甄别与具体模型的适用关系)。
② 把三种比较拆开。 仅在采用含 A、B 和 A×B 的线性加总模型,且共同参照状态与识别条件成立时,双政策相对无政策的总效应为 βA+βB+βAB;βAB 是偏离简单加总的部分。负交互系数不等于组合总效应为负,组合优于某个单项也不等于超加总协同。若实际使用四状态虚拟变量、分别回归或分期 DID(双重差分),必须按真实估计量重写比较。现有转录没有方程与完整回归表,尚不能判定学生是否误读了系数。
③ 今天即可执行。 冻结目前数据、代码及结果,列出各模型的因变量、参照组、政策时点、固定效应和标准误,再核对处理组编码、城市匹配与缺失规则。导出表头:模型|估计对象|线性组合|估计值|置信区间|解释。另列删前与删后的城市覆盖、基期特征及政策状态,地区仍有覆盖不等于选择偏差已经消失。
④ 验收与分支。 每条协同结论应对应明确估计对象及可复核检验。若编码或样本选择存在错误,按有依据的规则修复并保留旧结果;若检查后方向仍与预期不同,如实解释,不能继续搜索到变号为止。网络指标计算完成只说明测量完成,尚不自动构成因果机制证据。
⚠️ 风险预警
- 多政策先后实施可能使简单交互回归难以解释。
- 事件研究图看起来平不能证明平行趋势;不能为改善图形移动估计点。
- 机制指标已算出不代表机制已识别,标题与结论必须对应实际检验。
二、李山岚
机制指标依据与中期文字闭环
📚 研究历程
自 2025 年秋的研究记录以来,李山岚的学位论文经历了从府际协作、GPU 技术融合到人工智能政策与城市算力创新的收束。2026 年上半年逐步明确政策对象、城市层面的结果指标和专利数据口径,随后进入多表合并、清洗与城市匹配。9 月的组会已讨论事件研究、安慰剂检验、匹配后的双重差分和异质性结果;9 月 30 日进一步聚焦城市等级、地区、投资强度及人口规模的分组解释,以及机制代理变量的理论依据。本次从继续寻找机制指标转向尽快完成正文,把已有检验转化为可审阅的论文。她通常能明确说明自己做到哪一环,但有结果仍需逐步转化为有定义、有代码、有解释的证据链;中期阶段尤其要保留未获得统计支持的尝试。
📝 本次(2026-10-08)
本次汇报:机制指标依据与中期文字闭环
- 尝试在信息相关行业就业人数之外加入科研与技术服务就业人数,作为人才集聚的代理指标。
- 计划先完成现有实证部分的文字,机制扩展和溢出分析视时间与研究需要再定。
林老师指导
- 先写已有主体内容,安排对策建议章节,未完成部分保留与证据相匹配的空间。
- 不要求机械凑足显著中介数量;可以报告有信息量的不显著结果。
⏭️ 下次预期(暂定 2026-10-14 下午)
- [ ] 提交现有实证章节文字稿及对策建议框架,机制结果同时呈现估计依据与局限。
- [ ] 补充人才集聚指标定义、构成与依据,保留已尝试机制的完整结果。
🤖 AI 实操建议
① 直接纠正“不显著=假设不成立”。 李山岚将不显著结果概括为假设不成立,林老师随即认可,这一表述不准确。不显著通常只能说明在既定模型、数据和检验下,没有足够证据拒绝相应原假设,不能证明机制不存在。可直接改写为:“本样本与当前识别条件下,尚未获得支持该机制的充分统计证据;估计方向、置信区间和识别限制见表。”依据见 ASA 统计显著性说明(需甄别具体检验对象)。
② 人数相加不自动得到人才集聚。 两个行业就业人数能否相加,取决于统计范围、单位、人员是否重叠和概念定义;即使不重叠,相加也更直接反映相关行业就业规模。若称集聚,还需说明相对于城市人口、就业总量或其他基准的空间集中含义。林老师现场表示表面上可以使用,应视为允许继续写作的工作安排,不能当作指标有效性已经核验。以显著性决定是否增加行业,会使测量理由倒置。
③ 今天即可执行。 先冻结所有尝试,建立 机制假设|理论来源|变量公式|分子分母与单位|样本|处理方式|估计值与区间|保留理由 表。分别写清理论为何预期人才渠道、变量实际测量什么、现有结果能支持到哪一步。若指标只能测规模,应收窄名称与解释;若需要集中度指标,先论证,再作为独立敏感性规格检验,不能只留显著版本。
④ 验收与分支。 初稿要让读者复核指标来源、处理规则和各项机制,而不是凑两个显著中介。若理论路径合理而估计不精确,报告不确定性;若代理变量偏离概念,先修改测量与措辞。是否增加空间模型由明确问题决定,不以篇幅决定。中期正式日期以学院通知核对,转录中的月份与“还有一两周”不能合并为确定截止日。
⚠️ 风险预警
- 逐步回归显著不自动证明因果机制,处理后中介还需额外识别假设。
- 对策建议不得超出当前证据,增加控制变量不能代替研究贡献。
- 下周写完是本人计划,不等同于已提交或已核验完成。
三、朱丹晨
绿色创新效率的劳动投入与双政策样本
📚 研究历程
朱丹晨在 2026 年上半年围绕数字治理与绿色政策的共同作用探索学位论文,把公共管理问题与城市层面的效率评价联系起来。6 月开始比较低碳城市等政策组合,9 月 9 日已形成开题框架,并讨论超效率 SBM(松弛变量测度)及双政策识别的衔接。9 月 23 日因劳动投入指标的适配问题,曾考虑转向绿色经济效率。本次重新比较文献与数据后,回到城市绿色创新效率,重点核查行业从业人数、全社会研发人员与规模以上工业企业研发人员的覆盖。她习惯报告数据平台、时间范围和缺失情况,能够把抽象指标问题落到数据取得环节。接下来需要把可获得性与概念有效性分开判断,同时确认双政策重叠样本能否支撑既定问题。
📝 本次(2026-10-08)
本次汇报:绿色创新效率的劳动投入与双政策样本
- 比较三类劳动投入代理指标,倾向先使用科研与技术服务相关行业从业人员,继续从省级和市级年鉴补齐数据。
- 发现跨年统计名称和分类可能变化;双政策重叠城市较少,计划先验证数据和模型,再调整开题稿。
林老师指导
- 优先验证城市数据能否取得,兼顾各类代理指标的缺陷。
- 采集后绘制年度曲线检查断点,先跑通主流程,再决定开题报告调整;曲线与统计口径的关系见 AI 核查。
⏭️ 下次预期(暂定 2026-10-14 下午)
- [ ] 提交劳动投入指标的来源、单位、年份覆盖与缺失表,并补齐可获得的城市数据。
- [ ] 带来双政策重叠样本清单和初步运行结果,据此调整开题稿。
🤖 AI 实操建议
① 明确纠正两项口径。 朱丹晨把研发人员全时当量描述为达到一定科研时长才计入,容易误解为单纯人数门槛。正确口径是按实际研发工作量折算成人年,不能与行业从业人数直接等同。依据见国家统计局指标解释(需甄别所用年鉴的具体制度版本)。林老师提出曲线不跳即可视作口径一致,这也不充分:名称变化、分类调整和调查范围变化可能相互抵消,图形连续不能证明统计可比。
② 今天先做口径对照。 在旧、新两期年鉴逐项抄录表名、脚注、统计范围、行业分类依据、计量单位和城市覆盖,并与同一城市的省级表核对。可直接使用 城市|年份|年鉴表号|原指标名|单位|调查范围|行业代码|是否可比|证据页码。对地质勘查是否仍包含在内,现有转录存在先后纠正,没有原表就保持待核,不能宣布某一年全国统一改变范围。
③ 把效率测量和政策识别分开验收。 劳动投入应服务于绿色创新的生产过程,较易取得只解决可执行性,不自动解决概念适配。另建城市—年份政策状态表,区分无政策、仅 A、仅 B、A 与 B 同时存在,并记录进入时间。重叠样本少可能影响可比性、精度和识别支持,但没有“少于某个城市数必定不能做”的通用门槛。分期处理可参看 did 作者文档(需甄别:普通二元分期 DID 不直接解决所有双政策问题)。
④ 分支与交付。 若名称变了但定义可比,用证据解释衔接;若范围确实变了,尝试可追溯重构、限制可比时期或替代测量,并保留不同口径的结果。若双政策状态缺少足够的可比样本,先收窄识别问题,再改标题和开题稿。验收以原表可回查、指标可复算、政策状态可核对为准,不能只看模型成功运行。
⚠️ 风险预警
- 行业从业人数不等于全社会研发投入,也不专指绿色研发。
- 缺失年份不能机械插值跨过真实制度断点。
- 不以论文数量或模型复杂度单独判断结果变量优劣。
四、王硕
结果变量选择、基金进入识别与估计对象
📚 研究历程
王硕此前以存算一体领域的企业研究积累了文本测量和模糊集定性比较分析经验,2026 年春夏持续修改论文结构、图表及引文,9 月重点收敛因果措辞并准备投稿。学位论文则从产业链安全的概念和测度出发,逐渐转向基金投资与企业层面的政策评价。9 月的讨论已强调先界定概念,再核验指标与对照组接口。本次考虑以 ESG(环境、社会和公司治理)表现作为结果变量,同时讨论股东记录、投资进入年份及不同估计方法的关系。这仍是研究方案比较阶段,不能把候选结果变量写成已经定题。王硕常按修改点逐项报告,适合将本轮讨论落成方案对照表,说明哪些问题由数据解决、哪些问题仍依赖识别假设。
📝 本次(2026-10-08)
本次汇报:结果变量选择、基金进入识别与估计对象
- 讨论小论文投稿反馈与后续转投安排,具体期刊与处理记录留在内部档案。
- 提出以企业 ESG 表现替代此前结果变量,比较双重机器学习和 CSDID 的估计安排,并考虑产权性质与产业链环节分组。
- 已取得部分企业数据,拟用股东记录识别基金进入与时间。
林老师指导
- 继续检查投稿系统中是否有意见,会后商议投稿去向。
- 核对 ESG 指标的计算依据与底层数据可得性;若不能支持拟议改进,再考虑其他结果变量。
- 核对股东名称和进入年份,保留已有企业数据用于方案验证。
⏭️ 下次预期(暂定 2026-10-14 下午)
- [ ] 核对投稿反馈入口并与导师商议转投方案。
- [ ] 提交 ESG 来源、底层数据可得性及备选结果变量说明;整理基金名称与企业进入年份的小样本核验表。
🤖 AI 实操建议
① 先把 ESG 从“一个算法”还原成测量体系。 会上把 ESG 三个字母与合成算法连在一起讨论,但 ESG 本身并不规定唯一统一算法;不同机构的评价目标、行业比较方式和底层指标可能不同。例如 MSCI 官方说明采用自身的行业相对评级方法(需甄别:这不等于本次准备使用的数据库就是 MSCI)。目前不知道学生拟取得的数据供应商与版本,不能直接认定其指标有缺陷,更不能把简单换权重当作创新。林老师关于工作量的判断属于论文设计意见,不是可由这段转录核验的事实错误。
② 今天即可执行。 先取有明确来源的一小份数据样本,填 供应商|评价目标|原始层级|覆盖年份|评级公布日|数值方向|修订历史|允许用途。若只有总分,不宣称能复算整个体系;若有分项,也先确认分项与底层原始指标的差别。直接可用的研究表述是:“本文使用某机构某版本的企业 ESG 评价,测量其所定义的表现;不同测量口径作为敏感性分析,不将任一评级当作无误差真值。”
③ 基金进入不能只靠当期名称命中。 用基金主体及可核验的投资载体清单匹配股东名称,逐案记录披露日、持股时点和首次可观察进入日。当前记录未命中,可能是历史缺失、持股披露范围或间接投资造成,不能立即当作从未受投。按企业代码和年份关联时,先排查更名、重复与频率转换。分组回归与逐步变量筛选也应分开命名,避免代码做的事情和论文描述不一致。
④ 验收与分支。 对照表中说明 DML(双重机器学习)与 CSDID(分组—时期双重差分)各自估计什么、使用哪些样本与假设;换方法名称不增加独立证据。分期进入的背景可参看 Callaway–Sant’Anna 作者文档(需甄别适用前提)。若测量可靠且识别有贡献,可以保留成熟评级;若测量缺陷有证据且底层数据足够,再设计改进,不能仅为增加工作量重造指标。
⚠️ 风险预警
- 当前尚未核验数据来源,不能把拟购买或 AI 描述写成已取得可靠数据。
- 不同方法若估计不同对象,系数不宜直接当作互相验证。
- 投资进入可能具有选择性,完整企业面板仍不自动带来因果识别。
五、马婧怡
政策—技术匹配与研发方向变化的测量
📚 研究历程
马婧怡的既有研究记录从政策文本采集和比较逐步转向政策如何影响技术演化。2026 年春整理政策、专利及文本向量化方法,6 月已明确讨论新能源汽车政策与研发方向,并批判仅凭文本贴近就作因果解释的做法。9 月继续比较语义表征与双重差分设计,本次用新旧政策与细分技术进行对应,同时回看以向量变化刻画研发方向的思路。研究主线一直包含两个不同环节:先测量政策指向什么技术,再识别技术变化是否由政策引起。她的交流常从文本粒度、数据接口和实际处理困难切入,能及时发现政策语言与专利术语的尺度差异;下一步要把这些困难写成可检验的测量误差与识别限制。
📝 本次(2026-10-08)
本次汇报:政策—技术匹配与研发方向变化的测量
- 用大模型匹配新旧政策与细分专利技术,区分新增、延续等类别,试做政策前后数量比较。
- 讨论专利数量与研发方向变化两条路径;政策和专利文本粒度不同,语义测量及 DID 设计仍需收束。
林老师指导
- 写清提示词、人工验证和匹配失败后的复核流程,解释选择某类政策变化的理论理由。
- 不能因为某类结果更明显就选用;重新比较数量与语义方向指标,尽快单独讨论。
⏭️ 下次预期(暂定 2026-10-14 下午)
- [ ] 提交政策—技术匹配流程说明,附提示词、人工核验与复检设计。
- [ ] 带来数量指标与语义方向指标的方案对照,写清后者如何成为可比较的结果变量,并尽快与导师单独讨论。
🤖 AI 实操建议
① 先把探索和验证分开。 马婧怡提出看哪类变化更明显再用哪类,这可以帮助探索问题,但不能把同一批结果筛选后的方案当作预先设定的验证。林老师当场要求补充理论理由是必要提醒;还应保留全部探索结果,不能只为最终显著类别补写故事。数据驱动选择会改变结论的解释,依据见 ASA 方法透明性声明(需甄别)。本次没有正式估计量与数据,尚不能判定其 DID 结果是否有效。
② 今天即可建立两张表。 第一张表记录 政策原句|技术定义|代表专利|匹配理由|模型及提示词版本|人工判断|争议处置,允许一对多和无法判断,不强制每条技术归类。第二张表记录 研究问题|观察单位|政策时点|结果变量|对照来源|测量验证|识别风险,并列数量变化和方向变化。先固定政策类别判定,再看政策后的技术结果,避免结果反过来决定处理组。
③ 给方向指标一个可解释版本。 可先探索“企业某年技术向量与固定政策目标向量的余弦距离变化”,明确距离减少表示向该目标靠近;相邻两年向量间的角度只表示变化幅度,不能单独表示朝政策方向移动。跨年必须使用可比的编码空间,并说明政策目标向量是否在政策后才构建。这个例子是 AI 建议,不是本次已经确定的模型。先用人工能判断的技术迁移正反例测试测量,再考虑进入因果估计。
④ 验收与分支。 若人工核验发现政策层级太粗,就采用分层映射或收窄技术范围;若语义距离与人工方向判断不一致,先改测量,不能依靠后续回归补救。若没有可信对照与政策前趋势,即便前后变化明显,也只能作为描述性证据。与导师讨论时带一页决策表,明确主指标、备用指标、待解决的最关键识别条件,并保留未被采用方案的理由。
⚠️ 风险预警
- 不把专利数量直接等同于创新质量,也不把文本相近等同于政策因果效应。
- 用政策后的文本训练分类、再据此构造处理类别,可能引入结果信息。
- 是否微调嵌入模型应由验证结果决定,不能以评审是否熟悉算法作为理由。
六、南迪柯
BERTopic 参数理解与真实专利抽样
📚 研究历程
南迪柯在此前训练中先复现 LDA(潜在狄利克雷分配)主题模型,再学习文本嵌入和 BERTopic 的组合流程。2026 年 7 月已开始独立运行句向量实验,9 月继续练习分词、停用词和结果解释。9 月 30 日尝试复用分词与向量中间结果,随后遇到环境问题;同日会外讨论提出从技术瓶颈出发探索替代路线的候选方向,先用专利完成主题分类与主题表示。本次重建环境后跑通剩余示例,开始比较主题数、主题归属得分和离群点。她通常能具体说明报错与参数改动,后续要把运行记录扩展成有控制变量的实验记录,避免将教程里的默认参数解释为对所有真实数据都成立的规律。
📝 本次(2026-10-08)
本次汇报:BERTopic 参数理解与真实专利抽样
- 重建环境并报告剩余示例已运行,演示主题大小、主题缩减、词项处理和主题归属得分。
- 比较 UMAP 的 min_dist 参数设置,发现离群点数量未按原先预期变化。
林老师指导
- 在已交接的大文件中先抽取小比例样本跑通分类,再评估全量运行。
- 比较主题向量的构造方式,查找除组内均值之外的可行表示;参数调整应保留解释与记录。
⏭️ 下次预期(暂定 2026-10-14 下午)
- [ ] 从已有专利文件抽样跑通主题分类,提交抽样规则、运行记录和主题输出。
- [ ] 整理主题向量构造方法的对照,比较组内均值与备选表示。
🤖 AI 实操建议
① 直接纠正参数含义。 南迪柯认为 mindist 为 0 时离群点应最少,这不是算法保证。mindist 控制 UMAP 低维表示的紧密程度,并非 HDBSCAN 判定离群点的单一距离阈值;离群数还受数据、降维随机性及聚类设置影响。林老师把它解释成形成聚类的最小距离也不准确。参见 UMAP 参数说明(需甄别安装版本)。同时,多输出一组主题归属得分并不让结果自动“更权威”,仍需要人工与任务评价。
② 自动主题数也需要负责解释。 林老师说让算法定主题数即可免责,不准确。自动结果仍由嵌入、降维、密度参数和语料共同决定;研究者需要解释并检验这些选择。nr_topics 的缩减是在已有主题基础上进一步合并,不能简单理解为从头把全部文档重新分成指定类数。参见 BERTopic 参数文档及概率输出说明(均需甄别具体聚类器)。
③ 今天即可执行。 固定一份可复现抽样、嵌入缓存和随机种子,只改变一个参数,记录 样本哈希|模型版本|降维参数|聚类参数|主题数|离群比例|代表文本人工评价|耗时与内存。先检查语料重复与极短文本,再比较参数;约 1% 是本次起跑建议,不是质量最优比例。为观察波动可另作多随机种子实验,明确与固定种子的对照目的不同。
④ 主题向量的验收。 在相同主题分配上,比较成员向量均值与代表文档向量,检查近邻主题是否有真实技术联系。直接可用表头为 主题|表示方法|代表专利|最近邻|人工相似判断|可能替代的功能证据。若近邻只共享词汇,则只能叫检索候选;若均值被宽泛或重复文本支配,先检查数据和主题边界。样本运行可复现、主题可解释且资源消耗可估计后,再扩大规模。
⚠️ 风险预警
- 不以结果符合预期为唯一调参目标,不把离群点越少当成越好。
- 聚类归属得分不等于人工真值概率,不宜据此直接声称分类准确率。
- 依赖环境、缓存和抽样测试输出放在同步目录外的指定缓存目录。
七、杨瑞豪
新闻语料合并与技术路径研究的数据准备
📚 研究历程
自 2026 年 9 月有记录的入组训练以来,杨瑞豪先用外文专利练习 BERTopic、主题缩减和技术路径分叉问题,同时带入本科阶段的计量分析经验。9 月 23 日分享随机试验与规模化研究的阅读工具和方法理解,9 月 30 日转向技术分叉早期预警论文,复核指标依据、引用对应和样本外验证。本次交流从论文方法转向大规模新闻语料的准备,讨论两套新闻数据的字段统一、缺失月份与后续模型替换。此前对预警研究的疑问仍作为研究判断的背景,不能因语料已经下载就视作原方案已被验证。杨瑞豪常报告数据规模、计算困难和文献问题,下一阶段应将这三类记录连接起来,说明每项数据究竟服务于哪个待验证问题。
📝 本次(2026-10-08)
本次汇报:新闻语料合并与技术路径研究的数据准备
- 报告已下载新闻数据,讨论先使用两套纽约时报语料,其他来源暂时保留。
- 交流字段对齐、统一存储、月份缺口、使用许可与此前技术路径模型的问题文档。
林老师指导
- 先合并选定的两套数据,统一列名和存储格式;其他语料保留备用。
- 发送此前总结模型问题的文档,若 PDF 不便查看可用长截图;后续模型调整另行讨论。
- 现场对缺失月份与离线使用给出了简化处理意见,AI 核查补充其适用边界。
⏭️ 下次预期(暂定 2026-10-14 下午)
- [ ] 提交两套新闻数据的字段对照、合并样本及缺失月份说明。
- [ ] 发送此前技术路径模型问题文档或清晰长截图,供导师讨论替代模型。
🤖 AI 实操建议
① 直接纠正“离线就不用管许可”。 林老师提出数据不外露、工具离线便可不考虑许可,并认为注明来源通常即可,这个概括不成立。离线处理仍可能涉及复制、数据库或获取服务条款;署名也不自动替代授权。我国著作权法对个人研究、科研使用等有具体条件,不能把例外扩展成一切离线产品。参见国家版权局公布的著作权法(需甄别具体使用场景与适用法律)。本次尚未看到两套语料的实际许可,因此既不能认定可任意使用,也不能直接判定已侵权。杨瑞豪提出许可缺失的疑问本身没有错误。
② 今天先做可回滚合并。 保留两份原始文件,分别输出列名、字段类型、日期范围、缺失和重复情况,再定义共同字段。可直接采用 source_dataset|source_record_id|title|publication_date|text|url|license|retrieved_at,无法取得的字段留空,不让 AI 补写。统一格式前先用少量记录对照转换前后的文本、日期与条数;Parquet 是存储选择,不会自动完成字段对齐、内容去重或授权核验。
③ 缺失月份应按研究窗口判断。 某些月份在拟研究区间外,可以解释排除;若位于研究区间内,就必须显示覆盖缺口,不能把没有抓到的报道当成当月没有报道。先画来源—月份覆盖矩阵,再比较重叠时期的重复与差异。将断档、缺正文和同文转载分别标记,因为三者对技术关注度或预警指标造成的偏差不同。冻结一个源记录到统一记录的映射表,便于后续回查。
④ 验收与分支。 合并后的每条记录可追溯到来源,抽检内容不变,重复与缺失有统计;许可表写明访问、研究处理和对外再分发的不同范围。若许可不明,先用明确允许的数据验证程序,并向来源方核对用途。模型问题文档逐条列“原方案问题—证据位置—备选做法—验证产物”,先解决可观察缺陷,再决定替换模型;不能仅凭更换算法名称宣称增加创新。
⚠️ 风险预警
- 大语料的名义条数不等于独立新闻数量,跨来源可能大量重复。
- 时间覆盖变化可能伪装成技术热度变化或预警信号。
- 语料字段、规模和许可尚属口头汇报,未完成文件级核验。
八、张恩豪
OpenAlex 小样本检索与元数据入库
📚 研究历程
张恩豪于 2026 年 9 月 16 日首次有记录地参加组会,初期已跑通导师提供的代码,随后转向理解函数、输入输出与处理流程。9 月 23 日与李政杰讨论合同付款规则、履约证据及核验问题,9 月 30 日报告交易资料统一、履约匹配、融资价值转换和动态风险管理的四步结构,导师要求修订报告措辞。本次转向 OpenAlex 学术数据获取,演示网页下载入口,讨论整库快照与面向集成电路的小样本检索。数据获取是本次新增训练内容,不代表本科论文题目已确定,也不能据此认为此前报告修订已经完成。他常从能否运行、能否下载提出问题,下一阶段可把演示结果转化为带查询条件、字段解释和入库记录的可复核流程。
📝 本次(2026-10-08)
本次汇报:OpenAlex 小样本检索与元数据入库
- 演示快照文件可下载,注意到文件按更新日期分区,不能直接把分区日期当成发表日期。
- 讨论整库下载的成本、Works 元数据与全文的区别,尚未核验快照整体范围。
林老师指导
- 先通过 API(应用程序接口)跑通一例,再把集成电路领域拆成检索概念,带样本和检索方案讨论。
- 后续数据统一进入 PostgreSQL 数据库,暂不要求直接下载整个快照。
⏭️ 下次预期(暂定 2026-10-14 下午)
- [ ] 提交 OpenAlex API 最小请求、返回样本和集成电路检索词方案,与导师核对范围后再扩展。
- [ ] 将样本保存到 PostgreSQL,说明字段映射和唯一标识。
🤖 AI 实操建议
① 直接纠正 Works 与全文的混淆。 张恩豪将此前较大的 Works 数据理解成全部论文正文,并据此解释容量差异,这一推断不成立。OpenAlex 的 Works 快照主体是作品元数据记录;某条记录有全文链接或内容可用标志,不代表快照内包含全部正文。林老师也沿着容量与全文的对应关系追问,不能将这种猜测作为已核实解释。参考官方快照格式与Works 字段说明(需甄别实际下载版本)。容量还受压缩、实体范围、版本和分区完整性影响,须查 manifest 与文件清单。
② 保留更新日期与发表日期的区分。 学生对此已有正确提醒。updated_date 分区服务于数据组织与更新,不是研究时间筛选条件;发表年份应读作品中的相应字段。网页能下载 S3 对象,不表示已脱离 S3 服务,也不意味着需要在页面输入 SQL。先说明自己看到的是文件对象、API 返回还是本地数据库查询,三个接口分工不同。
③ 今天即可执行。 从一个明确技术词开始,保存请求参数、响应日期和少量返回记录,人工检查题名、摘要字段及主题是否真的属于目标领域,再加入同义词与排除词。直接可用表头:检索概念|词组|适用字段|命中记录|相关性判断|误检原因|修改理由。同时保留 OpenAlex ID、DOI、标题、发表日期、来源与检索批次;缺摘要即标记缺失,不凭标题生成摘要。
④ 验收与分支。 先验收一小批记录可重复获取、可入库、可按唯一 ID 查回,第二次导入不产生重复。若误检主要来自歧义词,修检索式;若漏检来自同义表达,扩词后再检查。先估计全量记录、存储和网络成本,再决定 API、快照或组合路径。PostgreSQL 是数据库系统,不是把 CSV 改后缀就能得到的统一文件格式。
⚠️ 风险预警
- 不按更新分区筛选论文发表年代,不凭一个文件夹的大小估计整库规模。
- 元数据可取得不等于所有全文可自由下载、处理或传播。
- 字段和接口可能变化,实验记录要注明版本与查询时间。
九、李政杰
中文文献跨库匹配与开放获取类型
📚 研究历程
李政杰从 2026 年 9 月 16 日的 Python 环境与代码运行训练进入组会,9 月 23 日参与供应链交易核验讨论,关注核心企业背书变化后的核验问题。9 月底又被明确分配工行杯报告修订,分工在共同项目中维护;这项工作与本科论文选题、组会方法训练分别记录。本次汇报中文文献在 OpenAlex 的匹配尝试,并讨论向 Crossref 扩展、设计中文检索和处理重复。此前的报告任务没有在本次获得完成确认,因此不会因出现新任务而自动关闭。李政杰会从命中数、重复与访问限制提出问题,接下来适合建立可核验的查询日志,把“AI 估计有多少”转换成“实际请求返回什么、为什么没有匹配上”。
📝 本次(2026-10-08)
本次汇报:中文文献跨库匹配与开放获取类型
- 尝试核对中文文献与 OpenAlex 的匹配,报告命中有限,并说明不同分类统计可能重叠。
- 讨论 Crossref 检索、中文文献获取、去重和开放获取颜色类型;口头数量估计尚未由查询日志验证。
林老师指导
- 补查 Crossref,与既有平台比较匹配情况和可得记录。
- 设计中文检索式,通过 API 获取样本;后续再开展跨库去重。
⏭️ 下次预期(暂定 2026-10-14 下午)
- [ ] 提交同一文献清单在 OpenAlex 与 Crossref 的匹配对照,记录请求与未匹配原因。
- [ ] 整理中文检索式并下载可核验的元数据样本,保留跨库唯一标识供后续去重。
🤖 AI 实操建议
① 直接纠正开放获取“等级”。 李政杰将钻石、绿色等理解为权限等级,并猜测钻石权限最高;林老师进一步把它解释为杂志社向 OpenAlex 提供多少信息以及可随便使用,这些说法不准确。它们描述开放获取的方式,不能当作权限从低到高的排名。钻石通常指读者与作者均不付出版费用的开放获取模式;绿色涉及仓储开放;具体再利用仍看许可。OpenAlex 的 OA(开放获取)标记也不等于任意再分发授权,参见官方 OA 分类(需甄别记录字段及版本)。
② Crossref 与 OpenAlex 功能有交集,但并不相同。 林老师把二者概括成功能一样,过于简化。Crossref 主要提供成员及可信来源登记的 DOI 相关元数据,OpenAlex 则整合学术作品及其关联信息;检索覆盖、字段和返回结果并不相同。参见Crossref REST API 文档(需甄别)。一库未命中不证明论文不存在,两库命中数量也不能直接相加。
③ 今天即可逐条核对。 用同一文献清单,优先按 DOI 查询,再用题名、作者、年份辅助匹配,记录 原始文献|DOI|查询式|平台|返回 ID|匹配依据|状态码|未匹配原因。题名近似、预印本与正式发表版本要单独复核。AI 估计的总量先标为未核验,只有实际查询的范围、返回总量和去重口径一致后,才形成数量结论。
④ 请求限制与验收。 林老师建议加邮箱解决限流,不能当作适用于所有平台的保证。Crossref 支持 mailto 的礼貌池机制;OpenAlex 应按其当前认证文档使用相应密钥和限额,两者分别配置(需甄别当次账户与接口)。遇到限流先记录响应并退避,不反复并发重试。验收时抽查匹配正确性,保留失败样本;如果大量未命中来自题名或语言元数据缺失,先改匹配策略,不立即判断中文覆盖为零。
⚠️ 风险预警
- OA 颜色、许可、是否有摘要、是否有全文是不同字段,不能互相替代。
- 多标签有交集,不能把分类计数直接求和当文献总数。
- API 元数据下载不等于论文正文下载,正式去重要保留版本关系。
散会
本周共同的问题,是如何把已经跑出的结果、取得的数据和新的研究设想变成可核验的证据:指标先有定义,模型先说明比较对象,数据先留下来源。下次组会暂定 2026 年 10 月 14 日(周三)下午,具体时刻另行确认。
🎭 本周彩蛋
📢 本周金句
“就是我觉得从科学研究的角度来看,就是不显著有可能也是一个值得汇报的结果。”
—— 林超然,机制检验讨论
值得保留的不是“不显著”这个标签,而是它告诉我们哪些预期尚未获得支持。把证据的不确定性写清楚,也是论文的一部分。
🧠 本周新词
- 全时当量:把不同人员实际投入的研发时间折成整年工作量,像把几个人的部分时间合成“人年”。
- 交互效应:在特定模型中,两个因素共同作用超出简单相加的部分;它与两项政策的总效应要分开算。
- min_dist:UMAP 低维表示的紧密程度参数,不是“离群点清零按钮”。
- 钻石开放获取:读者与作者通常都无需付出版费用的开放模式,不是可以随便使用的最高权限卡。
- 元数据:描述论文题名、作者、日期和关联信息的记录,像图书目录卡,不等于书的正文。
本周研究工具们联合递交了一份说明:回归系数不负责讨人喜欢,主题模型不能代签方法说明,数据库也不会因为改了文件后缀就自动完成交接。唯一表示愿意加班的是核对表——前提是大家真的往里填证据。
林超然 · 整理于 2026-10-08
