中国老年政策研究基础设施 生产级纵向切片 01
为什么现在 01 / 04
政策档案、地图、城市历史和老人双手组成的研究主题概念图

01 / WHY NOW Source snapshot · 81aaba0 · 2026.08.20

已处理核心稀疏文本管线

人民日报、政府工作报告、五年规划:Stage 1 + Stage 2 已执行。

已结构化政策全文

903 份结构化全文文件,可继续按工具、主体和定量承诺重读。

已收集 / 整理中额外媒体、统计、服务与调查

资料已经获得;正在处理去重、字段、实体、时间与地域对齐。

分析前验证样本、连接与测量口径

最终 N、唯一实体数、可比年份与变量定义必须由具体研究问题决定。

社区工作人员陪同老人查看资料

当前位置:基础设施 → 第一个可信分析

2020 · NAN ET AL. 489 → 226

以北大法宝等政策数据库为来源,使用 Boolean logic 建立候选,再按研究目的纳入。

关键词来源链 文献 → 概念 → 时期语言

既有研究提供起始词;历史语料和迭代审查补充时代变体。

方法来源提供了什么本项目怎样使用没有声称什么
Nan et al. (2020)政策数据库与 Boolean 检索范式作为检索和纳入逻辑的实证锚点不做简单规模倍数比较
老龄政策相关文献概念边界与主题词形成跨时期关键词家族文献词表不是最终真值
历史语料审查旧称、制度语言与边缘表达降低现代词汇造成的历史遗漏关键词命中不等于政策相关

A · NEEDLE IN HAYSTACK低密度文本
关键词召回语义筛选段落证据

报刊、报告、规划:相关内容只占大语料的一小部分。

B · FULL-TEXT RELEVANT整篇相关文件
文件分流结构提取全文索引

法规与专项政策:需要保留完整制度结构和上下文。

Q · QUANTITATIVE / SURVEY表格与个体调查
审计对齐连接面板

统计、服务、CHARLS/CLHLS:关键是口径、实体、时间和变量可比。

Stage主要责任主要错误修正路线
1保护召回,减少历史语言遗漏噪音与假阳性迭代词表、上下文窗口、Stage 2
2语义相关性与基础结构边界判断、漏判与标签漂移校准样本、人工挑战、协议版本

示意原文 · 非实际引文

各地应完善居家和社区养老服务网络,支持符合条件的机构参与服务供给,并逐步提高基本养老服务可及性……

decision
relevant
summary
完善居家社区服务网络并提高可及性
tags
home_based · community · provider · access
quantitative_info
unknown
provenance
source_id · year · passage_id · prompt_version

示意原文 · 保持不变

各地应逐步建立以居家为基础、社区为依托、机构为补充的养老服务体系,完善服务设施和支持政策……

此文本仅用于演示界面逻辑,不作为项目语料引文。
起点当前 Stage 2 基础 record相关性 · 摘要 · 基础标签 · 定量线索 · provenance

VALIDATION

PROMPT v0.xMODEL + DATECALIBRATION SETALLOWED UNKNOWNSPROVENANCE

89.7%

重复运行一致性

不是准确率
必须记录为什么
protocol / schema version知道模型被要求做什么
校准与人工判断把稳定与正确分开
主要错误类型决定是否可以用于具体结论

原始保留

北京 / 北京市 / 110000

机构 A / A 养老院 / A 老年公寓

2013 created_at / 2024 snapshot

duplicate package · changing headers

对齐
分析结构

geo_id · province · city · county

entity_id · source_record_id · match_status

observation_date · creation_date · source_vintage

variable_definition · provenance · qa_flag

为什么这一步快,但不能省

AI 可以协助发现重复、异名和字段模式;研究者仍要决定什么算同一实体、哪个时间口径对应研究问题。

不是设想:核心管线已经执行 240,984 候选段落 76,656 有效段落 903 结构化全文
分散的政策资料逐渐汇聚为时间、地域与关系网络的概念图
AI 生成概念图,不作为研究证据

价值层一次性项目持续研究引擎
效率每个题目重复整理基础处理可以复用
覆盖为单一问题较早收窄保留更大的候选空间
可重读编码完成后难以改变同一原文可应用新协议
由档案纸张、地图与统计网格构成的分层证据概念图
AI 生成概念图,不作为研究证据

点开任一层,查看它能回答什么、覆盖到哪里、不能代表什么。

五个镜头附着在同一主线上

时间 治理层级 证据类型 宏观—微观 表达—落实—体验

已进入核心管线 已收集,待组织/处理 覆盖不均或需核查 历史结构性缺席

证据地图:每一种资料回答不同的问题
资料 覆盖 主要作用 必须保留的限制
社区工作人员陪同老人查看材料的日常场景概念图
最终要解释的,不只是材料,而是政策如何抵达人的生活 · AI 概念图

所有数字按来源单位分别呈现;点击大数字查看定义与口径。

INPUT
OUTPUT
人工 GATE
已完成 / 已执行下一步需验证后续能力

研究问题

AI

HUMAN

OUTPUT

社区服务与老人生活场景

共同骨架:问题定义 → Reading Protocol → 来源追踪 → 人工挑战 → 修正

研究者围绕地图、文件与数据共同工作的俯视场景

共享核心证据基础 · Reading Protocol · 验证集 · 分析 Skill
PI

理论、问题、论证强度与学术方向

领域研究者

概念、制度语境与边界案例

方法研究者

测量、比较、识别与稳健性

DATA + AI

处理管线、协议执行、可追溯输出

当前窗口

可用覆盖
可以问
进入分析前
不能直接声称

调整任一约束会改变四个研究窗口的匹配度;窗口仍可点击查看覆盖、准备工作和当前不能支持的主张。

研究窗口覆盖匹配概念清晰清理范围证据链识别 / 时效难度
长期概念与政策注意力●●●●●○●●●●●○
中央—地方政策转译●●●●●○●●○●●●
政策—供给 gap●●○●●○●○○●●●中—高
长护险与个体结果●●○●●●●○○●●●高 · 数据相对滞后
01PI 兴趣

题目值得团队投入,并能与现有研究议程衔接。

02Null result 也有价值

即使没有预期关系,也能得到可解释、可报告的结论。

03可形成可信图表

核心变量、比较单位和证据来源都可以被清楚核验。

04可在有限周期跑通

清理、验证与首轮分析可以在约定周期内形成闭环。

需要 PI 判断

  1. 理论镜头是否遗漏重要维度?
  2. 哪个问题具有最清楚的学术增量?
  3. 现有证据允许描述、机制还是因果主张?
  4. 哪些同事、受众和期刊最适合第一项研究?
数据修复、字段定义与脚本由项目团队继续推进。

这不是最终评分;它把选择研究题目时必须讨论的 trade-off 放到同一张桌上。

研究团队围绕资料与地图讨论

  1. 01

    这个框架最重要的盲点是什么?

  2. 02

    哪个问题具有最清楚的学术增量?

  3. 03

    现有证据允许我们做多强的主张?

  4. 04

    哪些同事适合组成第一个小组?

  5. 05

    第一项产出面向什么 audience / journal?

研究者共同整理政策资料与证据

清理 / 对齐共同选题分析 / 验证发表 / 复用

从 75 年的材料,走向第一个可信、可解释、可复用的发现。