资讯

三张图讲清高质量数据集、知识库、智能体——高质量数据集如何打造自然资源和规划“最强大脑”!?

三张图讲清高质量数据集、知识库、智能体,打造自然资源和规划“最强大脑”

依托人工智能提升自然资源和规划“数智化”管理水平,写进了很多地方2026年自然资源和规划工作重点以及十五五规划。但关于这项工作的前提和基础,构建高质量数据集、知识库、智能体目前很多地方还处于起步阶段。

现实之困前两天和一位朋友聊天,他吐槽:手里握着全市的“三调”数据、控规图斑、卫星影像,数据量大得吓人,可每次遇到领导问“这块地能不能调规”,还是得翻法规、查案例、做分析,折腾好几天,最后还可能漏掉关键条款。

问题出在哪儿?数据是现成的,但知识是散的,决策还是靠人。这就像厨房里堆满了顶级食材,却没有菜谱,也没有会做菜的厨师——再好的材料也变不出一桌宴席。

今天,和我的AI助手尝试将自然资源和规划领域的「数据集」「知识库」「智能体」这三个硬核概念掰开揉碎,再聊聊自然资源和规划领域怎么搭好自己的高质量“数据集、知识库、智能体”和“数智化”应用场景。

一:概念区分

1. 数据集

  • 定义:原始、结构化的事实集合。它是未经加工的、客观存在的记录。
特点:
原始性:通常是数据库中的表、CSV文件、Shapefile、影像文件等。
可量化:由具体的字段组成,如坐标、面积、容积率、地类代码。
例子:
第三次国土调查的图斑数据(包含地类、面积、权属)。
某市的控制性详细规划地块指标(容积率、建筑密度)。
卫星遥感影像(像素值)。

2. 知识库

  • 定义:经过提炼、组织和关联的经验与规则集合。它是数据集的上层建筑,包含了上下文、逻辑和约束。
  • 例子:
特点:
规则性:包含法律法规、行业标准、逻辑规则。
关联性:不仅仅是数据,而是知道数据之间有什么关系。
例子:
法律法规:《土地管理法》、《城乡规划法》的条文。
逻辑规则:“永久基本农田”原则上不允许占用,除非符合国家重大建设项目且经过严格的论证和补划。
业务流程:建设项目用地预审与选址意见书的审批流程(申请 -> 初审 -> 踏勘 -> 论证 -> 核发)。
专家经验:坡度大于25度的区域不宜规划为城镇建设用地。

3. 智能体

  • 定义:能够感知环境、进行决策并执行动作的实体。它利用数据集和知识库,像人一样去完成特定任务。
特点:
自主性:无需人工逐条指令,能自动拆解任务。
工具使用:能调用GIS工具、查询数据库、调用大模型进行文本生成。
交互性:可以与人对话,解释自己的推理过程。
例子:
用途管制合规性审查智能体:你上传一个项目红线,它能自动调取“三区三线”数据集(数据集),依据《土地管理法》(知识库),判断是否占用生态红线,并自动生成审查意见报告。
规划编制辅助智能体:你描述“我想在城边找个地方建一个物流园”,它会结合交通数据、现状地类数据、规划文本要求,推荐几个候选地块并列出优缺点。

二:如何构建自然资源和规划领域的高质量智能体系

构建这三者是一个递进的过程:先夯实数据底座,再提炼知识规则,最后训练智能代理。

1. 构建高质量的数据集(夯实基础)

  • 痛点:数据多,但标准乱、更新慢、没法用。
  • 关键动作:数据治理

(1)多源融合将测绘数据、遥感数据、调查监测数据、规划审批数据、社会经济数据进行整合。打通“一张图”核心数据库。别让耕地在耕地图层,规划在规划图层,互相看不见。

(2)标准化严格遵循《国土空间规划用地用海分类指南》、《基础地理信息标准》等,确保字段名称、代码、坐标系的统一。不然以后智能体读数据就像看天书。

(3)时空化给每条数据打上时间戳。现状、规划、管理数据都是动态的(如三调数据、变更调查),需要建立数据的时序谱系。去年的耕地今年可能变了,智能体必须知道“哪个时间点的数据”。

(4)精度控制确保矢量数据的拓扑正确(无重叠、无缝隙),影像数据的分辨率满足业务需求,否则智能体算面积会出错。

一句话口诀:数据干净了,上层才能聪明。在自然资源领域,数据集的质量直接影响上层智能的可靠性。

2. 构建高质量的知识库(注入灵魂)

痛点:法规文本堆成山,专家经验都在人脑子里,人一走,经验就带走。这是目前从“数字化”迈向“智能化”的关键瓶颈,需要将隐性经验显性化。

  • 关键动作:知识工程
(1)法规结构化:将海量的法律法规、技术规范(PDF、Word)进行解析。不能只存全文,要拆解成最小知识单元。别再把《土地管理法》整个PDF扔给AI。拆成最小知识单元:“永久基本农田” + “禁止” + “挖塘养鱼” → 做成知识三元组。这样智能体才能精准调用。
(2)业务规则化:把规划条件、审批要点抽象成逻辑规则。例如:IF 地块用途 = “居住用地” AND 容积率 > 3.5 THEN 提示“需进行交通影响评价”。
(3)案例沉淀化:将历史上优秀的规划方案、典型的违法用地查处案例、生态修复成功案例进行文本化、向量化,存入向量数据库。
(4)知识图谱化:建立“地块-项目-政策-指标”之间的关联。比如某地块涉及“林地”,知识图谱能快速关联出《森林法》、林保规划、占补平衡指标等所有相关信息,让知识不再是孤岛。

3. 构建高质量的智能体(实现价值)

痛点想做的东西太宏大,结果啥也做不成。智能体是面向用户的“执行官”。在自然资源领域,不建议做一个万能智能体,建议做垂直领域的专用智能体

关键动作Agentic Workflow(智能体工作流设计)

(1)先定岗明确智能体的职责。例如:智能审批辅助员、公众政策问答员、违法用地预警员。比如先做一个“用地预审合规性问答助手”,别一上来就做“全域全要素全能手”。

(2)给工具智能体需要学会调用GIS工具(比如ArcPy、QGIS或GeoServer的接口)进行空间分析(如缓冲区分析、叠加分析)。调用AI模型(比如遥感识别)、调用数据库。就像给大厨配好刀和灶。

(3)调模型调用耕地识别模型(视觉模型)、规划方案生成模型(大语言模型)、指标计算模型(传统算法)。

(4)能感知给智能体装上“眼睛”。它能接收用户上传的文件(CAD、图片、PDF),也能通过API接口查询实时的国土空间基础信息平台数据。

(5)会思考设计思维链(Chain of Thought),比如选址评估的思考链:选址评估 = 合法性审查(知识库) -> 适宜性评价(数据集+模型) -> 经济性测算(数据集)。

(6)出报告利用大模型能力,将数据结果和分析结论生成符合公文规范的《建设项目用地预审与规划选址论证报告》。最后生成的报告要符合公文规范,有依据、有结论、有建议,别给一堆代码或生硬的表格。

(7)善推理

基于知识库的推理当接到任务“这块地能盖房子吗?”,智能体首先在知识库中搜索相关法律法规,然后调用工具数据集里查询这块地的“三区三线”标签。

一句话口诀:智能体用起来,数据知识才活起来。

图片
图片

三、一个真实场景:老王的地,到底能不能盖物流园?

老王是某物流公司老板,看中城边一块地,想建仓库。

以前:

  • 查规划图(不知道在哪找最新版)
  • 翻法规(不确定有没有新政策)
  • 咨询审批部门(排队等回复)
  • 找人做分析(耗时一周,花费上万)

现在(假设有了“选址分析智能体”):

  • 老王在手机上传红线坐标,语音输入:“这块地能建物流园吗?”
  • 智能体自动查询数据集:这块地现状是耕地,规划是预留城乡建设用地。
  • 查询知识库:耕地占补平衡政策、规划用途管制规则。
  • 结合两者判断:可以,但需落实耕地占补平衡,且容积率需≤2.0。
  • 5分钟后,智能体生成一份《选址初步意见》,附带法律依据和下一步建议。

老王当天就能拿着报告去决策。效率翻倍,决策更准。

图片
图片

总结:三者的协同关系

  • 数据集回答 “是什么”(现状是耕地还是林地?);
  • 知识库回答 “应该是什么”(按照法律,耕地应该被保护,林地采伐需要许可证);
  • 智能体通过工具去匹配“是什么”和“应该是什么”,并输出“做什么”(发现地块是耕地且正在施工,也没有合法的耕地占用审批手续,判定为疑似违法用地,触发预警工单)。

构建建议路径

建议先从数据集的标准化入手,然后梳理高频业务的知识库(如耕地保护、用地审批),最后在具体的业务场景中孵化智能体(如先做一个“选址合规性问答助手”),由点带面,逐步推进。

写在最后

很多同行说“数字化转型太难”,其实难的不是技术,而是把业务逻辑理清楚,把经验沉淀下来,再一步步用技术实现。

下一次,当领导问“这块地能不能用”,或者群众问“我家能翻建吗”,别急着翻图纸、查法规,想一想:

  • 我的数据集够全吗?
  • 我的知识库够细吗?
  • 我能训练一个智能体来替我干这些重复活吗?

END——关于我们

← 返回资讯动态