为帮助各参赛团队精准把握命题脉络,深入理解赛题的背景立意、考核目标及攻坚难点,本期特对由北京市市民热线服务中心(12345市民服务热线)命题的定向问题解决类赛题——“基于多维语义相似度的群体性诉求智能发现挑战赛”开展系统性解读。该赛题核心任务是从每日海量市民服务工单中,智能识别由同一事件、同一群体引发的群体性诉求。
一、群体性诉求:于万千来电中捕捉民意共性
12345市民服务热线是城市感知民情民意的重要窗口。热线电话、京通平台、微信服务号等多渠道,每天都会接收成千上万件市民来电与留言。单条工单记录的往往是个体市民的现实困扰:酒店消毒不达标、夜间工地施工扰民、机构收费后拒不退款、公交车辆不按标线进站停靠……各类民生问题纷繁多样。
但如果把工单按照时间、地域维度串联审视,就能够挖掘出隐藏在个体诉求之下的共性问题:同一家酒店,连续数日收到多位市民的同类投诉;同一个回迁小区,多名居民相继反映物业私装地桩,侵占业主停车权益;同一家企业,数十位消费者集中反映退款难问题。通过对这些分散工单进行关联分析,可以进一步发现其在事件背景、涉及群体和问题源头等方面的潜在关联,为同一事件下群体性诉求的识别与研判提供重要线索。
以往群体性诉求主要依靠热线工作人员人工浏览工单、逐级上报识别,高度依赖一线接线人员业务经验。这套传统模式存在明显短板:识别响应滞后,往往要等到诉求大量爆发后才能够被发现;容易出现信息遗漏,少数零星诉求极易淹没在海量工单之中;工单溯源归并难度大,同一事件被拆分为多条独立工单分头处置,部门之间信息不通,造成公共治理资源的浪费。
二、赛题挑战:搭建 AI“拼图工具”,还原事件全貌
出题单位提供经过脱敏处理的真实历史话务流水数据集作为训练素材。每份工单包含标题、正文、事发地址、推送时间、三级细分问题分类、承办单位等完整字段,例如“城乡建设‑施工管理‑施工扰民”。其中部分工单已经由业务专家完成人工标注,为对应群体性诉求分配专属编号;另一部分连续时段的新增工单字段保持一致,但隐去群诉编号,交由参赛团队自主完成诉求分群识别。
参赛团队需要打造具备聚类分析能力的AI模型。面对未标注的全新工单,模型要完成两项核心判断:该条诉求是否属于群体性诉求;若属于群诉,需要识别它与哪些工单归属于同一事件。赛题鼓励参赛团队大胆创新,可运用大语言模型开展实体抽取、语义增强,设计动态判别阈值、可解释分析模块,技术实现路径不设硬性限制。
三、三大现实难点:口语化文本、跨时间事件、苗头性预警
结合出题单位专家解读,本赛题主要面临三大技术与业务难点:
第一,工单文本非标准化。市民提交诉求大多为日常口语表达,没有统一表述规范。以酒店餐具消毒投诉为例,有的市民仅简单描述“酒店杯子没有消毒”,也有市民大段引用国家标准条文;地址信息更是参差不齐,既有精确到门牌号的详细描述,也有“上地七街公交站”这类模糊地点,甚至存在“地址不详”的情况。如何对口语化文本、多样地址信息做对齐匹配,是模型要跨过的第一道难关。
第二,跨时间事件识别难度高。很多群体性诉求并非集中爆发,而是呈断续出现的特点:单日仅有2‑3条反馈,间隔数天再次产生新工单,部分事件可持续一周以上。模型需要精准把分散在不同日期、属于同一事件的工单归集在一起,既不能将同一事件拆分为多个群诉,也不能把互不相关的事件错误合并。
第三,实现苗头问题早发现。模型不能仅识别已经大规模发酵的热点事件,更要对仅有寥寥数条工单的早期群诉苗头保持高度敏感,做到“小事早预警”。同时聚类结果必须具备可解释性,能够清晰说明多条工单归为同一群诉的依据,方便业务人员复核校验,杜绝不可溯源的算法黑箱。
四、价值展望:让民情诉求在发酵之前被及时感知
该赛题落地应用后,将重塑城市治理的响应节奏。以往群体性诉求需要积累到一定规模,经由人工逐级上报才会被关注;未来依托AI能力,工单流入即可完成实时比对,一旦捕捉到多条工单指向同一个问题源头,系统可主动推送预警线索,提示承办单位提前介入处置,市民的集体民生关切无需经过层层流转,就能直达治理端。
多年沉淀的热线话务数据,借助数据要素与大模型技术,推动治理模式从“办结单件诉求”升级为“洞察群体共性问题”,把数据价值渗透进城市治理的细微末梢。
同时也应看到,算法仅能完成文本、地址、时间等可量化信息的归集匹配。市民来电中承载的个人情绪、事件背后复杂的利益纠葛、工单里特殊个性化处境,仍需熟悉属地情况的接线工作人员与业务部门研判权衡。机器负责汇聚分散线索,最终的研判处置依旧依靠人的专业判断。算法与人力优势互补,民情民意才能既被及时发现,又得到妥善回应。
了解更多赛题详情,欢迎登录2026年“数据要素×”大赛北京分赛暨北京数智创新大赛官网https://dexc.data.beijing.gov.cn



京公网安备:110401200236