新华网南京7月30日电(记者潘晔)第四届语料库与数字人文暑期学院“语言文字标准论坛”近日在南京师范大学举办。来自教育部语言文字应用研究所、中国电子技术标准化研究院等单位的专家学者,围绕人工智能时代语言文字标准体系建设、语言资源智能化发展等议题展开研讨。130余位海内外专家学者现场参会,2000余名观众在线观看直播。
本次论坛系该暑期学院首次设立语言文字标准专题,旨在搭建跨学科交流平台,推动语言文字标准与人工智能技术深度融合。

图为第四届语料库与数字人文暑期学院“语言文字标准论坛”现场。受访者供图。
构建面向智能时代的语言标准体系
教育部语言文字应用研究所李慧在论坛上表示,人机共生时代,语言文字规范正从“人用”向“机用”延伸,对语言资源的结构化、标准化和可计算化提出新要求。她透露,近年来《机器合成普通话水平测评等级标准及测评大纲》《人工智能语料库基础术语》等一批国家标准相继发布,标志着语言文字标准建设进入面向智能应用的新阶段。
针对人工智能应用需求,李慧建议加快构建涵盖基础、数据、应用三个维度的语言智能标准体系,提升语言资源规范化水平和智能应用支撑能力。
百万字级汉字编码成攻关重点
中国电子技术标准化研究院陶扬、中国科学院软件研究所刘汇丹系统梳理了汉字编码体系发展历程,指出当前汉字编码扩展区存在音义属性数据不足、字符处理规范不统一等问题,对输入法适配、中文数据分析及人工智能应用构成挑战。
两位专家建议,未来需进一步完善汉字基础数据体系,研究构建百万量级、统合音形义属性的汉字资源平台,以解决繁简转换、异体字处理及字库受限等难题,为中文数字化和国产软件发展提供支撑。
古联(北京)数字传媒科技有限公司苏瑞欣结合古籍数字化实践指出,造字复杂、编码不统一等问题制约着古籍整理效率。她分享了古籍专用字库、输入法及文字处理平台的探索经验,强调需推动字形、字义与数字技术深度融合。
复合型人才培养与国际标准协同
南京师范大学语言大数据与计算人文研究中心负责人李斌教授在总结时表示,汉字作为表意文字,具有字量大、异体字多等特点。当前国内古籍出版及数字化领域自造字、异体字认同问题依然突出,百万字级超大字库的落地应用已成为文化传承的关键基础。
李斌强调,中文数字化需推进国际化进程,特别是在ISO语言文字国际标准及人工智能语料库建设领域,应与海内外学者协同攻坚,制定符合产业发展需求的汉字标准。
与会专家认为,语言文字标准化工作正从“基础支撑”向“AI赋能”转型,亟需培养兼具语言学功底与计算思维的复合型人才,为国家语言安全与文化传承贡献力量。(完)

