7月19日,由广州大学、广州市社科联共建的粤语语料库建设与大模型评测重点实验室应邀亮相2026世界人工智能大会“人工智能高质量语料生态论坛”,现场发布两项原创核心成果:AI-DimSum粤语语料库平台(中文名:点心粤语语料库)搜索2.0、粤语真实语音上下文交互能力评测基准CRS-Bench,以方言垂类数据底座打造广州AI差异化竞争力。

本届论坛共有25位院士出席,主旨演讲嘉宾汇聚图灵奖得主、6位中国工程院院士,共同围绕“高质量垂域语料如何破解AI落地瓶颈”展开深度研讨,为行业热议的“语料路径之争”给出权威答案。
论坛上,广州发布的AI-DimSum粤语语料库平台搜索2.0、粤语真实语音上下文交互能力评测基准CRS-Bench两大特色成果,既是本地粤语大模型研发实力的集中亮相,也是城市垂类大模型产业布局的全景展示。
中国工程院院士、粤语语料库建设与大模型评测重点实验室首席科学家方滨兴介绍,AI-DimSum多模态通用粤语语料库平台最重要的作用就是为粤语AI提供“文化忠实、安全可信、AI友好、持续成长”的数据基础设施底座。

现场,重点实验室主任、广州大学网络空间安全学院齐佳音教授代表重点实验室介绍了AI-DimSum粤语语料库平台搜索2.0和粤语真实语音上下文交互能力评测基准CRS-Bench两项最新研究成果。
前者作为重点实验室在语料规模迈入TB级后推出的重要升级,具备三大特色:所有语料自带“身份证”,来源更可信;搜索结果分三层呈现——精确、关联和推荐,内容更丰富;融合社交功能和生态应用,实现搜索即社交、搜索即传播、搜索即应用。
后者由重点实验室与GOMAX LAB合作建设,基于真实粤语语音资源,体现地域变体、包含上下文情景、具有文化语义复杂度,开辟了AI粤语能力评测的新赛道。

此次粤语AI成果亮相世界人工智能大会,是广州市社科联以社科重点实验室推动人文与科技双向奔赴的又一例证。下一步,重点实验室将继续推动优质粤语语料的常态化汇聚和规范化标注,加强标准建设、完善评测基准与搭建治理工具,迈出从科研成果到产业应用转化的关键一步;并以广东先行试点为基础,加强粤港澳大湾区语料共建、标准协同和场景合作。
南方+记者 洪钰敏
通讯员 穗社科联宣
红腾网配资提示:文章来自网络,不代表本站观点。