您的位置:首页 >生活 >

中国大模型语料数据联盟迎来9家新成员 开源第二批语料数据

2023-09-09 15:19:09 来源:腾讯网


(资料图片)

图说:活动现场 采访对象提供

新民晚报讯(记者 叶薇)为提升语料数据供给水平,推动大模型产业高质量发展加速应用创新与行业落地,由中国大模型语料数据联盟主办的数说新语·开放日首场活动昨天在上海人工智能实验室举行。

开放日上,中国专利技术开发公司、上海仲裁委员会、上海图书馆(上海科学技术情报研究所)、上海数据交易所、上海市社会信用促进中心、上海蜜度信息技术有限公司、上海钛米机器人股份有限公司、华东师范大学出版社有限公司、上海城建城市运营(集团)有限公司9家新成员单位加入“中国大模型语料数据联盟”,将共同为大模型技术深度发展与高水平应用提供更多元的数据要素保障。联盟发起单位代表为他们颁发了入盟纪念证书。

蜜度信息首席技术官刘益东发布了开源文本数据集蜜巢·花粉1.0,该数据集以互联网媒体数据为主,经过过滤清洗、多条件去重等精细化处理,来源可靠、质量高,并可持续稳定更新,截至目前,数据总量已超一亿条该数据集还经过了资深律师进行了数据合规前置审核。

蜜巢·花粉1.0已被应用于蜜度系列大模型的训练,在政务及媒体等垂直领域提供知识问答与内容生成、分析报告自动生成、文稿内容审校与润色改写等各类智能生成式服务。目前,各项服务已得到了用户的良好反馈。借此契机,蜜度将进一步降低大模型技术探索和落地的门槛,加速应用创新与行业落地。据悉,蜜巢·花粉1.0是继8月14日书生·万卷发布以来,联盟发布的第二个开源语料数据集。同时,多个联盟成员单位也已形成了语料数据开源方案,将陆续进入发布队列。

未来,联盟将持续发挥好“朋友圈”作用,凝聚各方资源,发挥各成员单位优势,群策群力,共同推动大模型语料数据高水平供给,为我国大模型发展做好数据支撑。

关键词: