19157628936

赋能AI创新,景联文科技提供海量优质大模型数据集

时间:2024-04-24 09:47:54

作者:景联文科技

浏览:

随着大模型发展步入新阶段,数据问题已成为其发展与广泛应用的重要制约因素。

 

image.png 

 

2023年业界聚焦于“缺芯”问题,即芯片短缺对AI硬件设施的影响;而2024年,业界关注焦点转向“缺数据”,逐渐出现数据需求剧增、数据质量问题、标注挑战、隐私与合规关切、数据偏见与公平性问题、数据孤岛与共享难题,以及新兴领域数据匮乏等多方面挑战。

 

在大模型训练的各个阶段,数据的确扮演至关重着要的角色。景联文科技作为大语言模型数据服务商,提供海量优质大模型数据集,致力于为不同训练阶段的算法精准匹配高质量数据资源,以应对上述数据挑战。

 

世界知识类书籍、期刊、论文及高价值社区文本数据:

中文书籍 250万本

高质量外文文献期刊 8500万篇

英文高质量电子书 200万本

教育题库:

K12教育题库 1800万

大学题库 1.1亿,800万带解析

英文题库 500万

专业知识类期刊、专利、代码:

中文数字专利 4000万

程序代码(代码注释) 20万

多轮对话:

文本多轮对话 1500万

中英文剧本(电影、电视剧、剧本杀) 6万

音频数据:

普通话 65万小时

图片生成及隐式/显示推理多模态数据:

图文复杂描述 600万

图文推理问答对 600万

生物数据:

核酸库 4000万

蛋白库 50万

蛋白结构库 19万

通路库 1000万

生信工具

药学数据:

药物研发数据库 1300万

全球上市数据库 80万

一致性评价数据库 25万

生产检验数据库 40万

合理用药 300万

多维文献 1亿

原料药数据库 1100万

化学数据:

化合物数据库 1.6亿

反应信息数据库 4100万

物化性质数据库 1.6亿

谱图数据库 20万

晶体信息数据库 100万

安全信息数据库 180万

商品信息数据库 740万

材料数据:

金属材料数据 20万

纳米材料数据 30万

相图数据 6万

材料性能数据 20万

材料腐蚀数据

表面处理数据

焊接材料数据

专利数据:

全球专利基础著录数据 1.3亿

全球专利原文数据 1亿

全球专利附图数据

全球专利法律状态数据

全球专利法律状态数据

全球专利引文数据

全球专利分类索引数据

全球专利重点申请人工商关联数据

全球生化医药专利深加工数据

全球专利全文数据

医疗器械数据:

国内政策法规数据 3千

行业标准数据

中国医疗器械审评数据 20万

中国医械临床试验数据 5千

全球医械临床试验数据 7万

医用耗材中标数据 1400万

医用耗材带量采购数据 400万

医用设备招投标数据38万

 

同时景联文科技提供大模型训练数据的标注服务,致力于为全球数千家人工智能从业公司和高校科研机构交付海量、高质量的多模态大模型训练数据。

 

景联文科技|数据采集|数据标注|大语言模型训练数据

助力人工智能技术,赋能传统产业智能转型升级

 

文章图文著作权归景联文科技所有,商业转载请联系景联文科技获得授权,非商业转载请注明出处。


做AI行业客户的数据参谋
客户咨询电话:19157628936
地址:杭州市萧山区杭州湾信息港E幢7楼
微信公众号 客户咨询微信