受ChatGPT驱动,2023年国内大模型发展呈现出前所未有的蓬勃态势,并在过去一年间实现了技术能力的飞速提升。

截至 2024年3月,我国共有117个GenAI完成了备案,包括文心一言、通义千问、kimi、智谱清言、云雀、abab、日日新、星火、盘古以及最新的滴滴出行大模型等,共同构成了国内AI大模型领域的繁荣景象。

打开网易新闻 查看精彩图片

数据是大模型发展的核心要素,不仅决定着模型的性能上限,也是推动人工智能技术持续进步的关键因素。在大模型时代,如何获取、管理、处理和利用好数据,成为AI开发者和企业的共同挑战与机遇。

景联文科技是AI数据服务公司,提供海量优质大模型数据集,致力于为不同训练阶段的算法精准匹配高质量数据资源,以应对上述数据挑战。

世界知识类期刊及高价值社区文本数据:

  • 高质量外文文献期刊 8500万篇
  • 英文高质量电子书 200万本

教育题库:

  • K12教育题库 1800万
  • 大学题库 1.1亿,800万带解析
  • 英文题库 500万

专业知识类期刊、专利、代码:

  • 中文数字专利 4000万
  • 程序代码(代码注释) 20万

多轮对话:

  • 文本多轮对话 1500万
  • 中英文剧本(电影、电视剧、剧本杀) 6万

音频数据:

  • 普通话 65万小时

图片生成及隐式/显示推理多模态数据:

  • 图文复杂描述 600万
  • 图文推理问答对 600万

生物数据:

  • 核酸库 4000万
  • 蛋白库 50万
  • 蛋白结构库 19万
  • 通路库 1000万
  • 生信工具

药学数据:

  • 药物研发数据库 1300万
  • 全球上市数据库 80万
  • 一致性评价数据库 25万
  • 生产检验数据库 40万
  • 合理用药 300万
  • 多维文献 1亿
  • 原料药数据库 1100万

化学数据:

  • 化合物数据库 1.6亿
  • 反应信息数据库 4100万
  • 物化性质数据库 1.6亿
  • 谱图数据库 20万
  • 晶体信息数据库 100万
  • 安全信息数据库 180万
  • 商品信息数据库 740万

材料数据:

  • 金属材料数据 20万
  • 纳米材料数据 30万
  • 相图数据 6万
  • 材料性能数据 20万
  • 材料腐蚀数据
  • 表面处理数据
  • 焊接材料数据

专利数据:

  • 全球专利基础著录数据 1.3亿
  • 全球专利原文数据 1亿
  • 全球专利附图数据
  • 全球专利法律状态数据
  • 全球专利法律状态数据
  • 全球专利引文数据
  • 全球专利分类索引数据
  • 全球专利重点申请人工商关联数据
  • 全球生化医药专利深加工数据
  • 全球专利全文数据

医疗器械数据:

  • 国内政策法规数据 3千
  • 行业标准数据
  • 中国医疗器械审评数据 20万
  • 中国医械临床试验数据 5千
  • 全球医械临床试验数据 7万
  • 医用耗材中标数据 1400万
  • 医用耗材带量采购数据 400万
  • 医用设备招投标数据38万

同时景联文科技提供大模型训练数据的标注服务,致力于为全球数千家人工智能从业公司和高校科研机构交付海量、高质量的多模态大模型训练数据。

景联文科技|数据采集|数据标注|大语言模型训练数据

助力人工智能技术,赋能传统产业智能转型升级

文章图文著作权归景联文科技所有,商业转载请联系景联文科技获得授权,非商业转载请注明出处。