test2_国内多数模型训练使用中文数据占比超60%
时间:2026-09-13 17:04:54 来源:明德惟馨网
国内多数模型训练使用中文数据占比超60%2025-08-19 11:44:30 来源:人民网-人民日报 责任编辑:尤容 本报北京8月18日电 (记者王云杉)记者从国家数据局获悉:中文数据在国内大模型的训练性能提升方面发挥着重要作用。国内多数模型训练使用的使用数据中文数据占比已经超过60%,有的中文占比模型达到80%。中文高质量数据的国内开发和供给能力持续增强,推动我国人工智能模型性能快速提升。多数
在人工智能时代,Token(通常所说的训练词元)是处理文本的最小数据单元。国家数据局局长刘烈宏介绍,使用数据2024年初,中文占比我国日均Token的国内消耗量为1000亿,截至今年6月底,多数日均Token消耗量已经突破30万亿,模型1年半时间增长了300多倍,反映了我国人工智能应用规模的快速增长。
《 人民日报 》( 2025年08月19日 06 版)
相关内容
- ·去年规上有色金属工业利润总额同比明显增长
- ·从1.4亿人“全球购”看中国机遇2.0
- ·让最快高铁列车跑得快、停得住
- ·哈尔滨市将公布“楼市新政”:全国第一个鼓励降房价的省会城市
- ·2024年全社会用电量同比增长6.8%
- ·物流网建设进入全面施工阶段
- ·农业机器人4S店,能干些啥
- ·最高法发布《关于依法审理涉人工智能纠纷案件的意见》
- ·2024年城镇新增就业1256万人
- ·房地产拉动投资方式转向城市更新
- ·福马“小三通”暑期客运量创复航以来新高
- ·在“玻璃丝”上刻写中国精度
- ·2024年全国消费品新增2163.9万种
- ·市场监管总局强化民生计量监管
- ·从“头”到“尾”,都是致富门道
- ·上半年数字产业收入同比增长13.6%
最新内容
推荐内容
