蚂蚁集团NextEvo全面开源AI Infra技术 可实现大模型训练“自动驾驶”
近日,蚂蚁集团AI创新研发部门NextEvo全面开源AI Infra技术,可帮助大模型千卡训练有效时间占比超过95%,能实现训练时“自动驾驶”,这推动了AI研发效率。
(图:蚂蚁集团的自动化分布式深度学习系统DLRover现已全面开源)
该技术框架名为DLRover,目标在于大规模分布式训练的智能化。目前很多企业的训练作业都是跑在混合部署的集群中,运行环境复杂多变,不管多么“崎岖的地形”,DLRover都可以“轻松行驶”。
2023 年大模型技术的发展,带来了工程实践的爆发,如何管理数据,提高训练和推理效率,最大化利用现有算力,成了关键一环。
完成一个千亿参数级别的大模型,如GPT-3,用一张卡训练一次要耗时32年,那么训练时的算力利用尤为重要。方法之一是把能用的算力用得更好,比如进一步压榨已购买GPU的性能;二是把以前利用不了的算力用起来,比如CPU、内存等,这就需要通过异构计算平台来解决。
最新集成进DLRover的是Flash Checkpoint(FCP)方案。模型训练时,一般要打Checkpoint(检查点),以便中断时能恢复到最近状态,目前常规的做法,存在着耗时长、高频打点易降低训练可用时间、低频打点恢复时丢失过多等缺点。新方案FCP应用在千卡千亿参数模型训练后,Checkpoint 导致的训练浪费时间降低约5倍,其中持久化时间降低约70倍,有效训练时间从90%提升至95%。
同时集成进去的,还有三项新的优化器(Optimizer)技术。优化器作为机器学习的核心组件,用于更新神经网络参数以最小化损失函数。其中,蚂蚁的AGD(Auto-switchable optimizer with Gradient Difference of adjacent steps)优化器,在大模型预训练任务中,相比传统的AdamW技术加速 1.5 倍,AGD已在蚂蚁内部多个场景使用并取得显著效果,相关论文已被 NeurIPS '23收录。
(图:在大模型预训练任务中,AGD相比AdamW可以加速1.5 倍)
作为自动化分布式深度学习系统,DLRover的“自动驾驶”功能模块还包括:Atorch,一种PyTorch分布式训练扩展库,在千亿参数模型千卡级别规模下,训练的算力利用率可达60%,帮助开发者进一步压榨硬件算力。
DLRover以 “ML for System” 的理念来提升分布式训练的智能度,旨在通过一个系统,让开发者完全摆脱资源配置的束缚,专注于模型训练本身。在没有任何资源配置输入的情况下,DLRover 仍然可以为每个训练作业提供最佳资源配置。
据了解,蚂蚁集团在人工智能领域持续进行技术投入,最近,蚂蚁集团在内部成立了AI创新研发部门NextEvo,承担了蚂蚁AI的所有核心技术研发,包含百灵大模型的所有研发工作,涉及AI算法、AI工程、NLP、AIGC等核心技术,并在布局多模态大模型、数字人等领域的技术研发和产品创新。
同时,蚂蚁集团还加速开源节奏,填补了国内相关技术空白,推动人工智能行业快速发展。
DLRover开源地址:https://github.com/intelligent-machine-learning/dlrover
免责声明:本网站所有文章仅作为资讯传播使用,既不代表任何观点导向,也不构成任何投资建议。】
猜你喜欢
李彦宏:不是要一个“超级应用”,是要打造数百万“超级有用”的应用
百度创始人李彦宏在百度世界2024大会上,发表了主题为《应用来了》的演讲,发布两大赋能应用的AI技术:检索增强的文生图技术(iRAG)和无代码工具“秒哒”。蚂蚁集团AI金融管家“蚂小财”在支付宝APP全量对外,月活用户数已达7000万
在9月6日的外滩大会财富论坛上,蚂蚁集团AI金融管家“蚂小财”新版升级亮相,并在支付宝APP内全量对外。升级后的“蚂小财”能更实时解读热点,更有锐度表达观点,提供有问必答、个性化的专业服务。国内首款服务型AI产品亮相外滩大会,支付宝推出新App“支小宝”
9月5日,2024 Inclusion·外滩大会上,支付宝全新发布AI生活管家App“支小宝”,苹果及安卓应用商店均可下载。欧洲杯助力中国赞助商出海“关键一跃” Alipay+合作钱包交易额同比增长68%
北京时间7月15日凌晨,欧洲杯决赛落幕,西班牙队第四次夺冠;西班牙球员达尼·奥尔莫、英格兰球员哈里·凯恩等6名在赛事期间打进三球的球员,共同荣膺蚂蚁集团全球化品牌Alipay+冠名的“得分王”奖杯。蚂蚁数科发布新一代融合AI风控引擎 十月底将开源核心框架
6 月 25 日,蚂蚁数科旗下蚁盾发布新一代融合AI风控引擎“AIR Engine(AI FUSE Risk Engine)”,在原有的决策式AI架构上通过引入生成式AI,进一步提升风控智能化水平。