科技行者 3月28日 北京消息:今日,在华为开发者大会2020(Cloud)第二天,华为全面分享在计算视觉领域的基础研究成果,全球开发者可通过公开发表的论文及开源代码,进一步开展AI的研究、开发和部署。同时,华为发布计算视觉研究计划(以下简称视觉计划),并邀请全球AI专家参与研究。基于华为昇腾AI处理器的Atlas人工智能计算平台将为该计划提供强大算力支撑,研究成果将在华为全场景AI计算框架MindSpore实现并开源给业界,让全球AI开发者以此为基础持续创新、不断突破边界、共同打造无所不及的智能。
开放华为计算视觉基础研究成果
投资基础研究是华为AI战略的重要部分,华为致力于在计算视觉、自然语言处理、决策推理等领域构筑数据高效、能耗高效、安全可信、自动自治的机器学习基础能力。
面向全球开发者,华为诺亚方舟实验室计算视觉首席科学家、IEEE Fellow田奇教授分享了计算视觉领域的最新研究进展:“华为在计算视觉领域围绕数据、知识和模型三大方向,大力投入基础研究,过去两年已在AI顶会CVPR、ICCV、NeurIPS、ICLR等发表80余篇论文,并取得多项业界领先的成果,这些研究成果已通过学术论文和算法代码开源等形式公开给业界,我们欢迎全球AI开发者基于华为已有的研究成果,进一步开展AI的研究、开发和部署”。
发布华为计算视觉研究计划、助力每一位AI开发者
华为计算视觉研究计划
在当前研究基础上,田奇教授发布了华为计算视觉计划,“华为将继续加大投入计算视觉的基础研究,不断挑战计算视觉领域三大问题,包括如何从海量数据中高效挖掘有用的信息、设计高效的万物识别视觉模型,以及表达并存储知识以迈向通用智能“。华为视觉计划围绕三大方向,共有六大子计划,包括:
同时,田奇教授表示,“我们欢迎全球AI研究者加入华为视觉计划,共同创新、探索未来。华为Atlas人工智能计算平台的超强算力将全面加速视觉计划开展,研究成果将在华为全场景AI计算框架MindSpore上充分实现并开源给业界,助力每一位AI开发者“。
华为在2018年华为全联接大会上首次发布AI战略,重点投资AI基础研究,并协同全球科研机构和开发者共同构建AI生态。本次开发者大会上,华为系统展示计算视觉领域基础研究成果并发布视觉计划,以AI基础研究和开放创新全面支持全球开发者探索未来,不断突破边界,共同打造无所不及的智能。
好文章,需要你的鼓励
腾讯ARC实验室推出AudioStory系统,首次实现AI根据复杂指令创作完整长篇音频故事。该系统结合大语言模型的叙事推理能力与音频生成技术,通过交错式推理生成、解耦桥接机制和渐进式训练,能够将复杂指令分解为连续音频场景并保持整体连贯性。在AudioStory-10K基准测试中表现优异,为AI音频创作开辟新方向。
Meta与特拉维夫大学联合研发的VideoJAM技术,通过让AI同时学习外观和运动信息,显著解决了当前视频生成模型中动作不连贯、违反物理定律的核心问题。该技术仅需添加两个线性层就能大幅提升运动质量,在多项测试中超越包括Sora在内的商业模型,为AI视频生成的实用化应用奠定了重要基础。
上海AI实验室发布OmniAlign-V研究,首次系统性解决多模态大语言模型人性化对话问题。该研究创建了包含20万高质量样本的训练数据集和MM-AlignBench评测基准,通过创新的数据生成和质量管控方法,让AI在保持技术能力的同时显著提升人性化交互水平,为AI价值观对齐提供了可行技术路径。
谷歌DeepMind团队开发的GraphCast是一个革命性的AI天气预测模型,能够在不到一分钟内完成10天全球天气预报,准确性超越传统方法90%的指标。该模型采用图神经网络技术,通过学习40年历史数据掌握天气变化规律,在极端天气预测方面表现卓越,能耗仅为传统方法的千分之一,为气象学领域带来了效率和精度的双重突破。