腾讯AI实验室与香港中文大学联合研究团队在顶级学术会议发表突破性成果,提出一种全新的大核卷积神经网络(CNN)多模态架构。该架构在标准图像分类基准上的准确率与推理速度均超过当前主流的Transformer模型。更关键的是,模型无需改动主体结构,仅需简单预处理即可适配点云、音频与视频等其他模态,部分指标逼近甚至超越SOTA水平。该技术路线有望降低多模态训练算力门槛,重塑行业技术选型标准。
关键要点
- 单架构兼容图像点云音频等多模态输入
- 推理速度与精度全面超越主流Transformer
- 有望大幅降低多模态训练与部署算力成本