微软多模态ChatGPT来了？16亿参数搞定看图答题、智商测验等任务-人工智能-PHP中文网

KOSMOS-1：一个多模态大型语言模型

模型训练

实验结果

首页

科技周边

人工智能

微软多模态ChatGPT来了？16亿参数搞定看图答题、智商测验等任务

PHPz

Apr 14, 2023 pm 06:28 PM

ai 模型

在 NLP 领域，大型语言模型（LLM）已经成功地在各种自然语言任务中充当通用接口。只要我们能够将输入和输出转换为文本，就能使得基于 LLM 的接口适应一个任务。举例而言，摘要任务输入文档，输出摘要信息。所以，我们能够将输入文档馈入摘要型语言模型，并生成摘要。

尽管 LLM 在 NLP 任务中取得了成功的应用，但研究人员仍努力将其原生地用于图像和音频等多模态数据。作为智能的基本组成部分，多模态感知是实现通用人工智能的必要条件，无论是对于知识获取还是与现实世界打交道。更重要的是，解锁多模态输入能够极大地拓展语言模型在更多高价值领域的应用，比如多模态机器人、文档智能和机器人技术。

因此，微软团队在论文《Language Is Not All You Need: Aligning Perception with Language Models》中介绍了一个多模态大型语言模型（MLLM）——KOSMOS-1，它可以感知一般模态、遵循指令（即零样本学习）以及在上下文中学习（即少样本学习）。研究目标是使感知与 LLM 保持一致，如此一来模型能够看到（see）和说话（talk）。研究者按照 METALM（参见论文《Language models are general-purpose interfaces》）的方式从头开始训练 KOSMOS-1。

微软多模态ChatGPT来了？16亿参数搞定看图答题、智商测验等任务

论文地址：https://arxiv.org/pdf/2302.14045.pdf
项目地址：https://github.com/microsoft/unilm

如下图 1 所示，研究者将一个基于 Transformer 的语言模型作为通用接口，并将其与感知模块对接。他们在网页规模的多模态语料库上训练模型，语料库包括了文本数据、任意交错的图像和文本、以及图像字幕对。此外，研究者还通过传输纯语言数据来校准跨模态的指令遵循能力。

最终，KOSMOS-1 模型原生支持零样本和少样本学习设置下的语言、感知语言与视觉任务，具体如下表 1 所示。

微软多模态ChatGPT来了？16亿参数搞定看图答题、智商测验等任务

研究者在下图 2 和图 3 中展示了一些生成示例。除了各种自然语言任务，KOSMOS-1 模型能够原生处理广泛的感知密集型任务，如视觉对话、视觉解释、视觉问答、图像字幕、简单的数学方程式、OCR 和带描述的零样本图像分类。他们还根据瑞文推理测验（Raven's Progressive Matrices, RPM）建立了一个 IQ 测试基准，用来评估 MLLM 的非语言推理能力。

微软多模态ChatGPT来了？16亿参数搞定看图答题、智商测验等任务

这些示例表明，多模态感知的原生支持为将 LLM 应用于新任务提供了新的机遇。此外与 LLM 相比，MLLM 实现了更好的常识推理性能，表明了跨模态迁移有助于知识获取。

由于 KOSMOS-1 模型的参数量为 16 亿，因此有网友表示有望在自己的电脑上运行这个多模态大模型。

微软多模态ChatGPT来了？16亿参数搞定看图答题、智商测验等任务

KOSMOS-1：一个多模态大型语言模型

如图 1 所示，KOSMOS-1 是一个多模态语言模型，它既可以感知一般的模态、遵循指令、还能在上下文中学习并生成输出。具体来说，KOSMOS-1 的主干是一个基于 Transformer 的因果语言模型。除了文本之外，其他模态也能被嵌入并输入到该模型中，如下图中，除了语言还有视觉、语音等的嵌入。Transformer 解码器用作多模态输入的通用接口。一旦模型训练完成，KOSMOS-1 在零样本和少样本设置中也能对语言任务和多模态任务进行评估。

微软多模态ChatGPT来了？16亿参数搞定看图答题、智商测验等任务

Transformer 解码器以统一的方式感知模态，输入信息会被 flatten 为带有特殊 token 的序列。例如表示序列开始、表示序列结束。特殊 token 和表示编码图像嵌入的开始和结束。

微软多模态ChatGPT来了？16亿参数搞定看图答题、智商测验等任务

嵌入模块将文本 token 和其他输入模态编码成向量表示，对于输入 token，该研究使用查找表将其映射到嵌入中。对于连续信号模态（例如，图像和音频），也可以将输入表示为离散编码。

之后，获得的输入序列嵌入会被馈送到基于 Transformer 的解码器。然后因果模型以一种自回归的方式处理序列，从而产生下一个 token。总而言之，MLLM 框架可以灵活地处理各种数据类型，只要将输入表示为向量即可。

模型训练

首先是训练数据集。数据集包括文本语料库、图像 - 字幕对、图像和文本交叉数据集。具体而言，文本语料库包括 The Pile 、Common Crawl (CC)；图像 - 字幕对包括 English LAION-2B、LAION-400M、COYO-700M 以及 Conceptual Captions；图像和文本交叉多模态数据集来自 Common Crawl snapshot。

数据集有了，然后是训练设置。MLLM 组件包含 24 层、隐藏维度是 2048、8192 个 FFN 和 32 个注意力头、参数量为 1.3B。为了使模型更好的收敛，图像表示是从具有 1024 个特征维度的预训练 CLIP ViT-L/14 模型获得的。图像在训练过程中被预处理为 224×224 分辨率，此外，训练期间除了最后一层，所有的 CLIP 模型参数被冻结。KOSMOS-1 的参数总数约为 1.6B。

微软多模态ChatGPT来了？16亿参数搞定看图答题、智商测验等任务

实验结果

该研究进行了一系列丰富的实验来评价 KOSMOS-1 ：语言任务（语言理解、语言生成、 OCR-free 文本分类）；跨模态迁移（常识推理）；非语言推理（ IQ 测试）；感知 - 语言任务（图像字幕、视觉问答、网页问答）；视觉任务（零样本图像分类、带有描述的零样本图像分类）。

图像字幕。下表给出了不同模型在 COCO 和 Flickr30k 上的零样本性能。相比其他模型，KOSMOS-1 均取得了显著效果，甚至在参数量远小于 Flamingo 的基础上，性能也不错。

微软多模态ChatGPT来了？16亿参数搞定看图答题、智商测验等任务

下表为少样本性能对比：

微软多模态ChatGPT来了？16亿参数搞定看图答题、智商测验等任务

视觉问答。KOSMOS-1 比 Flamingo-3B 和 Flamingo-9B 模型具有更高的准确率和鲁棒性：

微软多模态ChatGPT来了？16亿参数搞定看图答题、智商测验等任务

下表为少样本性能对比：

微软多模态ChatGPT来了？16亿参数搞定看图答题、智商测验等任务

IQ 测试。瑞文推理测验是评估非语言推理最常见的测试之一。图 4 显示了一个示例。

微软多模态ChatGPT来了？16亿参数搞定看图答题、智商测验等任务

表 6 显示了在 IQ 测试数据集上的评估结果。KOSMOS-1 能够在非语言环境中感知抽象概念模式，然后在多个选择中推理出之后的元素。据了解，这是首次有模型可以执行此类零样本 Raven IQ 测试。

微软多模态ChatGPT来了？16亿参数搞定看图答题、智商测验等任务

网页问答。网页问答旨在从网页中找到问题的答案。它要求模型既能理解文本的语义，又能理解文本的结构。结果如下：

微软多模态ChatGPT来了？16亿参数搞定看图答题、智商测验等任务

多模态思维链提示。受思维链提示的启发，本文对这方面进行了实验。如图 5 本文将感知语言任务分解为两个步骤。在第一阶段给定图像，使用提示来引导模型生成符合要求的输出，以产生最终结果。

微软多模态ChatGPT来了？16亿参数搞定看图答题、智商测验等任务

从表 9 可以看出，多模态思维链提示的得分为 72.9 分，比标准提示高出 5.8 分：

微软多模态ChatGPT来了？16亿参数搞定看图答题、智商测验等任务

了解更多实验内容，请参考原论文。

以上是微软多模态ChatGPT来了？16亿参数搞定看图答题、智商测验等任务的详细内容。更多信息请关注PHP中文网其他相关文章！

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

热AI工具

Undresser.AI Undress

人工智能驱动的应用程序，用于创建逼真的裸体照片

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

免费脱衣服图片

Clothoff.io

AI脱衣机

Video Face Swap

使用我们完全免费的人工智能换脸工具轻松在任何视频中换脸！

显示更多

热工具

记事本++7.3.1

好用且免费的代码编辑器

SublimeText3汉化版

中文版，非常好用

禅工作室 13.0.1

功能强大的PHP集成开发环境

Dreamweaver CS6

视觉化网页开发工具

SublimeText3 Mac版

神级代码编辑软件(SublimeText3)

显示更多

热门话题

Java教程

1655

CakePHP 教程

1413

Laravel 教程

1306

PHP教程

1252

C# 教程

1226

显示更多

Related knowledge

比特币值多少美金 Apr 28, 2025 pm 07:42 PM

比特币的价格在20,000到30,000美元之间。1. 比特币自2009年以来价格波动剧烈，2017年达到近20,000美元，2021年达到近60,000美元。2. 价格受市场需求、供应量、宏观经济环境等因素影响。3. 通过交易所、移动应用和网站可获取实时价格。4. 比特币价格波动性大，受市场情绪和外部因素驱动。5. 与传统金融市场有一定关系，受全球股市、美元强弱等影响。6. 长期趋势看涨，但需谨慎评估风险。

靠谱的数字货币交易平台推荐全球十大数字货币交易所排行榜2025 Apr 28, 2025 pm 04:30 PM

靠谱的数字货币交易平台推荐：1. OKX，2. Binance，3. Coinbase，4. Kraken，5. Huobi，6. KuCoin，7. Bitfinex，8. Gemini，9. Bitstamp，10. Poloniex，这些平台均以其安全性、用户体验和多样化的功能着称，适合不同层次的用户进行数字货币交易

排名前十的虚拟币交易app有哪最新数字货币交易所排行榜 Apr 28, 2025 pm 08:03 PM

Binance、OKX、gate.io等十大数字货币交易所完善系统、高效多元化交易和严密安全措施严重推崇。

全球币圈十大交易所有哪些排名前十的货币交易平台最新版 Apr 28, 2025 pm 08:09 PM

全球十大加密货币交易平台包括Binance、OKX、Gate.io、Coinbase、Kraken、Huobi Global、Bitfinex、Bittrex、KuCoin和Poloniex，均提供多种交易方式和强大的安全措施。

解密Gate.io战略升级：MeMebox 2.0如何重新定义加密资产管理？ Apr 28, 2025 pm 03:33 PM

MeMebox 2.0通过创新架构和性能突破重新定义了加密资产管理。1) 它解决了资产孤岛、收益衰减和安全与便利悖论三大痛点。2) 通过智能资产枢纽、动态风险管理和收益增强引擎，提升了跨链转账速度、平均收益率和安全事件响应速度。3) 为用户提供资产可视化、策略自动化和治理一体化，实现了用户价值重构。4) 通过生态协同和合规化创新，增强了平台的整体效能。5) 未来将推出智能合约保险池、预测市场集成和AI驱动资产配置，继续引领行业发展。

全球币圈十大交易所有哪些排名前十的货币交易平台2025 Apr 28, 2025 pm 08:12 PM

2025年全球十大加密货币交易所包括Binance、OKX、Gate.io、Coinbase、Kraken、Huobi、Bitfinex、KuCoin、Bittrex和Poloniex，均以高交易量和安全性着称。

排名靠前的货币交易平台有哪些最新虚拟币交易所排名榜前10 Apr 28, 2025 pm 08:06 PM

目前排名前十的虚拟币交易所：1.币安，2. OKX，3. Gate.io，4。币库，5。海妖，6。火币全球站，7.拜比特，8.库币，9.比特币，10。比特戳。

C 中的chrono库如何使用？ Apr 28, 2025 pm 10:18 PM

使用C 中的chrono库可以让你更加精确地控制时间和时间间隔，让我们来探讨一下这个库的魅力所在吧。C 的chrono库是标准库的一部分，它提供了一种现代化的方式来处理时间和时间间隔。对于那些曾经饱受time.h和ctime折磨的程序员来说，chrono无疑是一个福音。它不仅提高了代码的可读性和可维护性，还提供了更高的精度和灵活性。让我们从基础开始，chrono库主要包括以下几个关键组件：std::chrono::system_clock：表示系统时钟，用于获取当前时间。std::chron

See all articles

微软多模态ChatGPT来了？16亿参数搞定看图答题、智商测验等任务

KOSMOS-1：一个多模态大型语言模型

模型训练

实验结果

热AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

Video Face Swap

热门文章

热工具

记事本++7.3.1

SublimeText3汉化版

禅工作室 13.0.1

Dreamweaver CS6

SublimeText3 Mac版

热门话题