您好,欢迎来到一起上网站目录!
当前位置:一起上网站目录 » 站长资讯 » 行业新闻 » 文章详细 订阅RssFeed

超GPT-4o,1240亿参数!最强开源多模态模型 Pixtral Large!

来源:站长之家 浏览:1次 时间:2024-11-19

声明:本文来自于微信公众号 AIGC开放社区,作者:AIGC开放社区,授权站长之家转载发布。

今天凌晨,法国著名开源大模型平台Mistral.ai,开源了超大多模态模型——Pixtral Large

Pixtral Large有1240亿参数,支持128K上下文,能理解文本、图表、图像等,也是Mistral.ai自家聊天助手 le Chat目前正在使用的视觉模型。支持中文、法文、英文等十多种主流语言。

根据测试数据显示,Pixtral Large在MMMU、MathVista、ChartQA、DocVQA、VQAv2等基准测试的数据,超过了GPT-4o、Gemini-1.5Pro、Claude-3.5Sonnet、Llama-3.290B,成为目前最强的开源多模态模型。

同时,Mistral.ai还发布了一个免费的支持PDF理解、网络搜索、Canvas、AI Agent、图片生成的多模态AI助手——le Chat。

开源地址:https://huggingface.co/mistralai/Pixtral-Large-Instruct-2411

Pixtral Large简单介绍

Pixtral Large是基于Mistral Large2开发而成,有1230亿参数多模态解码器和10亿参数视觉编码器

多模态解码器是Pixtral Large的核心,主要负责整合和处理来自视觉编码器的图像信息以及文本数据。这个庞大的参数量使得解码器能够捕捉到复杂的模式和关系,无论是在文本中的长距离依赖还是在图像中的细节,实现高质量的图像描述、视觉问答和文档理解等。

而10亿参数的视觉编码器则是Pixtral Large处理图像数据的关键。这个编码器专门设计用于将图像转换为模型可以理解的高维特征表示。

通过这种方式,Pixtral Large能够理解图像中的视觉元素,并将这些信息与文本数据结合起来,以产生更丰富的上下文理解和更准确的任务执行。

在技术层面,Pixtral Large的视觉编码器采用了先进的变换器架构,能够有效地处理不同分辨率和宽高比的图像。这种灵活性对于处理现实世界中的图像至关重要,因为这些图像的尺寸和形状千差万别。此外,视觉编码器还采用了自注意力机制,模型能够在处理图像时考虑到全局上下文,而不仅仅是局部特征。

Pixtral Large的多模态解码器则进一步将这些视觉特征与文本信息结合起来。通过这种方式,模型不仅能够理解图像中的内容,还能够理解这些内容如何与文本数据相互作用和关联,它允许模型在处理多模态输入时动态地调整其关注点。

此外,Pixtral Large还采用了一种新颖的序列打包技术,这使得模型能够在单个批次中高效地处理多张图像。通过构建块对角掩码来确保不同图像之间的特征不会相互干扰,从而提高了模型处理多图像数据的效率和准确性。

在长上下文窗口方面,Pixtral Large拥有128K的上下文窗口,这使得模型能够处理大量的文本和图像数据。这对于理解和总结长篇文档或处理包含多个图像的复杂场景至关重要。长上下文窗口确保了模型能够在处理这些复杂任务时保持信息的连贯性和完整性

le Chat介绍

今天凌晨,Mistral.ai还对他们的类ChatGPT助手le Chat进行了重磅更新。

在这次更新中,Le Chat引入了网络搜索和引用功能,用户可以直接在聊天界面中搜索互联网上的最新信息,并获取带有引用链接的答案。对于学生和专业人士来说非常有帮助,可以在准备研究报告或学术论文时,快速准确地获取资料和数据。

Le Chat还推出了一个全新的Canvas功能,支持想法的构思允许内联编辑和导出,极大地提高了创意工作的效率。用户可以在Canvas上进行头脑风暴、编辑内容,并将其导出为各种格式,方便进一步使用。

现在Le Chat也能够处理大型、复杂的PDF文档和图像,得益于最新的多模态模型Pixtral Large,能够分析和总结文档中的图表、表格、图示、文本、公式和方程等内容。例如,它可以轻松解析著名的量子纠缠论文,展示出信息提取、总结和语义理解的强大能力。

Le Chat还与Black Forest Labs合作,整合了领先的图像生成技术Flux Pro,使用户可以直接在Le Chat中生成高质量的图像。这一功能特别适用于创意设计和营销领域,用户可以快速生成符合需求的图像,提高工作效率。

此外,Le Chat还提供了AI Agent功能。用户可以将特定类型的工作流程编码为 Agent,然后发布并与团队成员共享,实现更高效的工作流管理和自动化操作。常见的使用场景包括收据扫描、费用报告、会议纪要的总结和发票处理等。

在性能提升方面,Le Chat通过投机性编辑技术,显著提高了响应速度,用户可以更快地获得高质量的回答和建议,提高了整体的工作效率。同时,Le Chat提供了一个从模型到输出的完全集成平台,用户可以在一个平台上完成所有的多模态任务,无需在多个工具之间切换,简化了工作流程。

体验地址:https://chat.mistral.ai/chat(没锁区直接访问)

推荐站点

  • 0502站长工具网0502站长工具网

    0502站长工具网为您提供json格式化,json代码压缩,json校验解析,json数组解析,json转xml,xml转json,json解析,json在线解析,json在线解析及格式化,unix时间戳转换,CSS美化压缩,json美化,json格式化输出,json数组,json实体类,json视图等

    www.0502.net
  • 24gym24gym

    24gym是国内领先的健身房智能化整体解决方案提供商,致力于研发健身领域的软硬件产品,打造24小时健身房,颠覆传统健身房,创建10分钟健身圈,欢迎意向投资健身房、智能健身房加盟的人士与我们联系,将为你提供健身房经营更优解决方案。

    www.24gym.cn
  • 堆糖堆糖

    堆糖,美图壁纸兴趣社区。收录几十亿高清优质图片,数千万用户的珍藏分享,一键收藏下载美图,点亮生活无限灵感,做你的美好研究所:拥有高清壁纸、情侣头像、明星爱豆、影视动漫、情感文字、表情包、绘画手帐、P图教程、美妆穿搭、歌词台词、可爱萌宠等多种图片分类。你想要的风景壁纸、聊天背景、朋友圈背景、动漫头像都可以在这里找到。

    www.duitang.com
  • 图片之家图片之家

    图片之家_是以摄影图片大全为主国内综合性图片的网站,致力于打造各类好看的图片,包括奇闻异事图片,装修效果图,搞笑图片,搞笑动态图片,美女图片,美女人体艺术,发型图片,创意家居,创意广告设计,桌面壁纸,摄影作品等精选图片大全等你来挖掘。

    www.tupianzj.com
  • 煎蛋煎蛋

    煎蛋以译介方式传播网络新鲜资讯

    jandan.net