跳到正文

#多模态

今日 1 条
12月3日周三
8月1日周五
7月15日周二
  1. Mistral AI74

    Mistral 发布 Voxtral 语音理解模型,24B 与 3B 两个版本均以 Apache 2.0 开源

    Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟转录或 40 分钟理解,并具备音频问答、摘要、多语言识别与语音触发函数调用能力,其语言模型骨干继承自 Mistral Small 3.1。

    推荐理由:Mistral 开源语音理解模型,给出两款尺寸、32k 上下文与转录基准对比,可据此判断开源语音方案的落地成本。

5月7日周三
3月17日周一
  1. Mistral AI82

    Mistral 发布 Mistral Small 3.1:128k 上下文、多模态、Apache 2.0 开源

    Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本表现、多模态理解,上下文窗口扩展至 128k tokens,推理速度 150 tokens 每秒,以 Apache 2.0 许可证开源。

    推荐理由:Mistral Small 3.1 以 128k 上下文和 Apache 2.0 开源发布,读者可据此判断小模型在端侧多模态任务上的可用边界。

3月7日周五
  1. Mistral AI76

    Mistral AI 发布文档理解模型 Mistral OCR

    Mistral AI 发布 OCR API mistral-ocr-latest,可将图像和 PDF 解析为有序交错的文本与图像,定价为 1000 页/美元,批量推理约翻倍。

    推荐理由:官方给出 Mistral OCR 的文档解析能力、定价与自托管选项,可据此判断其接入多模态 RAG 流程的可行性。