全部文章标签

多模态AI

能同时看懂文字、语音、图像和视频的 AI,正在把通用助手从概念变成现实。看多模态模型的发布、能力评测与应用场景。

专题介绍

只会聊天的 AI 已经不够看了——真正的通用助手要能看图、听声、理解视频。多模态就是这条路:各家旗舰模型都在向全模态演进。内容包括多模态大模型的发布动态、跨模态能力对比与真实应用场景,帮你看懂 AI 是如何打通多种感官的。

2026年AI视频生成工具推荐:7款对比,短视频团队这样选

2026年AI视频生成工具推荐:7款对比,短视频团队这样选

AI精选
AI导航 1 次阅读
腾讯Hy翻译App今日上线:33种语言互译,语音拍照离线都能用

腾讯Hy翻译App今日上线:33种语言互译,语音拍照离线都能用

AI资讯
AI导航 2 次阅读
Google 发布 Gemini 3.8 Flash TTS:语音生成更快更便宜,支持 100+ 语言

Google 发布 Gemini 3.8 Flash TTS:语音生成更快更便宜,支持 100+ 语言

AI资讯
AI导航 1 次阅读
小米开源 MiMo-V2.6:万亿参数全模态模型登顶开源榜

小米开源 MiMo-V2.6:万亿参数全模态模型登顶开源榜

AI资讯
AI导航 0 次阅读
DeepSeek-V4.1-Flash 发布:原生多模态进入新架构起点

DeepSeek-V4.1-Flash 发布:原生多模态进入新架构起点

AI资讯
AI导航 11 次阅读
Thinking Machines 发布 Inkling,9750 亿参数多模态模型开放权重

Thinking Machines 发布 Inkling,9750 亿参数多模态模型开放权重

AI资讯
AI导航 21 次阅读
Google 推出 Nano Banana 2 Lite 与 Omni Flash,生成成本继续下探

Google 推出 Nano Banana 2 Lite 与 Omni Flash,生成成本继续下探

AI资讯
AI导航 13 次阅读
HunyuanImage 3.0-Instruct上线:原生多模态理解与高保真图像合成能力公布

HunyuanImage 3.0-Instruct上线:原生多模态理解与高保真图像合成能力公布

AI资讯
AI导航 66 次阅读