跳到正文

技术方向

多模态 最新动态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

3 条精选近 30 天 3 条共收录 4 条

更新

多模态的精选

10月7日周三第 1–3 条
9月29日周二
  1. Microsoft Research66

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨模态生物学世界模型和连接科学工具、文献、湿实验与研究者的交互式 harness 组成。

    推荐理由:微软研究院公开 Quine 的生物学世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。

9月25日周五
  1. Google DeepMind72

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,实现带口型同步、自然表情和流畅轮次的视觉化对话。

    推荐理由:官方给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 种语言支持,可据此判断企业级多模态交互的落地形态。