AAI Search
← 返回首页
话题

多模态

331 条相关资讯 · 来自历史归档

行业动态
7/17 18:45
2026最受投资人关注人工智能/具身智能企业50揭晓

人工智能正在进入一个新的产业周期。 过去一年,大模型能力持续演进,生成式AI、多模态交互、智能体等技术方向快速推进;而具身智能也从早期的技术探索阶段,逐渐步入产业验证的深水区,机器人开始成为人工智能与现实世界的重要载体。 市场率先给出了回应。据36氪研究院测算,中国具身智能市场规模已从2018年的2133亿元增长至2025年的9150亿元,2026年有望突破…

行业动态
7/17 15:22
腾讯发布具身 VLM 基座模型 Hy-Embodied-VLM-1.0,A3B 规模整体性能接近上一代 A32B 模型

IT之家 7 月 17 日消息,腾讯 Robotics X 实验室、福田实验室联合腾讯混元打造的第二代具身 VLM 基座模型 Hy-Embodied-VLM-1.0 昨日正式发布。 官方表示,在覆盖 37 个评测任务的具身能力评测体系中,Hy-Embodied-VLM-1.0 在物理状态理解、动作 — 变化推理、时序与自适应推理三大维度分别取得 68.6、6…

AI 点评 · 参数规模锐减十倍,性能逼近上一代大模型,具身智能走向高效实用化。

行业动态
7/17 10:39
36氪首发 | 港科大博士创业做机器人全身触觉系统,红杉、瓴智、智元共同押注

作者 | 乔钰杰 编辑 | 袁斯来 硬氪获悉,全身多模态融合触觉解决方案公司模感科技(MoSense)近日完成数千万元天使轮融资,投资方包括红杉中国、高瓴创投及智元机器人。本轮融资资金将主要用于加速研发、团队扩充、算力投入及量产测试体系建设。 模感科技成立于2026年5月,总部注册于上海,在深圳前海设有研发中心,聚焦机器人全身多模态触觉感知系统研发。公司正式…

AI 点评 · 红杉、高瓴、智元联手押注,机器人触觉赛道技术壁垒高、应用前景广。

行业动态
7/13 16:34
字节探索自动驾驶,Seed世界模型团队负责|36氪独家

36氪从多位产业人士处获悉,字节跳动正探索进入自动驾驶领域。这一项目目前由Seed旗下周畅的世界模型团队负责。据了解,Seed旗下不仅有周畅的多模态模型、世界模型等团队,还有大语言模型方向。 而自动驾驶与世界模型的技术路线有交叠之处。 另有消息人士告诉36氪,业务方向上,字节有意布局的自动驾驶场景有无人物流,这一业务隶属于字节旗下的火山引擎汽车行业线。 部分…

行业动态
7/13 10:39
对话Om AI赵天成:多年坚守,押注物理AI原生的「流式」未来

一个从未见过监控画面的多模态模型,却比在监控数据上练了多年的小模型“老将”更懂监控。这不是科幻电影,这是2023年Om AI联汇的一场“无心插柳”,也是CEO兼首席科学家赵天成博士更加坚信“多模态训练方式能为物理开放世界带来泛化性”的关键节点。彼时,AI行业正在追求以大语言模型为核心的生成式AI。 三年后,这个多模态模型演变成了VLX——全球首个面向物理AI…

AI 点评 · 押注物理AI原生流式架构,多模态泛化性突破传统小模型局限。

产品发布/更新
7/12 23:12
Meta 发布多模态推理模型 Muse Spark 1.1,强化 AI 智能体任务能力

IT之家 7 月 12 日消息,Meta 于 7 月 9 日正式发布适用于 AI 智能体的多模态推理模型 Muse Spark 1.1 版本,重点提升了模型在智能体任务中的规划、协同与执行能力,并增强了工具调用、代码开发、应用操作能力。 Meta 表示,Muse Spark 1.1 强化了多智能体协作机制,由主智能体负责收集信息、制定计划,再将任务拆分并分配…

AI 点评 · 多智能体协作机制是AI落地的关键突破,Meta这次强化了任务拆解与分工能力。

论文研究
7/11 00:42
PAC-ACT: Post-training Actor-Critic for Action Chunking Transformers

Precision industrial contact manipulation requires reliable robot policies under pose perturbations and contact-force constraints. Vision-language-action models offer broad generalization but often in…

AI 点评 · 用强化学习微调动作块,提升机器人接触操作的鲁棒性和泛化能力。

产品发布/更新
7/7 16:38
caseclose/cma-harness

Cognitive-structured Multimodal Agent (CMA-Harness): a memory-centric agent for long-horizon multimodal understanding, generation, and editing — externalizing v…

行业动态
7/7 09:05
用AI“复刻”人类细胞、预判药效,「华源智因」获千万级人民币种子轮融资|36氪首发

文|胡香赟 编辑|海若镜 36氪获悉,AI虚拟细胞(AIVC)企业华源智因近期已完成千万级人民币种子轮融资。本轮融资由水木创投领投,募集资金将主要用于多模态测序底层技术迭代,进一步拓展与头部三甲医院的合作,以及团队扩充等。此外,华源智因团队已计划启动新一轮融资。 华源智因创始团队由资深医药产业从业者、计算生物学研发人员组成,并邀请到深圳国家基因库等单位专家组…

产品发布/更新
7/4 16:20
JT-Sun/UAVReason

🚁 Can Vision-Language Models Think from the Sky? UAVReason for Aerial Reasoning and Generation

论文研究
7/2 04:00
Gemma 4 Technical Report

We introduce Gemma 4, a new generation of open-weight, natively multimodal language models in the Gemma model family. Designed to advance compute efficiency and reasoning, the Gemma 4 model suite feat…

模型发布/更新
7/1 07:29
谷歌发布全新AI创作工具,加速多模态内容生成

谷歌在近期举行的I/O开发者大会上宣布了一系列面向开发者的AI创作工具升级,旨在通过最新的Gemini模型家族,降低多媒体内容的生成门槛并提升效率。在视频和多模态创作领域,谷歌发布了全新的Gemini Omni模型。该模型能够理解并处理文本、图像、音频和视频输入,并生成连贯的视频内容。其最突出的特点是支持对话式编辑,用户只需用自然语言描述修改需求,如更换角色…

AI 点评 · 多模态对话式编辑降低视频创作门槛,自然语言交互革新内容生产流程。

行业动态
6/30 23:27
华为官宣全球首个商用多模态文旅大模型规模化应用

IT之家 6 月 30 日消息,华为中国宣布,2026 年 6 月 29 日,全球首个商用多模态文旅大模型 ——“博观文旅大模型”在西安规模应用。截至今年 3 月, “博观”支撑开发的 AI 伴游智能体已覆盖超 400 万用户 。其打造的非遗数字 IP,衍生产品销售超 200 万。 IT之家查询获悉,陕文投与华为等于 2025 年 9 月联合开发的“博观文旅…

论文研究
6/30 04:00
Xiaomi-GUI-0 Technical Report

Graphical user interface (GUI) agents build on vision-language models to complete user tasks end-to-end in real applications through interface actions such as tapping, swiping, text entry, and navigat…

产品发布/更新
6/27 14:12
odebo/CC-Vision

Give non-multimodal Claude Code main models the ability to see pasted screenshots — a ~200-line UserPromptSubmit hook.

行业动态
6/27 07:30
追赶FSD V14,理想在补哪些课?|最前线

过去几年,智能驾驶行业的竞争重心经历了几次明显变化。 最早比的是硬件:激光雷达要不要上、摄像头装几个、算力做到多少 TOPS;随后进入大模型时代,竞争开始转向端到端、VLA(Vision-Language-Action)、World Model(世界模型)等路线。 到了今天,越来越多公司发现,仅仅拥有更大的模型已经不足以形成代际优势,真正决定上限的,开始变成…

AI 点评 · 解析理想追赶特斯拉FSD V14的技术短板,揭示智驾竞争从模型规模转向系统整合的新趋势。

产品发布/更新
6/26 20:23
FudanCVL/Unison

[ICML 2026] Unison: Benchmarking Unified Multimodal Models via Synergistic Understanding and Generation

产品发布/更新
6/25 15:42
RoboScience机器科学发布Visics通用具身大模型,实现跨本体、跨物体、跨任务|最前线

作者|黄楠 编辑|袁斯来 6月24日,通用具身智能企业RoboScience机器科学通用具身大模型发布,首次完整披露自研Visics大模型的技术架构VLOA(Vision-Language-Object-Action),并展示了模型在家具拼装、灵巧抓取、动态流水线等多项真实场景的应用。 大语言模型有标准的文本Token,自动驾驶有统一的视觉或点云表征,这些基…

产品发布/更新
6/23 15:11
vancyland/DataClaw0

DataClaw: Agentic Tailoring Multimodal Data from Raw Streams — coming soon (code, weights, dataset & DataClaw-val upon acceptance).

产品发布/更新
6/23 15:11
vancyland/DataClaw0

DataClaw: Agentic Tailoring Multimodal Data from Raw Streams — coming soon (code, weights, dataset & DataClaw-val upon acceptance).

模型发布/更新
6/17 07:13
谷歌推送 Android 17 正式版,深度集成 AI 功能

IT之家 6 月 17 日消息,谷歌于当地时间周二正式推送了 Android 17 正式版,同时发布了智能手表操作系统 Wear OS 7。本次新版系统将率先搭载于谷歌自家 Pixel 系列设备,同步上线 Pixel 专属功能更新包,新增多项 AI 相关功能,包括对最新人工智能模型的支持,如音乐生成模型 Lyria 3、多模态大模型 Gemini Omni,…

AI 点评 · AI深度融入系统底层,Android 17标志移动平台正式进入AI原生时代,看点在于其生态影响力。

行业动态
6/16 06:59
招商银行推出“运通工程师信用卡”,新用户办卡提供“专属 AI 权益”单月可享 18 亿 Token M3 用量

IT之家 6 月 16 日消息,招商银行宣布推出一款“运通工程师信用卡”,强调相应信用卡拥有“专属 AI 权益”。 IT之家参考官方介绍获悉,新用户办卡首次参与活动达标后,至高可享每月 18 亿 Token M3 用量,可直接用于文档、图像、音视频等多模态模型调用,以及 MaxClaw 龙虾部署等 AI 高频场景。具体来看,相应信用卡“AI 权益体系”提供三…

AI 点评 · 银行信用卡与AI算力打包,精准切中工程师群体的高频需求,开创了金融+AI的跨界权益新玩法。

产品发布/更新
6/15 17:15
volcengine/ark-cli

The fastest way to put Volcengine Ark in your terminal and your AI agent — go from prompt to generated media, multimodal answer, or deployed endpoint in a sin…

产品发布/更新
6/14 21:26
Egoist-Machines/LodeDB

World's fastest and most compact embedded vector database: exact by default, multimodal, local-first, and GPU-accelerated

模型发布/更新
6/11 04:10
小米 MiMo Code V0.1.0 探索性 AI 编程助手发布并开源:基于 OpenCode 二次开发,采用 MIT 协议

IT之家 6 月 11 日消息,小米 MiMo 官方今日凌晨正式发布并开源 MiMo Code V0.1.0 —— 一款运行在终端里的探索性 AI 编程助手。 据介绍, MiMo Code 基于开源项目 OpenCode 二次开发,发布并开源,采用 MIT 协议 。它还内置限时免费多模态模型 MiMo-V2.5,同时支持接入 DeepSeek、Kimi 和…

AI 点评 · 小米开源AI编程助手,降低开发者门槛,推动生态共建,MIT协议利于广泛商用。

产品发布/更新
6/9 19:20
wanshuiyin/ARIS-Movie-Director

Agentic, long-horizon visual generation: a fuzzy story → a cross-model-audited image-based movie. Brings ARIS's research-wiki + multi-agent debate to multimodal…

论文研究
6/6 01:59
MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism

Current Vision-Language Models struggle with hours-long videos because processing full-length visual sequences induces prohibitive token explosion and attention dilution. To overcome this, we introduc…

AI 点评 · 分层记忆架构破解长视频理解瓶颈,用图记忆与智能检索分离感知推理,显著降低计算成本。

产品发布/更新
6/3 22:37
Able-rip/cc-VisionRouter

Transparent proxy for Claude Code that auto-routes image-bearing requests to a multimodal model — so a non-multimodal primary model never crashes your long-runn…

行业动态
6/2 18:22
字节Seed架构调整:周畅管理范围扩大,具身业务纳入核心

字节跳动多模态负责人周畅管理范围再次扩大,原由李航负责的SeedRobotics团队已向周畅汇报月余,李航现以顾问身份负责学术合作方向。字节也正在招聘具身智能技术负责人,负责机器人业务整体规划,职级定位为L8,对标阿里P10-P11,将向周畅汇报。该岗位候选人主要来自头部具身智能创业公司技术负责人。(晚点 LatePost)

AI 点评 · 架构调整显示字节加速整合资源,具身智能成战略核心,技术负责人招聘透露行业人才争夺升级。

产品发布/更新
6/2 06:38
阿里发布 Qwen3.7-Plus 模型,升级多模态交互混合 AI 智能体

IT之家 6 月 2 日消息,阿里千问大模型今天(6 月 2 日)发布博文,宣布推出 Qwen3.7-Plus 模型, 定位为多模态交互混合智能体。 Qwen3.7-Plus 是 Qwen3.7 的多模态升级版,核心定位是视觉与语言统一的智能体基座。 它保留文本、编码、工具使用和生产力工作流能力,同时强化视觉理解、视觉推理和跨模态任务处理。 模型已通过阿里云…

AI 点评 · 多模态与智能体融合,或加速AI从“对话”迈向“行动”的关键一步。

论文研究
6/2 01:56
AdaCodec: A Predictive Visual Code for Video MLLMs

Video is temporally redundant: adjacent frames usually share most objects, background, and layout. Yet existing video multimodal large language models (video MLLMs) usually encode each sampled frame a…

AI 点评 · 提出视频时序冗余新视角,用预测编码压缩帧,有望大幅降低视频多模态模型算力成本。

产品发布/更新
5/29 15:25
StarTrail-org/PixelRAG

The end of web parsing. The beginning of scalable pixel-native search.

AI 点评 · 像素级搜索技术突破,终结传统网页解析,开启视觉原生检索新范式。

产品发布/更新
5/29 15:25
StarTrail-org/PixelRAG

The end of web parsing. The beginning of scalable pixel-native search.

AI 点评 · 将网页解析转向像素级原生搜索,为多模态检索开辟全新路径。

论文研究
5/29 04:00
Task-Focused Memorization for Multimodal Agents

Long-term memory is essential for multimodal agents to build coherent experience, accumulate world knowledge, and achieve continual learning. However, constructing effective memory goes beyond memory…

AI 点评 · 聚焦多模态智能体的长期记忆构建,突破传统记忆局限,实现持续学习与知识积累。

论文研究
5/29 04:00
Linear Scaling Video VLMs for Long Video Understanding

Video vision-language models (VLMs) are increasingly used in long-horizon and streaming settings, yet most video encoders still rely on spatiotemporal self-attention, causing compute and latency to gr…

AI 点评 · 突破视频模型计算瓶颈,实现线性缩放,为长视频实时理解铺平道路。

产品发布/更新
5/28 09:46
modelstudioai/cli

Official Model Studio CLI(阿里云百炼 CLI)built for AI Agent frameworks, exposing models, search, multimodal, and workflow capabilities as structured tool calls.

论文研究
5/28 04:00
GenClaw: Code-Driven Agentic Image Generation

Image generation models have evolved from text-conditioned pixel synthesis toward multimodal agents endowed with visual comprehension and tool invocation capabilities. Yet, existing agents remain at t…

AI 点评 · 代码驱动生成图像,打通语言与视觉鸿沟,开辟智能代理新范式。

论文研究
5/28 04:00
VLM3: Vision Language Models Are Native 3D Learners

Vision Language Models (VLMs) enable a unified model to solve various vision tasks through prompting. They have shown promising performance in semantic understanding. However, 3D understanding still l…

AI 点评 · 打破视觉语言模型对3D理解的局限,开启原生3D学习新范式。

产品发布/更新
5/21 19:14
wangchuxiaoji-oss/doubao2api

Reverse-engineered Doubao (豆包) API → OpenAI-compatible REST service. Free multimodal chat, image/video/music generation, and file hosting for AI agents.

AI 点评 · 逆向工程豆包API,提供免费多模态服务,极大降低AI应用开发门槛。

产品发布/更新
5/21 19:14
wangchuxiaoji-oss/doubao2api

Reverse-engineered Doubao (豆包) API → OpenAI-compatible REST service. Free multimodal chat, image/video/music generation, and file hosting for AI agents.

AI 点评 · 逆向工程将豆包API转为OpenAI兼容接口,免费提供多模态功能,大幅降低AI开发门槛。

产品发布/更新
5/19 11:58
fudan-generative-vision/PromptReinjection

[ICML 2026] Alleviating Prompt Forgetting in Multimodal Diffusion Transformers

AI 点评 · 多模态扩散模型的提示遗忘问题首次被系统性解决,为AI图像生成领域带来突破性进展。

产品发布/更新
5/7 21:28
InternLM/ETCHR

A question-conditioned, reasoning-aware image editor designed to serve as a decoupled visual reasoning assistant for Multimodal Large Language Models (MLLMs).

AI 点评 · 将视觉推理拆解为独立模块,为多模态大模型提供更精准的图像编辑能力。

产品发布/更新
5/7 21:28
InternLM/ETCHR

A question-conditioned, reasoning-aware image editor designed to serve as a decoupled visual reasoning assistant for Multimodal Large Language Models (MLLMs).

AI 点评 · 将推理能力融入图像编辑,为多模态大模型提供解耦式视觉助手,拓展了AI交互边界。

产品发布/更新
5/3 19:04
shawn0728/OpenSearch-VL

🔍 OpenSearch-VL provides a fully open recipe for training strong multimodal deep search agents through high-quality data curation, diverse visual/search tools,…

产品发布/更新
5/3 19:04
shawn0728/OpenSearch-VL

🔍 OpenSearch-VL provides a fully open recipe for training strong multimodal deep search agents through high-quality data curation, diverse visual/search tools,…

产品发布/更新
5/2 00:24
cyeinfpro/Lumen

Self-hosted multimodal AI workspace — chat, vision QA, text-to-image, image-to-image in one conversation

技巧与观点
6/4 22:00
AGI Is Not Multimodal

"In projecting language back as the model for thought, we lose sight of the tacit embodied understanding that undergirds our intelligence." –Terry Winograd The recent successes of…

AI 点评 · 挑战语言中心主义,揭示具身认知对通用智能的核心价值,重塑AI发展路径。