程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
多模态 相关技术文章
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
OmniShow 开源:全模态统一框架,文本+图像+音频+姿势一个模型通吃
资讯
OmniShow 开源:全模态统一框架,文本+图像+音频+姿势一个模型通吃
2026-09-12 09:51:21
OmniShow 是字节跳动、香港中文大学、莫纳什大学和香港大学联合开源的人-物交互视频生成模型:统一通道级条件注入整合文本、参考图像、音频、姿势四种输入,支持 R2V/RA2V/RP2V/RAP2V 四种生成模式,原生支持最长 10 秒长镜头,多项基准取得 SOTA。
OmniShow
视频生成
多模态
人-物交互
字节跳动
SentrySearch:一句话搜索视频画面并自动裁剪,特斯拉行车记录仪直接叠车速
编程
SentrySearch:一句话搜索视频画面并自动裁剪,特斯拉行车记录仪直接叠车速
2026-09-12 09:50:27
SentrySearch 是自然语言视频搜索工具:用多模态嵌入把视频片段转成向量,无需字幕即可理解画面内容,输入一句话精准定位时间点并自动裁剪片段;支持云端 Gemini 与本地 Qwen3-VL 双方案,可叠加特斯拉行车记录仪的车速与定位信息,配合 ChromaDB 本地向量存储。
SentrySearch
视频搜索
多模态
向量检索
Qwen3-VL
阿里开源 Fun-CineForge:会看视频的 AI 配音模型,口型同步、多人对话自然切换
资讯
阿里开源 Fun-CineForge:会看视频的 AI 配音模型,口型同步、多人对话自然切换
2026-09-12 09:50:19
Fun-CineForge 是阿里通义实验室联合中科大开源的零样本电影配音模型:能理解画面与时间线,支持多角色声音自然切换、精准口型同步,覆盖独白、旁白、多人对话场景;并开源首个大规模中文电视剧配音数据集 CineDub-CN 及完整数据集流水线。
Fun-CineForge
AI配音
口型同步
多模态
阿里开源
阿里除夕开源 Qwen3.5:397B 总参数仅激活 17B,硬刚顶级闭源模型
资讯
阿里除夕开源 Qwen3.5:397B 总参数仅激活 17B,硬刚顶级闭源模型
2026-09-12 09:48:40
阿里通义除夕开源 Qwen3.5-397B-A17B:MoE+线性注意力架构,每次推理仅激活 17B 参数,性能对标 GPT-5.2 与 Gemini 3 Pro,支持 1M 上下文、201 种语言与原生多模态,解码吞吐量是 Qwen3-Max 的 19 倍。
Qwen3.5
大模型
MoE
多模态
阿里开源
Google 开源 TranslateGemma:55 种语言翻译模型,还能直接看图翻译
资讯
Google 开源 TranslateGemma:55 种语言翻译模型,还能直接看图翻译
2026-09-12 09:47:05
Google 开源专为翻译任务调优的 TranslateGemma 模型(4B/12B/27B),覆盖 55 种语言,12B 版本性能超越 27B 且可在消费级显卡运行,支持直接翻译图像中的文字,可在手机、笔记本上部署出私有版 Google 翻译。
TranslateGemma
Gemma
机器翻译
多模态
开源模型
微信开源 WeMM-Embedding:2B/4B/9B 多模态检索模型 + 仓库与部署实测
资讯
微信开源 WeMM-Embedding:2B/4B/9B 多模态检索模型 + 仓库与部署实测
2026-09-07 15:32:48
微信视觉团队开源多模态 Embedding 模型 WeMM-Embedding(GitHub: Tencent/WeMM-Embedding),2B/4B/9B 三档,9B 以 80.6 分登顶 MMEB-v2、2B 反超 8B 开源基线。补齐官方仓库、HuggingFace 权重与 arXiv 技术报告链接,梳理 Matryoshka 可变维度(256 维保留 98.7%)及 Transformers/vLLM/SGLang 部署与版本钉死等注意事项,供做多模态搜索与 RAG 检索的团队参考。
AI模型
多模态
Embedding
开源
检索
部署
HuggingFace Transformers v5.14.0 发布:支持 Inkling 多模态大模型(975B 参数)
编程
HuggingFace Transformers v5.14.0 发布:支持 Inkling 多模态大模型(975B 参数)
2026-09-05 20:44:56
HuggingFace 发布 Transformers v5.14.0,新增对 Thinking Machines 公司 Inkling 模型的支持。Inkling 是通用多模态 MoE 模型,总参数 975B、激活参数 41B,支持文本、图像、音频输入和文本输出。
HuggingFace
Transformers
Inkling
大模型
多模态
MoE
AI
深度学习
文本图片视频API全部不要钱:Agnes AI开放三模态免费接口,1M上下文加4K出图加音画同步视频
编程
文本图片视频API全部不要钱:Agnes AI开放三模态免费接口,1M上下文加4K出图加音画同步视频
2026-09-05 19:15:38
介绍Agnes AI推出的免费API政策:文本模型Agnes-2.0-Flash(1M上下文)、图片模型Agnes-Image-2.1-Flash(4K分辨率)、视频模型Agnes-Video-V2.0(音画同步)三个模型API无限期免费开放,接口兼容OpenAI,上线两周调用量达3.12万亿Token。
Agnes AI
免费API
多模态
文本生成
图片生成
视频生成
doc7:5MB的文档理解工具,用多模态模型把PDF/Word/扫描件统一转成Markdown,1.1K Star
编程
doc7:5MB的文档理解工具,用多模态模型把PDF/Word/扫描件统一转成Markdown,1.1K Star
2026-09-05 19:06:17
介绍doc7这个文档转换工具:将PDF、Office、扫描件、截图、图表、邮件、Notebook等各种格式统一渲染为页面后交给多模态视觉模型理解,输出干净的Markdown。公式转LaTeX、图表关系一并理解,支持本地模型(LM Studio/Ollama)和断点续传,二进制仅5MB,GitHub Star超1100。
doc7
文档理解
RAG
多模态
Markdown转换
Parlor:本地端到端语音视觉 AI 助手,M3 Pro 即可实时运行
编程
Parlor:本地端到端语音视觉 AI 助手,M3 Pro 即可实时运行
2026-09-05 19:00:05
介绍 Parlor 这个本地语音视觉 AI 助手:用 Gemma 4 E2B 做多模态理解、Kokoro 做语音合成,在 Apple Silicon 或 Linux GPU 上实现实时对话,支持随时打断、整句边说边播、多语言混合,完全本地运行无需 API Key,9 天获 1.5K Star。
Parlor
本地AI
语音助手
多模态
Gemma 4
Kokoro
Apple Silicon
World Labs 发布 Atlas:把相机坐标当输入的多模态世界模型,3 台手机能复刻子弹时间
资讯
World Labs 发布 Atlas:把相机坐标当输入的多模态世界模型,3 台手机能复刻子弹时间
2026-09-04 00:20:23
World Labs 发布首款多模态世界模型 Atlas:以空间上下文理解三维场景,把相机坐标作为输入实现镜头控制,相机控制对比 MiniMax H3/Seedance 胜率分别 75%/94%,3D 重建误差 25.3 为全场最低;子弹时间场景从 120 台相机降到 3 台手机。
世界模型
Atlas
World
Labs
多模态
视频生成
3D重建
李飞飞
Muse Glimmer 30B 深度拆解:Meta「真开源」旗舰Agent模型如何用一块显卡颠覆本地AI工作流
编程
Muse Glimmer 30B 深度拆解:Meta「真开源」旗舰Agent模型如何用一块显卡颠覆本地AI工作流
2026-08-14 09:44:53
深度拆解Meta开源的Muse Glimmer 30B端侧Agent模型:从稠密Transformer架构、1.8B ViT-G/14视觉编码器,到4-bit GGUF量化、DFlash推测性解码,再到Ollama一键部署、配完整代码实战与15条生产踩坑清单
Muse Glimmer
Meta
Agent模型
本地AI
开源LLM
量化部署
Function Calling
多模态
MiniMax H3 开源视频模型架构深度拆解:从 Contextual Omni Representation 到 H3-Omni Transformer 的全链路工程解析
编程
MiniMax H3 开源视频模型架构深度拆解:从 Contextual Omni Representation 到 H3-Omni Transformer 的全链路工程解析
2026-08-11 14:32:39
深度拆解 MiniMax H3 开源视频模型三层模块架构:Contextual Omni Representation、H3-Omni Transformer、H3-VAE,以及 FL2VA 与 Ref2VA 的技术差异、INT8 量化优化与本地部署实战
MiniMax H3
视频生成
开源AI
扩散模型
多模态
H3-Omni Transformer
MiniMax H3 开源全模态视频模型深度解析:从架构设计到本地部署实战
编程
MiniMax H3 开源全模态视频模型深度解析:从架构设计到本地部署实战
2026-08-09 09:15:42
深度解析MiniMax H3开源视频模型的技术架构、核心原理与本地部署实战,涵盖Contextual Omni Representation、H3-VAE、H3-Omni Transformer、In-context Regeneration四项核心技术与完整部署指南。
AI
开源
视频生成
MiniMax
H3
多模态
Transformer
MiniMax H3 深度拆解:当多模态生成决定「用一个模型替代所有专家」——从 Contextual Omni Representation 到 In-context Regeneration,一个开源的全模态统一模型如何用「去任务化」重新定义 AI 创作的终极形态
编程
MiniMax H3 深度拆解:当多模态生成决定「用一个模型替代所有专家」——从 Contextual Omni Representation 到 In-context Regeneration,一个开源的全模态统一模型如何用「去任务化」重新定义 AI 创作的终极形态
2026-08-05 19:15:08
深度拆解MiniMax H3全模态统一架构:Contextual Omni Representation跨模态表征、H3-VAE 4倍压缩视觉编码器、H3-Omni Transformer任务泛化架构、In-context Regeneration上下文内局部重现,附完整代码实战与国产芯片适配指南
MiniMax
H3
多模态
视频生成
开源
AI创作
Contextual Omni Representation
H3-VAE
H3-Omni Transformer
In-context Regeneration
全模态
JoyAI-Video-Edit 深度拆解:当京东决定「让视频边播边改」——从流式推理引擎到帧级实时编辑,一个今天刚开源的模型如何用「720P/30fps」重新定义视频创作的终极形态
编程
JoyAI-Video-Edit 深度拆解:当京东决定「让视频边播边改」——从流式推理引擎到帧级实时编辑,一个今天刚开源的模型如何用「720P/30fps」重新定义视频创作的终极形态
2026-08-05 16:46:18
深度拆解京东开源的实时流式视频编辑模型JoyAI-Video-Edit:720P/30fps实时推理、滑动窗口注意力机制、帧间一致性约束、四大编辑能力(全局风格/局部替换/局部删除/字幕编辑),OpenVE-Bench全面领先,覆盖电商直播到具身智能的完整应用生态
JoyAI-Video-Edit
京东
视频编辑
流式推理
Diffusion Transformer
实时编辑
OpenVE-Bench
开源
AI视频
多模态
Qwen3.8-Max 深度拆解:当阿里决定「把 2.4 万亿参数的旗舰模型开源」——MoE 稀疏路由、百万 Token 上下文与自主编码能力如何重新定义开源大模型的终极形态
编程
Qwen3.8-Max 深度拆解:当阿里决定「把 2.4 万亿参数的旗舰模型开源」——MoE 稀疏路由、百万 Token 上下文与自主编码能力如何重新定义开源大模型的终极形态
2026-08-05 05:46:24
深度拆解阿里Qwen3.8-Max:2.4万亿参数MoE旗舰模型,950亿激活参数,100万Token上下文,原生多模态,自主编码16天265次提交,Arena全球第二,Max级模型首次开源
Qwen3.8
MoE
开源大模型
阿里
千问
混合专家
100万Token
自主编码
多模态
2.4万亿参数
MiniMax H3 深度拆解:全模态生成模型的「统一理解」革命——当 AI 学会像导演一样「看画面、听声音、读脚本」后,2K 视频创作的底层逻辑被彻底重写
编程
MiniMax H3 深度拆解:全模态生成模型的「统一理解」革命——当 AI 学会像导演一样「看画面、听声音、读脚本」后,2K 视频创作的底层逻辑被彻底重写
2026-08-03 07:12:16
深度拆解MiniMax H3全模态生成模型三大核心架构:Contextual Omni Representation统一表征、H3-VAE音视频联合编码、H3-Omni Transformer理解-生成异构训练,附完整代码示例、API实战与性能对比分析
MiniMax
H3
全模态
视频生成
MoE
VAE
2K视频
V2V Motion Transfer
AI视频
多模态
Google AI Edge Gallery 深度拆解:当手机成为大模型的「离线战场」——从 LiteRT 推理引擎到端侧 GenAI 的工程全貌(2026)
编程
Google AI Edge Gallery 深度拆解:当手机成为大模型的「离线战场」——从 LiteRT 推理引擎到端侧 GenAI 的工程全貌(2026)
2026-07-18 12:44:38
深度拆解 Google AI Edge Gallery 开源项目:LiteRT 推理引擎架构、INT4 量化原理、多模态支持、模型转换实战、企业级落地场景,配完整 Kotlin 代码示例与性能优化指南。
Google AI Edge Gallery
LiteRT
端侧AI
大模型
Android
量化
多模态
离线推理
移动端部署
GenAI
CyberVerse:开源实时视频通话数字人平台,一张照片让 AI 活过来
编程
CyberVerse:开源实时视频通话数字人平台,一张照片让 AI 活过来
2026-07-14 11:47:44
CyberVerse是开源数字人Agent平台(GPL-3.0),上传一张照片生成实时视频通话数字人,WebRTC低延迟+语音打断+Agent工具调用/RAG/多Agent协作,支持GPT-4o/Qwen/DeepSeek+FlashHead/LiveAct,无需3D建模,RTX 4090即可运行。
数字人
CyberVerse
实时视频
AI Agent
WebRTC
开源
TTS
ASR
多模态
数字永生
RAG-Anything:港大开源多模态文档 RAG 框架,让 AI 真正读懂图、表、公式
编程
RAG-Anything:港大开源多模态文档 RAG 框架,让 AI 真正读懂图、表、公式
2026-07-14 11:37:51
RAG-Anything是香港大学开源的All-in-One多模态文档RAG框架(基于LightRAG),文本/图像/表格/LaTeX公式统一为知识实体,多模态知识图谱双图结构,跨模态混合检索,金融研报/法律合同/科研文献/制造质检开箱即用。
RAG
RAG-Anything
LightRAG
多模态
知识图谱
VLM
RAG框架
开源
HKUDS
当AI第一次"长出眼睛":o3/o4-mini视觉推理架构深度拆解,从TIR思维中间表示到Codex CLI的视觉编程革命
编程
当AI第一次"长出眼睛":o3/o4-mini视觉推理架构深度拆解,从TIR思维中间表示到Codex CLI的视觉编程革命
2026-07-13 09:15:10
深度拆解o3/o4-mini视觉推理核心架构:TIR思维中间表示、空间关系图谱、符号化操作序列、双编码器-解码器架构,配Codex CLI完整实战代码与性能优化指南。
o3
o4-mini
视觉推理
TIR
Codex CLI
OpenAI
多模态
AI编程
百度 Unlimited OCR 深度解析:端到端架构、R-SWA 常数量化 KV Cache,以及让 AI 像人一样抄书的工程革命
编程
百度 Unlimited OCR 深度解析:端到端架构、R-SWA 常数量化 KV Cache,以及让 AI 像人一样抄书的工程革命
2026-07-05 05:41:29
深度解析百度2026年开源的Unlimited OCR模型:端到端架构、R-SWA常数量化KV Cache机制、MoE解码器设计,以及让AI像人一样连续解析长文档的工程革命。含完整代码实战。
OCR
百度
端到端OCR
R-SWA
KV Cache
文档识别
多模态
百度 Unlimited OCR 深度技术解析:端到端多模态OCR模型架构与R-SWA注意力机制详解
编程
百度 Unlimited OCR 深度技术解析:端到端多模态OCR模型架构与R-SWA注意力机制详解
2026-07-05 02:43:03
深入解析百度Unlimited OCR的核心技术:R-SWA注意力机制如何将KV Cache压成常数,DeepEncoder+MoE解码器架构,以及长文档OCR的完整解决方案。
OCR
百度
深度学习
Transformer
KV Cache
端到端
多模态
文档解析
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
python
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
上一页
1
2
3
下一页
共 3 页
到第
页
确定