程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
Vision-Agents 深度实战:用Stream构建多模态AI Agent——从实时视频理解到边缘计算低延迟的完全指南(2026)
编程
Vision-Agents 深度实战:用Stream构建多模态AI Agent——从实时视频理解到边缘计算低延迟的完全指南(2026)
2026-06-03 15:17:28 +0800 CST
view 666
深入解析 GetStream 开源的 Vision-Agents 框架,从架构设计、视频处理管道、多模态LLM集成、RAG知识库、MCP工具调用到Kubernetes生产部署的完整实战指南
Vision-Agents
GetStream
多模态AI
视频AI
Agent
WebRTC
低延迟
RAG
Kimi K2.6实测:Claude 1/6价格,原生多模态编码,能吃截图能迭代
编程
Kimi K2.6实测:Claude 1/6价格,原生多模态编码,能吃截图能迭代
2026-04-21 09:50:07 +0800 CST
view 1148
Kimi K2.6 code preview实测:原生多模态+Tool Calling+Agent能力,价格为Claude 1/6,适合独立开发者做前端复刻和日常编码辅助
AI
LLM
Kimi
K2.6
模型实测
多模态
Agent
编程模型
独立开发
Ollama v0.14.3 深度实战:从本地部署到多模态 AI——2026 年私有化大模型工程化完全指南
编程
Ollama v0.14.3 深度实战:从本地部署到多模态 AI——2026 年私有化大模型工程化完全指南
2026-05-24 12:04:34 +0800 CST
view 427
Ollama v0.14.3 深度实战指南:从架构解析到生产部署,涵盖 GGUF 格式、API 集成、多模态模型、性能优化等核心内容,2026 年私有化大模型首选方案。
Ollama
大模型
本地部署
GGUF
多模态
Qwen3.5小模型深度解析:打破参数内卷,十亿级成本实现百亿级性能
编程
Qwen3.5小模型深度解析:打破参数内卷,十亿级成本实现百亿级性能
2026-05-17 20:51:43 +0800 CST
view 826
深度解析Qwen3.5系列小模型的技术架构、性能表现、部署实践和应用场景,涵盖混合注意力、原生多模态、MoE优化等核心技术。
Qwen3.5
小模型
AI
大模型
多模态
Google把操作电脑塞进Gemini 3.5 Flash了
编程
Google把操作电脑塞进Gemini 3.5 Flash了
2026-06-25 20:56:55 +0800 CST
view 554
Google正式将计算机操作能力原生集成进Gemini 3.5 Flash——模型现在可以看屏幕截图、理解当前界面,并给出下一步操作建议(点击按钮、输入文字、滚动页面、完成表单、检查网页流程)。这不是简单的功能更新,而是AI Agent从聊天走向真正干活的关键一步。不依赖固定选择器,像人一样看界面、理解上下文、做出判断。
Gemini 3.5 Flash
Google
AI Agent
计算机操作
自动化测试
浏览器自动化
多模态
UI-TARS-Desktop 深度解析:ByteDance 如何用多模态 AI Agent 重新定义 GUI 自动化
编程
UI-TARS-Desktop 深度解析:ByteDance 如何用多模态 AI Agent 重新定义 GUI 自动化
2026-05-12 04:43:13 +0800 CST
view 1243
UI-TARS-Desktop 是 ByteDance 开源的多模态 AI Agent 技术栈,包含 Agent TARS CLI/Web UI 和 UI-TARS-Desktop 原生应用。支持自然语言控制电脑、视觉理解界面、MCP 工具集成、Event Stream 协议驱动的 Context Engineering。本文深入解析其架构设计、核心特性、实战案例、性能基准与部署最佳实践。
UI-TARS
ByteDance
GUI自动化
多模态AI
MCP
当AI第一次"长出眼睛":o3/o4-mini视觉推理架构深度拆解,从TIR思维中间表示到Codex CLI的视觉编程革命
编程
当AI第一次"长出眼睛":o3/o4-mini视觉推理架构深度拆解,从TIR思维中间表示到Codex CLI的视觉编程革命
2026-07-13 09:15:10 +0800 CST
view 224
深度拆解o3/o4-mini视觉推理核心架构:TIR思维中间表示、空间关系图谱、符号化操作序列、双编码器-解码器架构,配Codex CLI完整实战代码与性能优化指南。
o3
o4-mini
视觉推理
TIR
Codex CLI
OpenAI
多模态
AI编程
Gemma 4 12B 深度实战:当 Google 把多模态 AI「塞进」你的笔记本——从无编码器架构到本地 Agent 工作流的完全指南(2026)
编程
Gemma 4 12B 深度实战:当 Google 把多模态 AI「塞进」你的笔记本——从无编码器架构到本地 Agent 工作流的完全指南(2026)
2026-06-13 12:46:40 +0800 CST
view 706
深度解析 Google DeepMind Gemma 4 12B 无编码器多模态架构,从架构原理到本地部署,从 Agent 工具链集成到生产级实战,5400+ 字完全指南。
Gemma 4 12B
Google DeepMind
多模态模型
本地推理
Agent
Ollama
无编码器架构
万字深度解析百度 Unlimited-OCR:当端到端OCR遇见R-SWA革命,从逐页失忆到40页文档一口气解析(2026)
编程
万字深度解析百度 Unlimited-OCR:当端到端OCR遇见R-SWA革命,从逐页失忆到40页文档一口气解析(2026)
2026-07-02 10:46:07 +0800 CST
view 313
深度解析百度2026年开源的Unlimited-OCR模型:3B参数的端到端OCR系统,R-SWA机制实现常数级KV缓存,OmniDocBench 93.92% SOTA评分,可一口气解析40页文档
Unlimited-OCR
百度
OCR
R-SWA
MoE
CLIP
端到端
长文档处理
深度学习
多模态
R-SWA如何让OCR「过目不忘」:百度Unlimited-OCR的KV缓存革命与40页长文档解析实战(2026)
编程
R-SWA如何让OCR「过目不忘」:百度Unlimited-OCR的KV缓存革命与40页长文档解析实战(2026)
2026-07-02 10:47:12 +0800 CST
view 413
深度解析百度2026年开源的Unlimited-OCR模型:3B参数的端到端OCR系统,R-SWA机制实现常数级KV缓存,OmniDocBench 93.92% SOTA评分,可一口气解析40页文档
Unlimited-OCR
百度
OCR
R-SWA
MoE
CLIP
端到端
长文档处理
深度学习
多模态
MiniCPM-V 4.6:参数砍到1.3B,多模态小钢炮拿下同级第一
编程
MiniCPM-V 4.6:参数砍到1.3B,多模态小钢炮拿下同级第一
2026-05-13 17:38:45 +0800 CST
view 819
面壁智能发布MiniCPM-V 4.6,参数量仅1.3B,1B级多模态评测第一。仅用Qwen3.5-0.8B的2.5%token量即超越对方。LLaVA-UHD v4架构创新,视觉编码运算量降低55.8%,手机断网秒级响应。
MiniCPM-V
面壁智能
多模态
端侧AI
密度定律
MiniCPM-V 4.6 手机实测:1.3B参数跑满端侧推理,输入框还没缩回结果就出来了
编程
MiniCPM-V 4.6 手机实测:1.3B参数跑满端侧推理,输入框还没缩回结果就出来了
2026-05-13 17:56:16 +0800 CST
view 730
MiniCPM-V 4.6手机实测体验:输入框还没缩回结果就出来了。1.3B参数推理版token消耗仅为Qwen3.5-0.8B的1/43,TTFT高清大图75.7ms快2.2倍,LLaVA-UHD v4架构视觉编码运算量降低55.8%。
MiniCPM-V
面壁智能
端侧AI
手机AI
多模态
RAG-Anything:港大开源多模态文档 RAG 框架,让 AI 真正读懂图、表、公式
编程
RAG-Anything:港大开源多模态文档 RAG 框架,让 AI 真正读懂图、表、公式
2026-07-14 11:37:51 +0800 CST
view 327
RAG-Anything是香港大学开源的All-in-One多模态文档RAG框架(基于LightRAG),文本/图像/表格/LaTeX公式统一为知识实体,多模态知识图谱双图结构,跨模态混合检索,金融研报/法律合同/科研文献/制造质检开箱即用。
RAG
RAG-Anything
LightRAG
多模态
知识图谱
VLM
RAG框架
开源
HKUDS
阿里发布首个「音视频实时交互」模型,实现数字人实时视频聊天
编程
阿里发布首个「音视频实时交互」模型,实现数字人实时视频聊天
2026-06-26 18:16:02 +0800 CST
view 741
阿里发布 Wan-Streamer v0.1,原生流式端到端音视频实时交互多模态模型,同一Transformer内完成感知/理解/生成全流程,响应延迟低至200ms,支持25fps音画同步输出。
AI
多模态
数字人
阿里
实时交互
视频生成
GLM-OCR 深度解析:0.9B 参数的文档理解小钢炮,OmniDocBench 拿下 94.62 分的秘密
编程
GLM-OCR 深度解析:0.9B 参数的文档理解小钢炮,OmniDocBench 拿下 94.62 分的秘密
2026-05-13 22:15:56 +0800 CST
view 643
GLM-OCR是智谱AI推出的0.9B参数文档理解多模态模型,凭借布局感知两阶段流水线和GRPO强化学习,在OmniDocBench v1.5以94.62分领先。本文深度解析其CogViT架构、MTP解码加速、印章识别技术及完整部署实战。
GLM-OCR,智谱AI,OCR,多模态模型,文档理解
CyberVerse:开源实时视频通话数字人平台,一张照片让 AI 活过来
编程
CyberVerse:开源实时视频通话数字人平台,一张照片让 AI 活过来
2026-07-14 11:47:44 +0800 CST
view 252
CyberVerse是开源数字人Agent平台(GPL-3.0),上传一张照片生成实时视频通话数字人,WebRTC低延迟+语音打断+Agent工具调用/RAG/多Agent协作,支持GPT-4o/Qwen/DeepSeek+FlashHead/LiveAct,无需3D建模,RTX 4090即可运行。
数字人
CyberVerse
实时视频
AI Agent
WebRTC
开源
TTS
ASR
多模态
数字永生
Gemma 4 12B 深度实战:当 Google 把「无编码器多模态」塞进 16GB 笔记本——从统一架构原理到生产级本地 Agent 的完全指南(2026)
编程
Gemma 4 12B 深度实战:当 Google 把「无编码器多模态」塞进 16GB 笔记本——从统一架构原理到生产级本地 Agent 的完全指南(2026)
2026-06-14 04:46:45 +0800 CST
view 596
深度解析 Google DeepMind Gemma 4 12B 的无编码器统一多模态架构,从原理到代码实战,涵盖 llama.cpp 部署、量化策略、Agent 工作流和生产级架构设计(2026)。
Gemma 4
Google DeepMind
多模态
本地部署
Agent
llama.cpp
开源大模型
MiniMax H3 开源全模态视频模型深度解析:从架构设计到本地部署实战
编程
MiniMax H3 开源全模态视频模型深度解析:从架构设计到本地部署实战
2026-08-09 09:15:42 +0800 CST
view 222
深度解析MiniMax H3开源视频模型的技术架构、核心原理与本地部署实战,涵盖Contextual Omni Representation、H3-VAE、H3-Omni Transformer、In-context Regeneration四项核心技术与完整部署指南。
AI
开源
视频生成
MiniMax
H3
多模态
Transformer
MiniMax M3 深度实战:当稀疏注意力打破百万 Token 墙——从 MSA 架构原理到 1M 上下文工程实践、原生多模态与 Agent 集群的生产级完全指南(2026)
编程
MiniMax M3 深度实战:当稀疏注意力打破百万 Token 墙——从 MSA 架构原理到 1M 上下文工程实践、原生多模态与 Agent 集群的生产级完全指南(2026)
2026-06-19 07:26:01 +0800 CST
view 449
深度解析MiniMax M3的自研MSA稀疏注意力架构,从KV outer gather Q设计到1M上下文工程实践,包含代码示例、性能优化和部署指南
MiniMax
M3
MSA
稀疏注意力
1M上下文
多模态
Agent
大模型
Qwen3.8-27B 深度实战:270亿参数如何把「多模态+长上下文+编程能力」塞进家用显卡——从 Dense 架构原理到本地部署全链路拆解
编程
Qwen3.8-27B 深度实战:270亿参数如何把「多模态+长上下文+编程能力」塞进家用显卡——从 Dense 架构原理到本地部署全链路拆解
2026-08-16 11:15:36 +0800 CST
view 186
深度拆解阿里Qwen3.8-27B:270亿参数原生多模态稠密模型,262K原生上下文可扩展至100万tokens,编程能力超越Qwen3.7-Plus。从Dense架构原理、混合注意力、YaRN外推、reasoning_effort机制,到INT4量化部署、KV Cache优化、vLLM推理加速、生产级FastAPI部署,配完整代码实战与性能对比数据。
Qwen3.8-27B
多模态模型
Dense架构
长上下文
本地部署
量化优化
编程能力
推理引擎
腾讯混元开源 HyOCR-1.5 深度解读:端到端 OCR 的工程哲学与 DFlash 投机解码完全指南
编程
腾讯混元开源 HyOCR-1.5 深度解读:端到端 OCR 的工程哲学与 DFlash 投机解码完全指南
2026-07-21 12:46:56 +0800 CST
view 260
2026年7月腾讯混元开源HyOCR-1.5端到端OCR大模型,1B参数OmniDocBench 94.74分霸榜。深度拆解DFlash投机解码6.37倍加速、Agentic Data Flow自动化数据闭环、三阶段训练配方,以及vLLM/llama.cpp全场景部署实战。
HyOCR
HunyuanOCR
腾讯混元
端到端OCR
DFlash
投机解码
多模态模型
文档解析
文字识别
视觉语言模型
OmniDocBench
vLLM
llama.cpp
深度学习
RAG-Anything 深度实战:港大开源全模态 RAG 框架,让知识库真正看懂图片、表格和公式
编程
RAG-Anything 深度实战:港大开源全模态 RAG 框架,让知识库真正看懂图片、表格和公式
2026-04-25 00:31:11 +0800 CST
view 853
深度解析港大开源RAG-Anything框架:从多模态文档解析到跨模态知识图谱构建,包含完整代码实战、自定义模态处理器开发、性能优化与生产部署指南
RAG
多模态
知识图谱
HKUDS
LightRAG
MinerU
VLM
文档理解
Gemma 4 12B 深度实战:当无编码器统一多模态架构走进本地
编程
Gemma 4 12B 深度实战:当无编码器统一多模态架构走进本地
2026-06-14 17:49:21 +0800 CST
view 607
深入解析 Google Gemma 4 12B 的无编码器统一多模态架构,从技术原理到生产部署的完整指南
Gemma4
Google
多模态
本地部署
AI
LLM
Encoder-Free
Gemma 4 12B 工程实践:Encoder-Free 统一多模态架构从原理到本地部署完全指南(2026)
编程
Gemma 4 12B 工程实践:Encoder-Free 统一多模态架构从原理到本地部署完全指南(2026)
2026-06-14 17:49:38 +0800 CST
view 720
深入解析 Google Gemma 4 12B 的无编码器统一多模态架构,从技术原理到生产部署的完整指南
Gemma4
Google
多模态
本地部署
AI
LLM
Encoder-Free
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
2
3
4
5
下一页