程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
Google把操作电脑塞进Gemini 3.5 Flash了
编程
Google把操作电脑塞进Gemini 3.5 Flash了
2026-06-25 20:56:55 +0800 CST
view 522
Google正式将计算机操作能力原生集成进Gemini 3.5 Flash——模型现在可以看屏幕截图、理解当前界面,并给出下一步操作建议(点击按钮、输入文字、滚动页面、完成表单、检查网页流程)。这不是简单的功能更新,而是AI Agent从聊天走向真正干活的关键一步。不依赖固定选择器,像人一样看界面、理解上下文、做出判断。
Gemini 3.5 Flash
Google
AI Agent
计算机操作
自动化测试
浏览器自动化
多模态
UI-TARS-Desktop 深度解析:ByteDance 如何用多模态 AI Agent 重新定义 GUI 自动化
编程
UI-TARS-Desktop 深度解析:ByteDance 如何用多模态 AI Agent 重新定义 GUI 自动化
2026-05-12 04:43:13 +0800 CST
view 1183
UI-TARS-Desktop 是 ByteDance 开源的多模态 AI Agent 技术栈,包含 Agent TARS CLI/Web UI 和 UI-TARS-Desktop 原生应用。支持自然语言控制电脑、视觉理解界面、MCP 工具集成、Event Stream 协议驱动的 Context Engineering。本文深入解析其架构设计、核心特性、实战案例、性能基准与部署最佳实践。
UI-TARS
ByteDance
GUI自动化
多模态AI
MCP
当AI第一次"长出眼睛":o3/o4-mini视觉推理架构深度拆解,从TIR思维中间表示到Codex CLI的视觉编程革命
编程
当AI第一次"长出眼睛":o3/o4-mini视觉推理架构深度拆解,从TIR思维中间表示到Codex CLI的视觉编程革命
2026-07-13 09:15:10 +0800 CST
view 185
深度拆解o3/o4-mini视觉推理核心架构:TIR思维中间表示、空间关系图谱、符号化操作序列、双编码器-解码器架构,配Codex CLI完整实战代码与性能优化指南。
o3
o4-mini
视觉推理
TIR
Codex CLI
OpenAI
多模态
AI编程
Gemma 4 12B 深度实战:当 Google 把多模态 AI「塞进」你的笔记本——从无编码器架构到本地 Agent 工作流的完全指南(2026)
编程
Gemma 4 12B 深度实战:当 Google 把多模态 AI「塞进」你的笔记本——从无编码器架构到本地 Agent 工作流的完全指南(2026)
2026-06-13 12:46:40 +0800 CST
view 620
深度解析 Google DeepMind Gemma 4 12B 无编码器多模态架构,从架构原理到本地部署,从 Agent 工具链集成到生产级实战,5400+ 字完全指南。
Gemma 4 12B
Google DeepMind
多模态模型
本地推理
Agent
Ollama
无编码器架构
万字深度解析百度 Unlimited-OCR:当端到端OCR遇见R-SWA革命,从逐页失忆到40页文档一口气解析(2026)
编程
万字深度解析百度 Unlimited-OCR:当端到端OCR遇见R-SWA革命,从逐页失忆到40页文档一口气解析(2026)
2026-07-02 10:46:07 +0800 CST
view 281
深度解析百度2026年开源的Unlimited-OCR模型:3B参数的端到端OCR系统,R-SWA机制实现常数级KV缓存,OmniDocBench 93.92% SOTA评分,可一口气解析40页文档
Unlimited-OCR
百度
OCR
R-SWA
MoE
CLIP
端到端
长文档处理
深度学习
多模态
R-SWA如何让OCR「过目不忘」:百度Unlimited-OCR的KV缓存革命与40页长文档解析实战(2026)
编程
R-SWA如何让OCR「过目不忘」:百度Unlimited-OCR的KV缓存革命与40页长文档解析实战(2026)
2026-07-02 10:47:12 +0800 CST
view 377
深度解析百度2026年开源的Unlimited-OCR模型:3B参数的端到端OCR系统,R-SWA机制实现常数级KV缓存,OmniDocBench 93.92% SOTA评分,可一口气解析40页文档
Unlimited-OCR
百度
OCR
R-SWA
MoE
CLIP
端到端
长文档处理
深度学习
多模态
MiniCPM-V 4.6:参数砍到1.3B,多模态小钢炮拿下同级第一
编程
MiniCPM-V 4.6:参数砍到1.3B,多模态小钢炮拿下同级第一
2026-05-13 17:38:45 +0800 CST
view 781
面壁智能发布MiniCPM-V 4.6,参数量仅1.3B,1B级多模态评测第一。仅用Qwen3.5-0.8B的2.5%token量即超越对方。LLaVA-UHD v4架构创新,视觉编码运算量降低55.8%,手机断网秒级响应。
MiniCPM-V
面壁智能
多模态
端侧AI
密度定律
MiniCPM-V 4.6 手机实测:1.3B参数跑满端侧推理,输入框还没缩回结果就出来了
编程
MiniCPM-V 4.6 手机实测:1.3B参数跑满端侧推理,输入框还没缩回结果就出来了
2026-05-13 17:56:16 +0800 CST
view 681
MiniCPM-V 4.6手机实测体验:输入框还没缩回结果就出来了。1.3B参数推理版token消耗仅为Qwen3.5-0.8B的1/43,TTFT高清大图75.7ms快2.2倍,LLaVA-UHD v4架构视觉编码运算量降低55.8%。
MiniCPM-V
面壁智能
端侧AI
手机AI
多模态
RAG-Anything:港大开源多模态文档 RAG 框架,让 AI 真正读懂图、表、公式
编程
RAG-Anything:港大开源多模态文档 RAG 框架,让 AI 真正读懂图、表、公式
2026-07-14 11:37:51 +0800 CST
view 281
RAG-Anything是香港大学开源的All-in-One多模态文档RAG框架(基于LightRAG),文本/图像/表格/LaTeX公式统一为知识实体,多模态知识图谱双图结构,跨模态混合检索,金融研报/法律合同/科研文献/制造质检开箱即用。
RAG
RAG-Anything
LightRAG
多模态
知识图谱
VLM
RAG框架
开源
HKUDS
阿里发布首个「音视频实时交互」模型,实现数字人实时视频聊天
编程
阿里发布首个「音视频实时交互」模型,实现数字人实时视频聊天
2026-06-26 18:16:02 +0800 CST
view 692
阿里发布 Wan-Streamer v0.1,原生流式端到端音视频实时交互多模态模型,同一Transformer内完成感知/理解/生成全流程,响应延迟低至200ms,支持25fps音画同步输出。
AI
多模态
数字人
阿里
实时交互
视频生成
GLM-OCR 深度解析:0.9B 参数的文档理解小钢炮,OmniDocBench 拿下 94.62 分的秘密
编程
GLM-OCR 深度解析:0.9B 参数的文档理解小钢炮,OmniDocBench 拿下 94.62 分的秘密
2026-05-13 22:15:56 +0800 CST
view 593
GLM-OCR是智谱AI推出的0.9B参数文档理解多模态模型,凭借布局感知两阶段流水线和GRPO强化学习,在OmniDocBench v1.5以94.62分领先。本文深度解析其CogViT架构、MTP解码加速、印章识别技术及完整部署实战。
GLM-OCR,智谱AI,OCR,多模态模型,文档理解
CyberVerse:开源实时视频通话数字人平台,一张照片让 AI 活过来
编程
CyberVerse:开源实时视频通话数字人平台,一张照片让 AI 活过来
2026-07-14 11:47:44 +0800 CST
view 204
CyberVerse是开源数字人Agent平台(GPL-3.0),上传一张照片生成实时视频通话数字人,WebRTC低延迟+语音打断+Agent工具调用/RAG/多Agent协作,支持GPT-4o/Qwen/DeepSeek+FlashHead/LiveAct,无需3D建模,RTX 4090即可运行。
数字人
CyberVerse
实时视频
AI Agent
WebRTC
开源
TTS
ASR
多模态
数字永生
Gemma 4 12B 深度实战:当 Google 把「无编码器多模态」塞进 16GB 笔记本——从统一架构原理到生产级本地 Agent 的完全指南(2026)
编程
Gemma 4 12B 深度实战:当 Google 把「无编码器多模态」塞进 16GB 笔记本——从统一架构原理到生产级本地 Agent 的完全指南(2026)
2026-06-14 04:46:45 +0800 CST
view 528
深度解析 Google DeepMind Gemma 4 12B 的无编码器统一多模态架构,从原理到代码实战,涵盖 llama.cpp 部署、量化策略、Agent 工作流和生产级架构设计(2026)。
Gemma 4
Google DeepMind
多模态
本地部署
Agent
llama.cpp
开源大模型
MiniMax H3 开源全模态视频模型深度解析:从架构设计到本地部署实战
编程
MiniMax H3 开源全模态视频模型深度解析:从架构设计到本地部署实战
2026-08-09 09:15:42 +0800 CST
view 29
深度解析MiniMax H3开源视频模型的技术架构、核心原理与本地部署实战,涵盖Contextual Omni Representation、H3-VAE、H3-Omni Transformer、In-context Regeneration四项核心技术与完整部署指南。
AI
开源
视频生成
MiniMax
H3
多模态
Transformer
MiniMax M3 深度实战:当稀疏注意力打破百万 Token 墙——从 MSA 架构原理到 1M 上下文工程实践、原生多模态与 Agent 集群的生产级完全指南(2026)
编程
MiniMax M3 深度实战:当稀疏注意力打破百万 Token 墙——从 MSA 架构原理到 1M 上下文工程实践、原生多模态与 Agent 集群的生产级完全指南(2026)
2026-06-19 07:26:01 +0800 CST
view 404
深度解析MiniMax M3的自研MSA稀疏注意力架构,从KV outer gather Q设计到1M上下文工程实践,包含代码示例、性能优化和部署指南
MiniMax
M3
MSA
稀疏注意力
1M上下文
多模态
Agent
大模型
NVIDIA Cosmos 3 深度实战:当物理AI学会「全模态统一建模」——从 MoT 双塔架构到生产级机器人策略与自动驾驶仿真的完全指南(2026)
编程
NVIDIA Cosmos 3 深度实战:当物理AI学会「全模态统一建模」——从 MoT 双塔架构到生产级机器人策略与自动驾驶仿真的完全指南(2026)
2026-06-14 06:48:12 +0800 CST
view 490
NVIDIA Cosmos 3技术报告深度拆解:MoT双塔架构、统一动作表征、3D多模态位置编码、SILA数据引擎、生产级部署指南
NVIDIA
Cosmos3
物理AI
全模态
世界模型
MoT
机器人
自动驾驶
腾讯混元开源 HyOCR-1.5 深度解读:端到端 OCR 的工程哲学与 DFlash 投机解码完全指南
编程
腾讯混元开源 HyOCR-1.5 深度解读:端到端 OCR 的工程哲学与 DFlash 投机解码完全指南
2026-07-21 12:46:56 +0800 CST
view 204
2026年7月腾讯混元开源HyOCR-1.5端到端OCR大模型,1B参数OmniDocBench 94.74分霸榜。深度拆解DFlash投机解码6.37倍加速、Agentic Data Flow自动化数据闭环、三阶段训练配方,以及vLLM/llama.cpp全场景部署实战。
HyOCR
HunyuanOCR
腾讯混元
端到端OCR
DFlash
投机解码
多模态模型
文档解析
文字识别
视觉语言模型
OmniDocBench
vLLM
llama.cpp
深度学习
RAG-Anything 深度实战:港大开源全模态 RAG 框架,让知识库真正看懂图片、表格和公式
编程
RAG-Anything 深度实战:港大开源全模态 RAG 框架,让知识库真正看懂图片、表格和公式
2026-04-25 00:31:11 +0800 CST
view 823
深度解析港大开源RAG-Anything框架:从多模态文档解析到跨模态知识图谱构建,包含完整代码实战、自定义模态处理器开发、性能优化与生产部署指南
RAG
多模态
知识图谱
HKUDS
LightRAG
MinerU
VLM
文档理解
Gemma 4 12B 深度实战:当无编码器统一多模态架构走进本地
编程
Gemma 4 12B 深度实战:当无编码器统一多模态架构走进本地
2026-06-14 17:49:21 +0800 CST
view 557
深入解析 Google Gemma 4 12B 的无编码器统一多模态架构,从技术原理到生产部署的完整指南
Gemma4
Google
多模态
本地部署
AI
LLM
Encoder-Free
Gemma 4 12B 工程实践:Encoder-Free 统一多模态架构从原理到本地部署完全指南(2026)
编程
Gemma 4 12B 工程实践:Encoder-Free 统一多模态架构从原理到本地部署完全指南(2026)
2026-06-14 17:49:38 +0800 CST
view 652
深入解析 Google Gemma 4 12B 的无编码器统一多模态架构,从技术原理到生产部署的完整指南
Gemma4
Google
多模态
本地部署
AI
LLM
Encoder-Free
综合
Llama 3.1 Omni:颠覆性的文本与语音双输出模型
2024-11-19 09:57:33 +0800 CST
view 2089
Llama3.1Omni模型是一种创新的多模态语言模型,能够同时生成文本和语音,提升用户体验。它适用于客户服务、教育和医疗等多个领域,具有强大的推理能力和生成质量。该模型开源,易于使用,开发者可以根据需求进行定制。Llama3.1Omni的出现为AI应用带来了更智能和多样化的可能性,值得关注和应用。
人工智能
语言模型
多模态交互
开源技术
用户体验
RAG-Anything 深度解析:从多模态文档解析到知识图谱构建,全链路实战指南
编程
RAG-Anything 深度解析:从多模态文档解析到知识图谱构建,全链路实战指南
2026-04-26 05:12:22 +0800 CST
view 877
深度解析RAG-Anything全模态RAG框架:从MinerU文档解析、四管线并行模态分析、到LightRAG知识图谱构建与双级检索,附完整代码实战与性能优化指南
RAG
多模态
知识图谱
LightRAG
MinerU
文档解析
Dify 2026 深度解析:开源 AI 应用开发平台从工作流引擎到多 Agent 协作的全面进化
编程
Dify 2026 深度解析:开源 AI 应用开发平台从工作流引擎到多 Agent 协作的全面进化
2026-05-14 20:14:52 +0800 CST
view 876
Dify 在 2026 年完成战略跃迁:分布式 Raft 工作流协调器保障 5 个 9 可用性,CMAE 多模态引擎支持 16 路并发视觉问答(延迟 410ms),零信任插件沙箱(PSR + WASM)保障企业安全,浙江大学×腾讯 AI 自动编排研究让自然语言生成工作流成为可能。深度解析架构演进、多模态实战、插件安全、企业部署、与 LangChain 横向对比。
Dify
AI工作流
多模态
CMAE
零信任
插件
RAG
开源AI
Kimi K2 系列深度实战:月之暗面开源编码大模型架构解析与生产级部署完全指南
编程
Kimi K2 系列深度实战:月之暗面开源编码大模型架构解析与生产级部署完全指南
2026-06-28 03:15:43 +0800 CST
view 591
深度解析月之暗面Kimi K2系列(K2.5/K2.6/K2.7 Code)的MoE架构、多模态能力、Token优化策略,附Ollama本地部署、OpenRouter API集成、OpenCode实战及Agent工作流完整代码。
Kimi K2
月之暗面
MoE架构
编码大模型
AI编程
Token优化
本地部署
OpenRouter
多模态
Agent工作流
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
2
3
下一页