程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
llm-d进入CNCF:Kubernetes正式迈入AI原生时代
编程
llm-d进入CNCF:Kubernetes正式迈入AI原生时代
2026-04-08 12:29:41 +0800 CST
view 798
IBM、红帽、谷歌联合向CNCF捐赠llm-d项目,标志着Kubernetes正式迈入AI原生时代。本文深度解析llm-d架构设计、性能数据及实践建议。
Kubernetes
云原生
AI
大模型
llm-d
CNCF
Hermes Agent 深度拆解:110K Star 背后的「自进化」架构哲学——当一个 AI Agent 决定「越用越聪明」后,闭环学习、三层记忆与 400+ 技能的工程实战
编程
Hermes Agent 深度拆解:110K Star 背后的「自进化」架构哲学——当一个 AI Agent 决定「越用越聪明」后,闭环学习、三层记忆与 400+ 技能的工程实战
2026-08-03 08:43:47 +0800 CST
view 114
深度拆解Hermes Agent 110K Star自进化AI Agent架构:闭环学习五阶段、三层记忆系统(情景/语义/程序性)、400+技能生态、工具自注册+Toolset组合、多平台统一网关、SQLite+FTS5状态持久化,附完整代码示例与生产部署指南
Hermes Agent
Nous Research
AI Agent
自进化
闭环学习
记忆系统
Skill
Python
多平台网关
开源
Hermes Agent 深度实战:自进化 AI Agent 的架构设计与生产级部署完全指南(2026)
编程
Hermes Agent 深度实战:自进化 AI Agent 的架构设计与生产级部署完全指南(2026)
2026-05-30 16:41:27 +0800 CST
view 596
深入解析 Nous Research 开源的 Hermes Agent:六层核心架构、GEPA 自进化闭环、三层持久记忆系统、200+ 模型支持,以及从 $5 VPS 到 Modal Serverless 的完整生产级部署实战指南。
AI Agent
Hermes Agent
Nous Research
自进化
GEPA
Skill系统
生产部署
Rolldown 深度拆解:当前端构建学会「原生速度」——Rust 重写 Rollup、Vite 8 统一工具链与 Oxc 编译器如何重写前端工程心智模型
编程
Rolldown 深度拆解:当前端构建学会「原生速度」——Rust 重写 Rollup、Vite 8 统一工具链与 Oxc 编译器如何重写前端工程心智模型
2026-07-16 04:43:22 +0800 CST
view 203
从工程师视角深度拆解 Rolldown:Rust 重写 Rollup、Vite 8 统一 dev/build 双引擎、Oxc 编译器协作、NAPI-RS 插件桥接与手写插件实战,配完整代码与性能对比。
Rolldown
Vite 8
Rust
前端构建
Oxc
打包器
VoidZero
Hertz 深度实战:当字节跳动把 Netpoll 塞进 HTTP 框架——从自研网络库到 4000万 QPS、从四层分层架构到生产级 Go 微服务完全指南(2026)
编程
Hertz 深度实战:当字节跳动把 Netpoll 塞进 HTTP 框架——从自研网络库到 4000万 QPS、从四层分层架构到生产级 Go 微服务完全指南(2026)
2026-06-21 02:23:45 +0800 CST
view 473
Hertz是字节跳动开源的高性能Go HTTP框架,基于自研Netpoll网络库,在内部支撑超1万微服务、4000万QPS。本文从架构原理到代码实战,全面解析Hertz的四层分层设计、中间件机制、性能优化技巧及生产最佳实践。
Hertz
Go语言
微服务
HTTP框架
字节跳动
Netpoll
性能优化
Browser-Use 深度拆解:当 AI 学会「看懂网页」——可访问性树、Playwright 内核与感知-决策-执行闭环如何重写浏览器自动化的心智模型
编程
Browser-Use 深度拆解:当 AI 学会「看懂网页」——可访问性树、Playwright 内核与感知-决策-执行闭环如何重写浏览器自动化的心智模型
2026-07-16 06:44:38 +0800 CST
view 543
从工程师视角深度拆解 Browser-Use:Playwright/CDP 内核、可访问性树感知、感知-决策-执行闭环、动作空间与系统提示词设计,并手写一个迷你 browser agent,配 Token 优化与自愈实战。
Browser-Use
AI浏览器自动化
Playwright
可访问性树
AI Agent
RPA
LLM
小米 MiMo UltraSpeed 深度解析:当 SWA 架构重塑 LLM 推理——从 O(n²) 困境到 1000 tokens/s 的极致跨越
编程
小米 MiMo UltraSpeed 深度解析:当 SWA 架构重塑 LLM 推理——从 O(n²) 困境到 1000 tokens/s 的极致跨越
2026-06-15 21:20:49 +0800 CST
view 308
深入解析小米MiMo UltraSpeed如何通过SWA架构在通用GPU上突破1000 tokens/s推理速度,从O(n²)困境到极致跨越的完整技术指南。
SWA
Sliding Window Attention
LLM推理
小米MiMo
推理优化
Transformer
PagedAttention
量化推理
端侧AI
Vite 8 深度拆解:当 Rust 打包器 Rolldown 成为默认引擎——统一工具链、10-30 倍提速与前端构建新范式
编程
Vite 8 深度拆解:当 Rust 打包器 Rolldown 成为默认引擎——统一工具链、10-30 倍提速与前端构建新范式
2026-07-17 00:18:32 +0800 CST
view 222
Vite 8 将 Rust 打包器 Rolldown 设为默认引擎,统一 dev/build 工具链,比 Rollup 快 10-30 倍。深度拆解架构演进、核心机制、迁移实战与性能调优。
Vite 8
Rolldown
前端构建
Rust
打包器
性能优化
VoidZero
前端工程化
2026年大模型推理框架横评:vLLM 0.5 vs TGI 2.0 vs TensorRT-LLM 1.8 vs DeepSpeed-MII 0.9
编程
2026年大模型推理框架横评:vLLM 0.5 vs TGI 2.0 vs TensorRT-LLM 1.8 vs DeepSpeed-MII 0.9
2026-07-10 17:44:16 +0800 CST
view 384
深度对比2026年四大主流LLM推理框架:vLLM 0.5、TGI 2.0、TensorRT-LLM 1.8、DeepSpeed-MII 0.9,涵盖PagedAttention、FP8量化、ZeRO-3、连续批处理等核心技术原理,配生产级代码示例与实测性能数据。
LLM
vLLM
TensorRT-LLM
TGI
DeepSpeed
推理优化
量化
AI部署
2026 LLM 推理框架深度拆解:当 vLLM 0.5 决定「让 PagedAttention 吞掉最后一块显存碎片」——从 PagedAttention 到 FlashAttention 3.0,四大推理框架如何用「算子融合 + 量化混合 + 动态批处理」重新定义大模型推理的终极形态
编程
2026 LLM 推理框架深度拆解:当 vLLM 0.5 决定「让 PagedAttention 吞掉最后一块显存碎片」——从 PagedAttention 到 FlashAttention 3.0,四大推理框架如何用「算子融合 + 量化混合 + 动态批处理」重新定义大模型推理的终极形态
2026-08-06 06:16:32 +0800 CST
view 110
深度拆解2026年四大主流LLM推理框架:vLLM 0.5 PagedAttention进化、TGI 2.0流式输出优化、TensorRT-LLM 1.8算子融合、DeepSpeed-MII 0.9自动优化,含完整架构分析、代码实战、性能基准测试与成本计算
LLM
vLLM
TensorRT-LLM
推理框架
PagedAttention
量化
GPU
H100
大模型
DeepSpeed
TGI
2026大模型推理框架年度横评:vLLM/TGI/TensorRT-LLM/DeepSpeed-MII 架构深度解析与生产级选型指南
编程
2026大模型推理框架年度横评:vLLM/TGI/TensorRT-LLM/DeepSpeed-MII 架构深度解析与生产级选型指南
2026-06-18 17:54:54 +0800 CST
view 819
深度横评2026年四大主流大模型推理框架,涵盖PagedAttention架构、ContinuousBatching、算子融合、FP8量化、NVMe卸载等核心技术,配实测数据与生产级选型指南
大模型
LLM
推理框架
vLLM
TensorRT-LLM
TGI
DeepSpeed
GPU推理
AI部署
NVIDIA
OpenClaw Skills 系统工程化深度解析:从 SKILL.md 动态注入到 MetaSkill DAG 的全链路架构
编程
OpenClaw Skills 系统工程化深度解析:从 SKILL.md 动态注入到 MetaSkill DAG 的全链路架构
2026-08-01 01:17:16 +0800 CST
view 153
深度解析OpenClaw Skills系统的核心架构:Tool/Skill/Plugin三角关系、SKILL.md动态注入机制、Token预算管理、Skill Workshop自举能力、MetaSkill DAG确定性编排,以及完整的代码实战示例。
OpenClaw
Skills系统
MetaSkill
SKILL.md
AI Agent
Tool
Plugin
架构设计
LLM 推理框架选型实战:vLLM、TensorRT-LLM、TGI、DeepSpeed-MII 深度对比与生产部署指南
编程
LLM 推理框架选型实战:vLLM、TensorRT-LLM、TGI、DeepSpeed-MII 深度对比与生产部署指南
2026-07-03 13:49:04 +0800 CST
view 431
深度对比 vLLM 0.5、TensorRT-LLM 1.8、TGI 2.0、DeepSpeed-MII 0.9 四大推理框架,从核心技术原理、性能数据、成本账本到生产部署实战,帮你做出正确的框架选型决策。
LLM
vLLM
TensorRT-LLM
TGI
DeepSpeed
推理优化
大模型部署
GPU优化
llmfit 深度拆解:一条命令算清你的机器能跑哪个大模型,Rust 硬件探测与适配度评分引擎全解析
编程
llmfit 深度拆解:一条命令算清你的机器能跑哪个大模型,Rust 硬件探测与适配度评分引擎全解析
2026-07-24 07:14:55 +0800 CST
view 179
深度拆解 GitHub Trending 破万星的 llmfit:Rust 硬件探测、权重与 KV cache 显存估算公式、内存带宽速度模型、MoE offload 运行模式,附 100 行 Python 复现 mini-llmfit 与工程集成实战。
llmfit
Rust
本地大模型
Ollama
llama.cpp
量化
KV cache
MoE
硬件选型
开源
LLM推理引擎终极对决:vLLM vs TensorRT-LLM深度解析与2026生产环境选型指南
编程
LLM推理引擎终极对决:vLLM vs TensorRT-LLM深度解析与2026生产环境选型指南
2026-04-20 13:45:31 +0800 CST
view 914
深度对比vLLM与TensorRT-LLM两大LLM推理框架,从PagedAttention到Kernel Fusion,从量化技术到生产部署,助你做出正确的技术选型决策
LLM
vLLM
TensorRT-LLM
推理优化
大模型部署
量化技术
AI工程
Skills 生态深度拆解:当 AI Agent 决定「用 Markdown 替代 JSON-RPC」——从 Karpathy 的防坑指南到万星 Skills 仓库,一个被 10 万+ 开发者采用的新范式如何重新定义 Agent 工程化的终极形态
编程
Skills 生态深度拆解:当 AI Agent 决定「用 Markdown 替代 JSON-RPC」——从 Karpathy 的防坑指南到万星 Skills 仓库,一个被 10 万+ 开发者采用的新范式如何重新定义 Agent 工程化的终极形态
2026-08-05 16:17:58 +0800 CST
view 190
深度拆解2026年AI Agent开发新范式Skills生态:Karpathy行为约束型Skills、Pocock工作流型Skills、SKILL.md架构设计、MCP vs Skills vs CLI三大范式对比,附完整生产级Skills构建实战与Token预算管理指南
Skills
AI Agent
MCP
Karpathy
Claude Code
LLM
Agent工程化
SKILL.md
提示工程
开源
LLM 推理服务引擎深度拆解:从 PagedAttention 到 PD 分离,把 GPU 榨干的七层优化栈
编程
LLM 推理服务引擎深度拆解:从 PagedAttention 到 PD 分离,把 GPU 榨干的七层优化栈
2026-07-30 21:49:19 +0800 CST
view 134
深度拆解 LLM 推理服务的七层优化栈:PagedAttention 分页显存与写时复制、连续批处理消灭队头阻塞、前缀缓存命中率实操、Chunked Prefill 与 PD 分离决策、KV Cache 分层复用的拉取/重算临界点、投机解码加速比数学与失效场景、量化与并行选型。附大量可运行代码、压测骨架、调优顺序与七个常见误区。
LLM推理
vLLM
SGLang
PagedAttention
PD分离
KV Cache
前缀缓存
投机解码
Chunked Prefill
性能优化
LLM推理引擎深度实战:从PagedAttention到生产级部署,万字长文吃透2026年最关键的AI基础设施
编程
LLM推理引擎深度实战:从PagedAttention到生产级部署,万字长文吃透2026年最关键的AI基础设施
2026-06-27 12:44:29 +0800 CST
view 372
2026年LLM推理引擎深度实战:从PagedAttention、连续批处理、量化技术到生产级K8s部署,万字长文覆盖vLLM、SGLang、TensorRT-LLM、TGI四大框架架构原理与实测对比
LLM推理
vLLM
PagedAttention
SGLang
推理优化
TensorRT-LLM
生产部署
KV Cache
量化
KV Cache 显存优化深度解析:从 PagedAttention 到 2026 年最新压缩技术演进
编程
KV Cache 显存优化深度解析:从 PagedAttention 到 2026 年最新压缩技术演进
2026-08-01 15:47:00 +0800 CST
view 145
从第一性原理深度剖析 KV Cache 显存困境,系统拆解 PagedAttention 核心原理,对比 vLLM/TensorRT-LLM/SGLang 三大推理框架技术路线,涵盖 FP8/INT4 量化、前缀缓存、StreamingLLM 等 2026 年最新压缩技术,含完整代码示例与生产调优指南。
KV Cache
PagedAttention
vLLM
TensorRT-LLM
SGLang
LLM推理
GPU优化
显存优化
量化
深度学习
Ollama 融资 6500 万美元背后:2026 年本地大模型运行时生态深度拆解——为什么「极简主义」赢了
编程
Ollama 融资 6500 万美元背后:2026 年本地大模型运行时生态深度拆解——为什么「极简主义」赢了
2026-07-16 11:45:03 +0800 CST
view 356
从 Ollama 6500 万美元融资事件切入,深度拆解 2026 年本地大模型运行时生态:Ollama、llama.cpp、LocalAI、LiteBox、vLLM 的架构设计、性能对比、API 设计、适用场景,配完整代码实战与生产部署踩坑指南。
Ollama
本地大模型
llama.cpp
LocalAI
LiteBox
本地LLM
推理引擎
量化
GGUF
MCP
Ollama 0.30 深度实战:当本地 LLM 推理有了双引擎——从 llama.cpp + MLX 双后端到 Gemma 4 QAT、从 Cohere2 MoE 到 ollama launch AI 编程助手生态的生产级完全指南(2026)
编程
Ollama 0.30 深度实战:当本地 LLM 推理有了双引擎——从 llama.cpp + MLX 双后端到 Gemma 4 QAT、从 Cohere2 MoE 到 ollama launch AI 编程助手生态的生产级完全指南(2026)
2026-06-21 08:54:17 +0800 CST
view 742
Ollama 0.30 深度解析:双引擎推理架构、Gemma 4 QAT、Cohere2 MoE、ollama launch 生态与生产级部署完全指南
Ollama
LLM
本地推理
AI编程
llama.cpp
MLX
Gemma
开源
Chrome DevTools MCP 深度解析:AI 编程助手「看见」浏览器的技术革命
编程
Chrome DevTools MCP 深度解析:AI 编程助手「看见」浏览器的技术革命
2026-06-30 01:16:44 +0800 CST
view 559
深度解析 Chrome DevTools MCP:AI 编程助手「看见」浏览器的技术革命,26+工具全景、代码实战、性能分析工程、安全实践
Chrome DevTools MCP
MCP
AI编程
浏览器自动化
Puppeteer
CDP
前端开发
TypeScript
OpenMontage 深度实战:当 AI 编程助手变成视频工作室——从 Agent-First 架构到零成本生产管线、从 52+ 工具到 500+ Agent Skills 的开源视频生产完全指南(2026)
编程
OpenMontage 深度实战:当 AI 编程助手变成视频工作室——从 Agent-First 架构到零成本生产管线、从 52+ 工具到 500+ Agent Skills 的开源视频生产完全指南(2026)
2026-06-22 16:54:28 +0800 CST
view 770
深入剖析 OpenMontage 开源 Agentic 视频生产系统的架构设计、工具体系、12条生产管线、零成本路径和跨平台兼容性
OpenMontage
AI视频
开源项目
Agent
视频制作
Remotion
HyperFrames
GraphQL.js v17 + Hive Router Demand Control:当 GraphQL 终于学会「算账」——从原生 TypeScript 重写到成本控制革命的完全指南(2026)
编程
GraphQL.js v17 + Hive Router Demand Control:当 GraphQL 终于学会「算账」——从原生 TypeScript 重写到成本控制革命的完全指南(2026)
2026-06-22 21:26:46 +0800 CST
view 261
2026年6月19日 GraphQL.js v17 发布,原生 TypeScript 重写、ESM 优先。同日 Hive Router 推出 Demand Control 功能,解决 GraphQL 查询成本逃逸问题。本文深度剖析技术原理、迁移指南与生产实践。
GraphQL
TypeScript
ESM
Hive Router
Demand Control
OpenAPI
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
45
46
47
48
49
...
102
下一页