程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
AI 生成界面为什么总是样板间? taste-skill 用 SKILL.md 给 AI 装上设计品味
编程
AI 生成界面为什么总是样板间? taste-skill 用 SKILL.md 给 AI 装上设计品味
2026-07-08 12:50:03 +0800 CST
view 411
taste-skill 通过将设计品味封装为可组合的 SKILL.md 技能集,解决 AI 生成界面千篇一律的核心问题。本文深入解析其三段旋钮系统、设计技能体系与工程实践。
AI编程
taste-skill
前端设计
SKILL.md
Claude Code
设计系统
AI Agent
vLLM 深度实战:当 LLM 推理遇上 PagedAttention——从 KV 缓存管理到生产级高并发服务的完全指南(2026)
编程
vLLM 深度实战:当 LLM 推理遇上 PagedAttention——从 KV 缓存管理到生产级高并发服务的完全指南(2026)
2026-06-08 22:52:24 +0800 CST
view 742
深度解析vLLM推理框架的核心原理、PagedAttention创新机制、分布式推理架构,以及生产环境部署的最佳实践。
vLLM
PagedAttention
LLM推理
KV缓存
分布式推理
2026 年 vLLM 推理服务实战:PagedAttention 原理、分布式部署与性能调优完全指南
编程
2026 年 vLLM 推理服务实战:PagedAttention 原理、分布式部署与性能调优完全指南
2026-06-08 22:53:03 +0800 CST
view 456
深度解析vLLM推理框架的核心原理、PagedAttention创新机制、分布式推理架构,以及生产环境部署的最佳实践。
vLLM
PagedAttention
LLM推理
KV缓存
分布式推理
大模型推理引擎实战:从 PagedAttention、Continuous Batching 到投机解码与量化部署,把 GPU 利用率榨到极限(vLLM/SGLang 2026 完全指南)
编程
大模型推理引擎实战:从 PagedAttention、Continuous Batching 到投机解码与量化部署,把 GPU 利用率榨到极限(vLLM/SGLang 2026 完全指南)
2026-07-09 09:17:24 +0800 CST
view 478
深入剖析 2026 年大模型推理引擎核心技术:PagedAttention、Continuous Batching、Chunked Prefill、RadixAttention 前缀缓存、投机解码与 AWQ/GPTQ/FP8 量化,结合 vLLM 与 SGLang 部署实战,把 GPU 利用率榨到极限的生产级完全指南。
LLM推理引擎
vLLM
SGLang
推理优化
量化部署
投机解码
GPU利用率
KV Cache
PagedAttention
vLLM 推理引擎源码级拆解:PagedAttention 显存虚拟化、Continuous Batching 调度与量化落地全指南
编程
vLLM 推理引擎源码级拆解:PagedAttention 显存虚拟化、Continuous Batching 调度与量化落地全指南
2026-07-27 03:44:38 +0800 CST
view 175
从显存字节到 CUDA kernel 源码级拆解 vLLM:PagedAttention 分页显存管理、Continuous Batching 连续批处理调度、Prefix Caching 前缀缓存与量化/投机解码实战,附完整代码与生产调参踩坑清单。
vLLM
PagedAttention
大模型推理
KV Cache
显存优化
连续批处理
量化
LLM Serving
LLM 推理优化全景实战:从 PagedAttention 到投机解码——让大模型推理成本下降 70% 的技术革命(2026)
编程
LLM 推理优化全景实战:从 PagedAttention 到投机解码——让大模型推理成本下降 70% 的技术革命(2026)
2026-05-30 15:42:55 +0800 CST
view 597
深度解析 LLM 推理优化的核心技术:PagedAttention 内存管理革命、投机解码加速策略、INT4/FP8 量化技术、MoE 架构优化,从架构原理到代码实战,让大模型推理成本下降 70%。
LLM
推理优化
vLLM
PagedAttention
投机解码
量化
MoE
vLLM V1 深度拆解:当一个 LLM 推理引擎决定「从零重写」——PagedAttention、分离式推理与 LMCache 如何重新定义大模型服务的性能天花板
编程
vLLM V1 深度拆解:当一个 LLM 推理引擎决定「从零重写」——PagedAttention、分离式推理与 LMCache 如何重新定义大模型服务的性能天花板
2026-08-03 09:43:58 +0800 CST
view 148
深度拆解vLLM V1引擎四大核心架构:PagedAttention V2融合块表与前缀树缓存、分离式推理Prefill/Decode架构、KV Connector标准化接口、LMCache三层KV Cache管理,附完整部署配置与性能基准测试
vLLM
PagedAttention
LMCache
分离式推理
大模型推理
KV Cache
推理引擎
LLM Serving
GPU优化
开源
vLLM 0.5 深度解析:PagedAttention 架构原理与生产级 LLM 推理优化实战
编程
vLLM 0.5 深度解析:PagedAttention 架构原理与生产级 LLM 推理优化实战
2026-07-04 18:15:46 +0800 CST
view 400
深度解析 vLLM 0.5 的 PagedAttention 架构原理,涵盖 KV Cache 分页管理、MoE 优化、分布式推理、量化技术,并通过代码实战和性能对比,帮助开发者掌握生产级 LLM 推理最佳实践。
vLLM
PagedAttention
LLM推理
CUDA
KV Cache
深度学习
AI基础设施
Python
生产部署
性能优化
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
编程
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
2026-07-28 11:48:24 +0800 CST
view 125
深度拆解Google ICLR 2026论文TurboQuant及其工程增强TurboQuant+:极坐标量化+QJL残差编码实现2bit KV Cache压缩,配合llama.cpp跨后端(CUDA/ROCm/Metal/Vulkan)生产级落地,附完整代码实战与选型建议
TurboQuant
KV Cache
LLM推理
llama.cpp
量化
显存优化
Walsh-Hadamard
Vulkan
CUDA
ROCm
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
编程
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
2026-07-28 11:50:04 +0800 CST
view 160
深度拆解Google ICLR 2026论文TurboQuant及其工程增强TurboQuant+:极坐标量化+QJL残差编码实现2bit KV Cache压缩,配合llama.cpp跨后端(CUDA/ROCm/Metal/Vulkan)生产级落地,附完整代码实战与选型建议
TurboQuant
KV Cache
LLM推理
llama.cpp
量化
显存优化
Walsh-Hadamard
Vulkan
CUDA
ROCm
Khazix Skills 深度解析:当「数字生命卡兹克」把压箱底的 AI Skills 一字不改开源出来
编程
Khazix Skills 深度解析:当「数字生命卡兹克」把压箱底的 AI Skills 一字不改开源出来
2026-04-10 00:44:17 +0800 CST
view 2335
数字生命卡兹克开源的 AI Skills 合集,支持 Claude Code、OpenClaw、Codex 三大平台,包含写作、代码、研究等核心 Skill,实用主义风格,真实生产环境验证。
AI Skills
Khazix
数字生命卡兹克
Agent Skills
开源
TurboQuant+深度拆解:极坐标量化+QJL残差编码——2bit KV Cache压缩重构 LLM 推理经济学
编程
TurboQuant+深度拆解:极坐标量化+QJL残差编码——2bit KV Cache压缩重构 LLM 推理经济学
2026-07-28 11:52:16 +0800 CST
view 203
深度拆解Google ICLR 2026论文TurboQuant及其工程增强TurboQuant+:极坐标量化+QJL残差编码实现2bit KV Cache压缩,配合llama.cpp跨后端(CUDA/ROCm/Metal/Vulkan)生产级落地,附完整代码实战与选型建议
TurboQuant
KV Cache
LLM推理
llama.cpp
量化
显存优化
Walsh-Hadamard
Vulkan
CUDA
ROCm
Spring AI 2.0 深度拆解:当 Java 企业级框架学会「AI 原生思维」——从 ChatClient 流式 API、MCP 工具调用到 Advisors 可组合架构的工程全貌
编程
Spring AI 2.0 深度拆解:当 Java 企业级框架学会「AI 原生思维」——从 ChatClient 流式 API、MCP 工具调用到 Advisors 可组合架构的工程全貌
2026-07-17 10:43:43 +0800 CST
view 359
深度拆解 Spring AI 2.0 GA:ChatClient Fluent API、Advisors 可组合拦截器链、@Tool 声明式工具调用、MCP 协议原生支持、RAG ETL Pipeline、Micrometer 可观测性,配完整生产级代码实战。2026年Java开发者AI集成的终极指南。
Spring AI
Java
AI
Spring Boot
LLM
MCP
RAG
AI Agent
Tool Calling
Spring Framework
Spring AI 2.0 深度拆解:当 Java 企业级框架学会「AI 原生思维」——ChatClient、MCP 工具调用与 Advisors 可组合架构
编程
Spring AI 2.0 深度拆解:当 Java 企业级框架学会「AI 原生思维」——ChatClient、MCP 工具调用与 Advisors 可组合架构
2026-07-17 10:44:29 +0800 CST
view 279
深度拆解 Spring AI 2.0 GA:ChatClient Fluent API、Advisors 可组合拦截器链、@Tool 声明式工具调用、MCP 协议支持、RAG ETL Pipeline,配完整生产级代码实战。
Spring AI
Java
AI
Spring Boot
LLM
MCP
RAG
AI Agent
Tool Calling
万字深度解析 Andrej Karpathy Skills:当 AI 编程遇见行为约束——从 CLAUDE.md 四原则到生产级 AI 编码工作流的工程化实践(2026)
编程
万字深度解析 Andrej Karpathy Skills:当 AI 编程遇见行为约束——从 CLAUDE.md 四原则到生产级 AI 编码工作流的工程化实践(2026)
2026-07-01 05:13:58 +0800 CST
view 332
2026年Andrej Karpathy Skills在GitHub狂揽11.7万Star。深度解析CLAUDE.md四核心原则:先思考再编码、简洁性优先、精准修改、目标驱动执行,以及生产级AI编程工作流工程化实践。
Andrej Karpathy Skills
CLAUDE.md
AI编程
Vibe Coding
LLM
行为约束
AI Agent
Cursor
SkillOpt 深度拆解:当微软决定「像训练神经网络一样训练 Skill」——从轨迹驱动优化到文本空间搜索,一个 3.1K Star 的框架如何用「不改权重只改文档」重新定义 Agent 技能优化的终极形态
编程
SkillOpt 深度拆解:当微软决定「像训练神经网络一样训练 Skill」——从轨迹驱动优化到文本空间搜索,一个 3.1K Star 的框架如何用「不改权重只改文档」重新定义 Agent 技能优化的终极形态
2026-08-05 21:49:06 +0800 CST
view 108
深度拆解微软开源的SkillOpt框架:用训练神经网络的方法论优化Agent技能文档,不改权重只改Markdown,52个评测组合全部最优,准确率提升20%+
SkillOpt
微软
AI Agent
技能优化
LLM
Prompt工程
强化学习
轨迹优化
文本空间搜索
开源
samber/cc-skills-golang:给 AI 编程助手的 Go 技能包,让 AI 写 Go 少一点玄学
编程
samber/cc-skills-golang:给 AI 编程助手的 Go 技能包,让 AI 写 Go 少一点玄学
2026-06-13 08:23:38 +0800 CST
view 463
cc-skills-golang是一组面向AI编程助手的Go技能包,将Go工程判断、编码约定、排查方法整理成指令文档,让Claude Code/Codex/Cursor等AI在写Go时按统一口径工作,With Skill准确率98% vs 56%。
cc-skills-golang
Go
Claude Code
Codex
Cursor
AI编程
代码规范
Agent Skill
Code Review
NVIDIA garak + SkillSpector 深度实战:当 AI Agent 学会「安全自检」——从 LLM 漏洞扫描到技能市场治理的完全指南(2026)
编程
NVIDIA garak + SkillSpector 深度实战:当 AI Agent 学会「安全自检」——从 LLM 漏洞扫描到技能市场治理的完全指南(2026)
2026-06-13 12:20:18 +0800 CST
view 895
深入剖析 NVIDIA garak 和 SkillSpector 两款 AI 安全工具,解读 arXiv:2606.01494 论文关于三方扫描器低重合度的发现,提供 Agent Skills 安全治理的完整指南。
NVIDIA
garak
SkillSpector
AI安全
LLM
Agent
万字深度解析 Langfuse:当 LLM 应用遇见「全链路可观测性」——从 Tracing 架构到生产级 LLM Ops 的完整技术指南(2026)
编程
万字深度解析 Langfuse:当 LLM 应用遇见「全链路可观测性」——从 Tracing 架构到生产级 LLM Ops 的完整技术指南(2026)
2026-07-02 05:42:52 +0800 CST
view 431
2026年LLM应用可观测性完整指南:深度解析Langfuse架构、Tracing系统、ClickHouse存储、SDK集成、生产部署与性能优化,15+可运行代码示例
Langfuse
LLM
可观测性
Tracing
AI Engineering
LLM Ops
ClickHouse
Prompt Management
llama.cpp 架构深度拆解:从 GGML 到 GGUF、量化内核到跨平台推理栈,一文吃透本地 LLM 推理工程化
编程
llama.cpp 架构深度拆解:从 GGML 到 GGUF、量化内核到跨平台推理栈,一文吃透本地 LLM 推理工程化
2026-08-01 08:18:35 +0800 CST
view 198
深度拆解 llama.cpp 全栈架构:从 GGML 到 GGUF 格式演进、K-Quant 量化内核原理、ggml 张量计算图层、libllama 推理逻辑层、10+ 硬件后端调度,以及生产调优实战与踩坑清单。
llama.cpp
GGUF
GGML
量化
本地LLM
CPU推理
GPU加速
跨平台
K-Quant
Ollama v0.20 Tool Calling 深度解析:让本地大模型真正「动起手来」——从协议原理到生产级多工具 Agent 系统实战
编程
Ollama v0.20 Tool Calling 深度解析:让本地大模型真正「动起手来」——从协议原理到生产级多工具 Agent 系统实战
2026-07-03 08:43:53 +0800 CST
view 327
深度解析 Ollama v0.20 的 Tool Calling 能力:从 JSON Schema 协议原理、HTTP API 调用循环,到生产级多工具 Agent 系统的完整实战(天气查询/数据库查询/Web搜索),配套 LangChain4j 集成方案与安全防护策略。
Ollama
AI Agent
Tool Calling
本地大模型
LangChain4j
生产级实战
Ollama v0.20 Tool Calling 深度解析:本地 AI Agent 的最后一公里——JSON Schema 协议 × 生产级多工具实战 × 安全防护全指南
编程
Ollama v0.20 Tool Calling 深度解析:本地 AI Agent 的最后一公里——JSON Schema 协议 × 生产级多工具实战 × 安全防护全指南
2026-07-03 08:44:52 +0800 CST
view 264
深度解析 Ollama v0.20 的 Tool Calling 能力,从 JSON Schema 协议原理到生产级多工具 Agent 实战,含安全防护与性能基准测试。
Ollama
AI Agent
Tool Calling
本地大模型
LangChain4j
Ollama Tool Calling × 本地 AI Agent:JSON Schema 协议 × 生产级多工具系统 × 安全防护实战
编程
Ollama Tool Calling × 本地 AI Agent:JSON Schema 协议 × 生产级多工具系统 × 安全防护实战
2026-07-03 08:45:53 +0800 CST
view 297
深度解析 Ollama v0.20 Tool Calling,从协议原理到生产级多工具 Agent 实战,含天气查询、数据库查询、Web搜索三大实战案例与安全防护策略。
Ollama
AI Agent
Tool Calling
本地大模型
【深度长文】Ollama v0.20 工具调用实战:本地大模型 + JSON Schema + 生产级 Agent 系统搭建指南(2026)
编程
【深度长文】Ollama v0.20 工具调用实战:本地大模型 + JSON Schema + 生产级 Agent 系统搭建指南(2026)
2026-07-03 08:47:18 +0800 CST
view 295
深度长文:Ollama v0.20 Tool Calling 从协议原理到生产级多工具 Agent 实战,含天气查询、数据库操作、Web搜索三大案例与安全防护策略(2026)。
Ollama
AI Agent
Tool Calling
本地大模型
生产级
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
29
30
31
32
33
...
99
下一页