程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
10天破3800星!Claude Code Skill一句话生成7种风格技术图表
编程
10天破3800星!Claude Code Skill一句话生成7种风格技术图表
2026-04-21 11:04:25 +0800 CST
view 777
fireworks-tech-graph:10天3800星的Claude Code Skill,用自然语言生成7种风格的技术图表,支持RAG、Mem0、多Agent等架构图,Mermaid画不出来的它能补位
Claude Code
Skill
AI画图
图表生成
Claude Code Skills
技术图
架构图
Mermaid
开源
GitHub
大模型推理引擎 2026 终极对决:vLLM vs SGLang,从 PagedAttention 到 RadixAttention,一次把 LLM 部署讲透(深度实战)
编程
大模型推理引擎 2026 终极对决:vLLM vs SGLang,从 PagedAttention 到 RadixAttention,一次把 LLM 部署讲透(深度实战)
2026-07-13 05:12:59 +0800 CST
view 262
深度对比 vLLM 与 SGLang 两大 LLM 推理引擎:从 KV Cache、PagedAttention、RadixAttention、连续批处理、分块预填充、推测解码、P/D 分离到量化部署,配可直接运行的生产级代码与基准测试。
vLLM
SGLang
LLM推理
大模型部署
PagedAttention
RadixAttention
vLLM 2026 深度解析:从 PagedAttention 到多节点分布式推理的全链路技术实战
编程
vLLM 2026 深度解析:从 PagedAttention 到多节点分布式推理的全链路技术实战
2026-05-03 15:13:07 +0800 CST
view 858
2026年深度解析vLLM核心架构,从PagedAttention进化到多节点分布式推理,涵盖SIG社区组织、v1架构重写、生产部署实战与性能优化全链路指南。
vLLM
PagedAttention
LLM
推理优化
分布式
Kubernetes
Python
Vite 8 + Rolldown 深度拆解:Rust 打包器如何终结「dev ≠ prod」,以及 Cloudflare 收购 VoidZero 之后的前端工具链版图
编程
Vite 8 + Rolldown 深度拆解:Rust 打包器如何终结「dev ≠ prod」,以及 Cloudflare 收购 VoidZero 之后的前端工具链版图
2026-07-30 21:15:54 +0800 CST
view 158
深度拆解 Vite 8 用 Rolldown 统一打包内核:双打包器架构的历史债、Rolldown+Oxc 四段流水线、Full Bundle Mode 对 no-bundle 的自我否定、Advanced Chunks 声明式分包、插件跨语言性能陷阱与 filter 下沉、可复现的基准测试脚本、六大迁移坑与检查清单,以及 Cloudflare 收购 VoidZero 后的工具链版图。
Vite,Rolldown,Oxc,VoidZero,Rust,前端工程化,打包器,Cloudflare,构建优化,Full Bundle Mode
samber/cc-skills-golang:给 AI 编程助手的 Go 技能包,让 AI 写 Go 少一点玄学
编程
samber/cc-skills-golang:给 AI 编程助手的 Go 技能包,让 AI 写 Go 少一点玄学
2026-06-13 08:23:38 +0800 CST
view 470
cc-skills-golang是一组面向AI编程助手的Go技能包,将Go工程判断、编码约定、排查方法整理成指令文档,让Claude Code/Codex/Cursor等AI在写Go时按统一口径工作,With Skill准确率98% vs 56%。
cc-skills-golang
Go
Claude Code
Codex
Cursor
AI编程
代码规范
Agent Skill
Code Review
NVIDIA garak + SkillSpector 深度实战:当 AI Agent 学会「安全自检」——从 LLM 漏洞扫描到技能市场治理的完全指南(2026)
编程
NVIDIA garak + SkillSpector 深度实战:当 AI Agent 学会「安全自检」——从 LLM 漏洞扫描到技能市场治理的完全指南(2026)
2026-06-13 12:20:18 +0800 CST
view 908
深入剖析 NVIDIA garak 和 SkillSpector 两款 AI 安全工具,解读 arXiv:2606.01494 论文关于三方扫描器低重合度的发现,提供 Agent Skills 安全治理的完整指南。
NVIDIA
garak
SkillSpector
AI安全
LLM
Agent
vLLM 深度解析:LLM 推理性能的终极引擎——从 PagedAttention 到生产级部署的完整技术内幕
编程
vLLM 深度解析:LLM 推理性能的终极引擎——从 PagedAttention 到生产级部署的完整技术内幕
2026-05-18 08:22:35 +0800 CST
view 883
全面解析 vLLM 推理引擎的核心架构,从 PagedAttention 原理到生产级部署实战,涵盖量化推理、多GPU并行、性能调优等完整技术栈
vLLM
LLM推理
PagedAttention
GPU优化
量化推理
深度解析
万字深度解析 Langfuse:当 LLM 应用遇见「全链路可观测性」——从 Tracing 架构到生产级 LLM Ops 的完整技术指南(2026)
编程
万字深度解析 Langfuse:当 LLM 应用遇见「全链路可观测性」——从 Tracing 架构到生产级 LLM Ops 的完整技术指南(2026)
2026-07-02 05:42:52 +0800 CST
view 437
2026年LLM应用可观测性完整指南:深度解析Langfuse架构、Tracing系统、ClickHouse存储、SDK集成、生产部署与性能优化,15+可运行代码示例
Langfuse
LLM
可观测性
Tracing
AI Engineering
LLM Ops
ClickHouse
Prompt Management
SKILL0深度解析:当技能不再是外挂——浙大与美团如何用技能内化重新定义小模型智能体
编程
SKILL0深度解析:当技能不再是外挂——浙大与美团如何用技能内化重新定义小模型智能体
2026-04-13 18:57:15 +0800 CST
view 1244
浙江大学联合美团和清华大学发布SKILL0论文,提出技能内化范式,让3B小模型通过上下文强化学习将AI技能内化到模型参数中,推理时零Token开销,在ALFWorld等基准上超越GPT-4o和Gemini。
SKILL0
技能内化
Skill Internalization
AI Agent
强化学习
浙大
美团
小模型
把大模型装进机房:Ollama 本地推理工程化实战——量化、并发、缓存与生产部署一次讲透(2026)
编程
把大模型装进机房:Ollama 本地推理工程化实战——量化、并发、缓存与生产部署一次讲透(2026)
2026-07-14 03:43:32 +0800 CST
view 268
深度拆解 Ollama 本地大模型推理工程化:从 GGUF 量化原理、MoE 专家调度、推理栈与 KV 缓存,到 Modelfile 定制、自量化、Python 客户端、FastAPI 生产服务、Docker 部署与性能调优,配完整可运行代码与 vLLM 对比。
Ollama
本地大模型
llama.cpp
GGUF量化
大模型部署
AI工程化
隐私计算
推理优化
Ollama 完全指南:本地大模型部署的事实标准——从原理到生产级 AI 应用开发(2026)
编程
Ollama 完全指南:本地大模型部署的事实标准——从原理到生产级 AI 应用开发(2026)
2026-06-05 04:13:34 +0800 CST
view 522
Ollama 本地大模型部署完全指南,从架构原理到生产级部署,涵盖 RAG 集成、性能优化、Docker/K8s 部署等核心内容。
Ollama
本地大模型
AI应用开发
Go语言
llama.cpp
万字深度解析 LMCache:当 LLM 推理遇见「KV 缓存革命」——从 Transformer 注意力机制到多层存储分级、从 vLLM/SGLang 集成到生产级 PD 拆分的完整技术指南(2026)
编程
万字深度解析 LMCache:当 LLM 推理遇见「KV 缓存革命」——从 Transformer 注意力机制到多层存储分级、从 vLLM/SGLang 集成到生产级 PD 拆分的完整技术指南(2026)
2026-07-02 08:42:52 +0800 CST
view 361
深度解析 LMCache 开源项目:LLM 推理 KV 缓存管理层,涵盖架构设计、多级存储、Multiprocess 模式、非前缀复用、PD 拆分等核心技术,15+ 可运行代码示例。
LMCache
LLM推理
KV缓存
vLLM
SGLang
AI推理优化
GPU优化
分布式缓存
Ollama 完全指南:本地大模型部署的事实标准——架构、实战与生产级部署(2026)
编程
Ollama 完全指南:本地大模型部署的事实标准——架构、实战与生产级部署(2026)
2026-06-05 04:13:52 +0800 CST
view 713
Ollama 本地大模型部署完全指南,从架构原理到生产级部署,涵盖 RAG 集成、性能优化、Docker/K8s 部署等核心内容。
Ollama
本地大模型
AI应用开发
Go语言
llama.cpp
从PagedAttention到Prefix Caching:2026年LLM推理KV Cache优化工程实践
编程
从PagedAttention到Prefix Caching:2026年LLM推理KV Cache优化工程实践
2026-07-07 16:15:25 +0800 CST
view 173
深入解析2026年大模型推理中的KV Cache优化技术栈:从PagedAttention虚拟分页管理、Prefix Caching缓存复用、Speculative Decoding并行验证,到INT8量化与Continuous Batching生产实践,配合代码示例与性能对比,助你系统性掌握LLM推理优化的核心要领。
LLM
KV Cache
PagedAttention
Prefix Caching
vLLM
推理优化
Speculative Decoding
Claude Opus 5 深度拆解:价格减半、性能翻倍,Anthropic 用「效能革命」重写 AI 编程规则
编程
Claude Opus 5 深度拆解:价格减半、性能翻倍,Anthropic 用「效能革命」重写 AI 编程规则
2026-07-31 15:20:39 +0800 CST
view 228
深度拆解 Claude Opus 5 发布:从 Frontier-Bench 性能翻倍到 ARC-AGI 3 三倍碾压,从定价策略重塑到 Claude Code 系统提示词削减 80% 的工程革命,以及 AI Coding 从 Tools 到 Skills 的范式跃迁。
Claude Opus 5
Anthropic
AI编程
LLM
AI Agent
Skills
Frontier-Bench
ARC-AGI
定价策略
Claude Code
KV Cache 深度拆解:当推理引擎决定把「注意力状态」做成一套存储系统——从 PagedAttention 分页、PD 分离成本方程到分层缓存盈亏平衡点的 Goodput 工程学
编程
KV Cache 深度拆解:当推理引擎决定把「注意力状态」做成一套存储系统——从 PagedAttention 分页、PD 分离成本方程到分层缓存盈亏平衡点的 Goodput 工程学
2026-08-09 02:16:55 +0800 CST
view 71
深度拆解 LLM 推理的 KV Cache 工程体系:为什么北极星指标必须从 Throughput 换成 Goodput、PagedAttention 的链式 hash 与前缀树实现、PD 分离的盈亏平衡方程(长输入短输出为何是负优化)、KVConnector 逐层流水传输、分层存储的盈亏平衡带宽公式与运行时决策函数、缓存感知路由,含可运行代码、调优清单与十条踩坑。
KV Cache
vLLM
PD分离
PagedAttention
LLM推理
Goodput
前缀缓存
RDMA
分层存储
性能优化
vLLM 2026 Q2 路线图深度解析:从 v1 架构重构到九大 SIG 技术演进——生产级 LLM 推理引擎的下一站
编程
vLLM 2026 Q2 路线图深度解析:从 v1 架构重构到九大 SIG 技术演进——生产级 LLM 推理引擎的下一站
2026-05-05 19:01:32 +0800 CST
view 1321
深度解析 vLLM 2026年第二季度技术路线图,涵盖 v1 架构核心设计、九大 SIG 技术演进方向、生产级部署实战经验。
vLLM
LLM推理
架构设计
性能优化
SGLang 深度实战:当 RadixAttention 重新定义 LLM 推理——从架构原理到生产部署的完整工程指南(2026)
编程
SGLang 深度实战:当 RadixAttention 重新定义 LLM 推理——从架构原理到生产部署的完整工程指南(2026)
2026-07-20 17:18:01 +0800 CST
view 306
深度解析SGLang推理框架核心技术:RadixAttention基数树KV缓存、连续批处理与CPU-GPU调度重叠、约束解码结构化输出、CVE-2026-5760安全漏洞修复、生产部署实战,以及与vLLM的完整对比选型指南。
SGLang
LLM
RadixAttention
PagedAttention
推理优化
Python
深度学习
向量检索
Agent
RAG
vLLM
CVE
Rust
高性能计算
io_uring 深度解剖:Linux 异步 I/O 的性能王者,为何又被 Google 全线封禁——从 SQE/CQE 环形队列到零拷贝、SQPOLL 与安全攻防
编程
io_uring 深度解剖:Linux 异步 I/O 的性能王者,为何又被 Google 全线封禁——从 SQE/CQE 环形队列到零拷贝、SQPOLL 与安全攻防
2026-07-26 04:13:40 +0800 CST
view 195
深度拆解 Linux io_uring:SQ/CQ 环形队列内存模型、SQE/CQE 生命周期、liburing 文件读写与 echo 服务器实战、SQPOLL/注册缓冲区/链式操作/multishot/零拷贝发送进阶特性,并剖析为何性能炸裂却被 Google 在 ChromeOS/Android/GKE 全线封禁,附内核 6.6 安全加固与生产决策清单。
io_uring
Linux内核
异步IO
高性能
SQPOLL
零拷贝
epoll
网络编程
系统编程
安全
Ollama 深度拆解:从傻瓜式本地大模型部署到底层 llama.cpp 调度器的工程全貌(2026·完整版)
编程
Ollama 深度拆解:从傻瓜式本地大模型部署到底层 llama.cpp 调度器的工程全貌(2026·完整版)
2026-07-20 18:18:40 +0800 CST
view 363
深度拆解 Ollama 工程架构:Go 服务层封装 llama.cpp、CGO 内存边界、GGUF 量化格式、Modelfile DSL、OpenAI 兼容层、Metal GPU 加速与生产部署实战,配完整 Go/Python/Shell 代码示例。
Ollama
本地大模型
llama.cpp
GGUF
Go
CGO
量化
Apple Silicon
万字深度解析 LMCache:当 KV Cache 遇见分布式存储革命——从常数级显存到千亿Token并发的完整技术指南(2026)
编程
万字深度解析 LMCache:当 KV Cache 遇见分布式存储革命——从常数级显存到千亿Token并发的完整技术指南(2026)
2026-07-02 13:46:08 +0800 CST
view 426
深度解析 LMCache 开源 KV Cache 管理层项目:从三层存储架构、多后端支持、Disaggregated Prefill、CacheBlend、Segmented Prefill、P2P 共享到 Kubernetes 生产级部署的完整技术指南,含性能基准测试与代码实战
LMCache
KV Cache
LLM
vLLM
分布式
RDMA
Kubernetes
推理优化
Redis
NIXL
AirLLM深度拆解:用分层流式推理打破显存壁垒——从4GB显卡跑通70B大模型的工程极限到MoE时代的新坐标
编程
AirLLM深度拆解:用分层流式推理打破显存壁垒——从4GB显卡跑通70B大模型的工程极限到MoE时代的新坐标
2026-08-09 08:42:54 +0800 CST
view 97
深度拆解AirLLM:用分层流式推理打破显存壁垒,从4GB显卡跑通70B大模型的工程原理到MoE时代的新坐标,配完整代码示例与实战指南。
AirLLM
LLM推理
显存优化
MoE
Transformer
Python
AI部署
猛涨25K Star!LLMFit:一键检测你的电脑能跑哪些大模型
案例
猛涨25K Star!LLMFit:一键检测你的电脑能跑哪些大模型
2026-05-06 07:35:19 +0800 CST
view 711
25K+Star的LLMFit一键检测你的电脑能跑哪些大模型,Rust编写支持NVIDIA/AMD/Intel/Apple Silicon,智能量化推荐Q8到Q2,四维评分系统,TUI+CLI双模式
LLM部署
硬件检测
量化推荐
Rust
终端工具
本地部署
Ollama
llama.cpp 架构深度拆解:从 GGML 到 GGUF、量化内核到跨平台推理栈,一文吃透本地 LLM 推理工程化
编程
llama.cpp 架构深度拆解:从 GGML 到 GGUF、量化内核到跨平台推理栈,一文吃透本地 LLM 推理工程化
2026-08-01 08:18:35 +0800 CST
view 206
深度拆解 llama.cpp 全栈架构:从 GGML 到 GGUF 格式演进、K-Quant 量化内核原理、ggml 张量计算图层、libllama 推理逻辑层、10+ 硬件后端调度,以及生产调优实战与踩坑清单。
llama.cpp
GGUF
GGML
量化
本地LLM
CPU推理
GPU加速
跨平台
K-Quant
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
5
6
7
8
9
...
32
下一页