程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
Headroom 深度实战:当 AI Agent 学会「省着吃」——从 Token 暴降 60-95% 到可逆上下文压缩的生产级完全指南(2026)
编程
Headroom 深度实战:当 AI Agent 学会「省着吃」——从 Token 暴降 60-95% 到可逆上下文压缩的生产级完全指南(2026)
2026-06-09 14:16:12 +0800 CST
view 539
Headroom 是一个开源的 AI Agent 上下文压缩中间层,通过六大专用算法实现 60-95% 的 Token 节省,CCR 可逆存储确保信息零丢失,跨 Agent 记忆打破协作孤岛。
AI Agent
Headroom
上下文压缩
Token优化
LLM
开源项目
口袋里的 AI 超级大脑:Operit AI 全链路架构深度拆解,从工具调用到移动端自动化的范式革命
编程
口袋里的 AI 超级大脑:Operit AI 全链路架构深度拆解,从工具调用到移动端自动化的范式革命
2026-08-11 12:29:29 +0800 CST
view 90
深度拆解 Operit AI 的全链路架构:Kotlin协程与Jetpack Compose UI层、MNN与llama.cpp本地推理引擎、PRoot嵌入Ubuntu 24环境、基于无障碍服务的UI自动化、MCP协议与40+工具生态。含15条生产踩坑清单与完整部署指南。
AI Agent
Android
Kotlin
Jetpack Compose
MNN
llama.cpp
MCP
自动化
工具调用
移动开发
Headroom 深度实战:AI Agent 的上下文压缩革命——60%~95% Token 节省背后的架构原理与生产级实战
编程
Headroom 深度实战:AI Agent 的上下文压缩革命——60%~95% Token 节省背后的架构原理与生产级实战
2026-06-28 10:14:20 +0800 CST
view 597
深度解析 GitHub Trending 项目 Headroom:AI Agent 上下文压缩引擎的架构原理、6 种算法、60-95% Token 节省实战,涵盖 Rust 高性能核心、CCR 可逆压缩、MCP 服务器与生产级部署指南。
Headroom
AI Agent
上下文压缩
Token优化
Claude Code
Cursor
AI编程
Rust
Python
MCP
RAG
LLMOps
Rust在前端工具链的崛起:2026年生态全景深度实战
编程
Rust在前端工具链的崛起:2026年生态全景深度实战
2026-05-22 00:49:39 +0800 CST
view 676
从Rolldown到Oxc,从Rspack到Turbopack,Rust编写的前端工具正在全面超越JavaScript方案。本文深度解析Rust工具生态。
Rust
前端工具链
性能优化
Rspack
Turbopack
Rolldown
Oxc
Headroom 深度实战:当上下文窗口成为AI Agent的成本黑洞——从Token爆炸到60-95%压缩率的生产级完全指南(2026)
编程
Headroom 深度实战:当上下文窗口成为AI Agent的成本黑洞——从Token爆炸到60-95%压缩率的生产级完全指南(2026)
2026-06-15 13:19:56 +0800 CST
view 660
深度解析开源项目Headroom:AI Agent的上下文压缩中间层,60-95% Token节省,CCR可逆压缩机制,六大压缩引擎架构分析,生产级部署指南。
AI Agent
Token压缩
上下文管理
LLM
Claude Code
Cursor
Headroom
Python
开源工具
工程实践
Rust 正在吞噬前端工具链:2026 年生态全景与深度架构解析
编程
Rust 正在吞噬前端工具链:2026 年生态全景与深度架构解析
2026-04-18 00:16:25 +0800 CST
view 918
深度解析 2026 年 Rust 在前端工具链的完整生态,涵盖 Rspack、Rolldown、Oxc、Biome 等核心工具,从架构原理到实战代码,从性能数据到迁移策略,10000字长文覆盖一切。
Rust
前端工具链
构建工具
Rspack
Rolldown
Oxc
Biome
编程
Microsoft Markitdown 深度解析:AI工作流中的文档转换基础设施——从架构原理到生产级部署的完整技术指南(2026)
2026-07-04 14:12:12 +0800 CST
view 255
深度解析Microsoft Markitdown:Python文档转换工具,支持PDF/Word/Excel/PPT/图片/音频转Markdown,为LLM/AI工作流量身定制。涵盖架构原理、Python API实战、RAG集成、性能优化、生产部署最佳实践。
Markitdown
Microsoft
文档转换
RAG
AI工作流
Python
LLM
Markdown
向量数据库
Pullfrog 深度实战:Zod 作者打造的 AI Code Review 革命——GitHub Actions 原生 AI Agent 完全指南(2026)
编程
Pullfrog 深度实战:Zod 作者打造的 AI Code Review 革命——GitHub Actions 原生 AI Agent 完全指南(2026)
2026-05-31 13:21:18 +0800 CST
view 531
Zod 作者 Colin McDonnell 打造的 Pullfrog:开源 AI Code Review 工具,运行在 GitHub Actions 里,BYOK 模式,数据不出你的仓库。深度解析架构、部署实战与团队落地案例。
AI Code Review
GitHub Actions
Pullfrog
Zod
AI Agent
NVIDIA Nemotron-Cascade-2 深度实战:30B MoE 模型如何拿下 IMO/IOI 双料金牌——从稀疏专家架构到生产级部署的完全指南(2026)
编程
NVIDIA Nemotron-Cascade-2 深度实战:30B MoE 模型如何拿下 IMO/IOI 双料金牌——从稀疏专家架构到生产级部署的完全指南(2026)
2026-06-01 12:56:48 +0800 CST
view 553
深度解析NVIDIA Nemotron-Cascade-2-30B-A3B模型:30B总参、3B激活参数的MoE架构,如何拿下IMO/IOI双料金牌,以及如何从HuggingFace加载到vLLM生产部署。
NVIDIA
Nemotron
MoE
AI模型
GPU
深度学习
推理引擎
vLLM
Headroom 深度实战:让 AI Agent 的 Token 消耗暴降 60-95% 的上下文压缩层完全解析
编程
Headroom 深度实战:让 AI Agent 的 Token 消耗暴降 60-95% 的上下文压缩层完全解析
2026-06-29 05:12:24 +0800 CST
view 670
Headroom v0.5.18 完整实战:六层压缩管道深度拆解、SmartCrusher/CodeCompressor/Kompress-base算法原理、四种集成方式代码实战、性能基准验证、headroom learn跨Agent记忆共享。让Token消耗暴降60-95%。
AI Agent
Token压缩
Headroom
上下文管理
LLM优化
编程工具
Python
TypeScript
pi-mono 深度拆解:libGDX 作者的 4 万 Star AI Agent 全家桶,不到 1000 token 的 System Prompt 凭什么成为 OpenClaw 的引擎
编程
pi-mono 深度拆解:libGDX 作者的 4 万 Star AI Agent 全家桶,不到 1000 token 的 System Prompt 凭什么成为 OpenClaw 的引擎
2026-07-28 05:13:25 +0800 CST
view 284
深度拆解 libGDX 作者 badlogic 的 4 万 Star 项目 pi-mono:7 包 Monorepo 架构、pi-ai 统一 LLM 层、不到 1000 token 的极简 System Prompt 与学徒哲学,附自定义工具实战与 Claude Code/Codex 对比选型。
pi-mono
AI Agent
Coding Agent
TypeScript
LLM
开源
OpenClaw
开发者工具
vLLM
终端工具
LMCache 实战:大模型推理的 KV Cache 终极优化方案
编程
LMCache 实战:大模型推理的 KV Cache 终极优化方案
2026-07-23 08:44:51 +0800 CST
view 197
LMCache 实战指南:通过智能 KV Cache 管理,实现 LLM 推理吞吐量最高 10 倍提升,显存占用降低 40%-60%。包含 vLLM/TGI 集成、分布式缓存、性能调优最佳实践。
LMCache
KV Cache
LLM推理优化
vLLM
RAG性能优化
Spring AI 2.0 深度拆解:当 Java 企业级框架学会「AI 原生思维」——从 ChatClient 流式 API、MCP 工具调用到 Advisors 可组合架构的工程全貌
编程
Spring AI 2.0 深度拆解:当 Java 企业级框架学会「AI 原生思维」——从 ChatClient 流式 API、MCP 工具调用到 Advisors 可组合架构的工程全貌
2026-07-17 10:43:43 +0800 CST
view 373
深度拆解 Spring AI 2.0 GA:ChatClient Fluent API、Advisors 可组合拦截器链、@Tool 声明式工具调用、MCP 协议原生支持、RAG ETL Pipeline、Micrometer 可观测性,配完整生产级代码实战。2026年Java开发者AI集成的终极指南。
Spring AI
Java
AI
Spring Boot
LLM
MCP
RAG
AI Agent
Tool Calling
Spring Framework
Spring AI 2.0 深度拆解:当 Java 企业级框架学会「AI 原生思维」——ChatClient、MCP 工具调用与 Advisors 可组合架构
编程
Spring AI 2.0 深度拆解:当 Java 企业级框架学会「AI 原生思维」——ChatClient、MCP 工具调用与 Advisors 可组合架构
2026-07-17 10:44:29 +0800 CST
view 283
深度拆解 Spring AI 2.0 GA:ChatClient Fluent API、Advisors 可组合拦截器链、@Tool 声明式工具调用、MCP 协议支持、RAG ETL Pipeline,配完整生产级代码实战。
Spring AI
Java
AI
Spring Boot
LLM
MCP
RAG
AI Agent
Tool Calling
shimmy v2.3.0 深度解析:纯 Rust WebGPU 推理引擎如何让 GGUF 模型跑满你的每一块 GPU
编程
shimmy v2.3.0 深度解析:纯 Rust WebGPU 推理引擎如何让 GGUF 模型跑满你的每一块 GPU
2026-07-23 11:45:35 +0800 CST
view 205
深度解析纯 Rust WebGPU 推理引擎 shimmy v2.3.0:GGUF 原生加载、OpenAI API 兼容、KV Cache 量化、Flash Attention 等效实现,配 Tauri 桌面应用集成实战与性能基准测试。
shimmy
WebGPU
Rust
GGUF
LLM
llama.cpp
推理引擎
WebAssembly
llama.cpp 深度实战:从 GGUF 量化到 CUDA 内核优化——纯 C/C++ 如何在 CPU/GPU 上榨出 LLM 推理的极限性能
编程
llama.cpp 深度实战:从 GGUF 量化到 CUDA 内核优化——纯 C/C++ 如何在 CPU/GPU 上榨出 LLM 推理的极限性能
2026-05-23 17:18:22 +0800 CST
view 2199
2026年深度拆解 llama.cpp 的核心架构:GGUF 格式原理、20+量化方法对比、KV Cache 优化、多硬件后端性能实测,与 Ollama/vLLM 完整横评。
llama.cpp
GGUF
量化
CUDA
Metal
LLM推理
C++
本地部署
性能优化
GGML
从140GB到4GB:AirLLM无量化层间推理原理深度剖析与生产级部署实战(2026)
编程
从140GB到4GB:AirLLM无量化层间推理原理深度剖析与生产级部署实战(2026)
2026-06-22 19:28:19 +0800 CST
view 482
深入解析 AirLLM 的无量化层间 Offloading 技术原理,探讨如何通过 CPU-GPU 混合推理在 4GB 显存上运行 70B 大模型,附完整代码实战与生产部署指南。
LLM推理
GPU优化
CPU Offload
层间调度
AirLLM
PyTorch
Nushell 0.111 深度解析:用 Rust 重写 Shell,让命令行终于有了数据类型
编程
Nushell 0.111 深度解析:用 Rust 重写 Shell,让命令行终于有了数据类型
2026-05-12 01:44:53 +0800 CST
view 724
深度解析Nushell 0.111核心架构:结构化数据管道替代POSIX字符串流、IR优化器实现管道融合与谓词下推带来3-10倍性能提升、栈式虚拟机执行器保证类型安全与即时错误反馈,附DevOps实战、插件开发与渐进迁移指南
Nushell,Shell,Rust,命令行,结构化数据,数据管道,终端工具,DevOps,CLI,编程工具
把大模型装进机房:Ollama 本地推理工程化实战——量化、并发、缓存与生产部署一次讲透(2026)
编程
把大模型装进机房:Ollama 本地推理工程化实战——量化、并发、缓存与生产部署一次讲透(2026)
2026-07-14 03:43:32 +0800 CST
view 276
深度拆解 Ollama 本地大模型推理工程化:从 GGUF 量化原理、MoE 专家调度、推理栈与 KV 缓存,到 Modelfile 定制、自量化、Python 客户端、FastAPI 生产服务、Docker 部署与性能调优,配完整可运行代码与 vLLM 对比。
Ollama
本地大模型
llama.cpp
GGUF量化
大模型部署
AI工程化
隐私计算
推理优化
Ollama 完全指南:本地大模型部署的事实标准——从原理到生产级 AI 应用开发(2026)
编程
Ollama 完全指南:本地大模型部署的事实标准——从原理到生产级 AI 应用开发(2026)
2026-06-05 04:13:34 +0800 CST
view 527
Ollama 本地大模型部署完全指南,从架构原理到生产级部署,涵盖 RAG 集成、性能优化、Docker/K8s 部署等核心内容。
Ollama
本地大模型
AI应用开发
Go语言
llama.cpp
万字深度解析 LMCache:当 LLM 推理遇见「KV 缓存革命」——从 Transformer 注意力机制到多层存储分级、从 vLLM/SGLang 集成到生产级 PD 拆分的完整技术指南(2026)
编程
万字深度解析 LMCache:当 LLM 推理遇见「KV 缓存革命」——从 Transformer 注意力机制到多层存储分级、从 vLLM/SGLang 集成到生产级 PD 拆分的完整技术指南(2026)
2026-07-02 08:42:52 +0800 CST
view 374
深度解析 LMCache 开源项目:LLM 推理 KV 缓存管理层,涵盖架构设计、多级存储、Multiprocess 模式、非前缀复用、PD 拆分等核心技术,15+ 可运行代码示例。
LMCache
LLM推理
KV缓存
vLLM
SGLang
AI推理优化
GPU优化
分布式缓存
Ollama 完全指南:本地大模型部署的事实标准——架构、实战与生产级部署(2026)
编程
Ollama 完全指南:本地大模型部署的事实标准——架构、实战与生产级部署(2026)
2026-06-05 04:13:52 +0800 CST
view 724
Ollama 本地大模型部署完全指南,从架构原理到生产级部署,涵盖 RAG 集成、性能优化、Docker/K8s 部署等核心内容。
Ollama
本地大模型
AI应用开发
Go语言
llama.cpp
vLLM 2026 Q2 路线图深度解析:从 v1 架构重构到九大 SIG 技术演进——生产级 LLM 推理引擎的下一站
编程
vLLM 2026 Q2 路线图深度解析:从 v1 架构重构到九大 SIG 技术演进——生产级 LLM 推理引擎的下一站
2026-05-05 19:01:32 +0800 CST
view 1333
深度解析 vLLM 2026年第二季度技术路线图,涵盖 v1 架构核心设计、九大 SIG 技术演进方向、生产级部署实战经验。
vLLM
LLM推理
架构设计
性能优化
io_uring 深度解剖:Linux 异步 I/O 的性能王者,为何又被 Google 全线封禁——从 SQE/CQE 环形队列到零拷贝、SQPOLL 与安全攻防
编程
io_uring 深度解剖:Linux 异步 I/O 的性能王者,为何又被 Google 全线封禁——从 SQE/CQE 环形队列到零拷贝、SQPOLL 与安全攻防
2026-07-26 04:13:40 +0800 CST
view 204
深度拆解 Linux io_uring:SQ/CQ 环形队列内存模型、SQE/CQE 生命周期、liburing 文件读写与 echo 服务器实战、SQPOLL/注册缓冲区/链式操作/multishot/零拷贝发送进阶特性,并剖析为何性能炸裂却被 Google 在 ChromeOS/Android/GKE 全线封禁,附内核 6.6 安全加固与生产决策清单。
io_uring
Linux内核
异步IO
高性能
SQPOLL
零拷贝
epoll
网络编程
系统编程
安全
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
70
71
72
73
74
...
103
下一页