程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
Ollama 深度实战:当本地大模型成为生产级基础设施——从模型量化到高并发推理、从 REST API 到 Kubernetes 部署的完全指南(2026)
编程
Ollama 深度实战:当本地大模型成为生产级基础设施——从模型量化到高并发推理、从 REST API 到 Kubernetes 部署的完全指南(2026)
2026-06-20 01:25:22
view 783
Ollama本地大模型生产级部署完全指南:从GGUF格式原理、INT4/INT8量化实战、REST API集成、多语言SDK(Python/Go/TypeScript)、GPU显存管理、Kubernetes+Helm生产部署、性能调优到RAG知识库构建,全流程深度实战。
Ollama
本地大模型
LLM部署
模型量化
GGUF
llama.cpp
REST API
Kubernetes
GPU
RAG
Mano-P + Cider:4B模型本地操控Mac,端侧GUI Agent新时代
案例
Mano-P + Cider:4B模型本地操控Mac,端侧GUI Agent新时代
2026-05-07 13:34:32
view 638
明略科技开源Mano-P(4B量化模型本地操控Mac)和Cider(MLX推理加速框架)。476 tokens/s预填充,76 tokens/s解码,峰值内存4.3GB,完全本地运行数据不出设备,离线长任务自主规划
GUI Agent
端侧AI
Apple Silicon
MLX
视觉理解
本地运行
Mano-P
Cider
WinApps:让 Linux 流畅运行 Windows 应用,狂揽 1.5 万 Star
编程
WinApps:让 Linux 流畅运行 Windows 应用,狂揽 1.5 万 Star
2026-07-09 11:57:08
view 287
WinApps在Linux上运行Windows应用,Word/Excel/Photoshop像原生一样独立窗口,VM投射+文件共享,15400+ Star,一行命令安装。
Linux
Windows
WinApps
开源
虚拟机
兼容性
Office
跨平台
Docker
ClickHouse 26.7 深度拆解:当 MPP 列存把「实时数仓」逼成单机也能扛 PB 的怪兽——从稀疏主键到倒排索引与向量检索的全链路实战
编程
ClickHouse 26.7 深度拆解:当 MPP 列存把「实时数仓」逼成单机也能扛 PB 的怪兽——从稀疏主键到倒排索引与向量检索的全链路实战
2026-08-18 08:44:39
view 106
深度拆解 ClickHouse 26.7:稀疏主键、跳数索引、倒排索引与向量检索,配 Docker Compose、SQL 与 Python 实战及生产级性能优化清单。
ClickHouse
OLAP
列式存储
MergeTree
向量检索
倒排索引
实时数仓
MPP
数据库
Next.js 15 深度实战:当 App Router 遇上 Turbopack —— 从缓存革命到生产级性能优化的完全指南(2026)
编程
Next.js 15 深度实战:当 App Router 遇上 Turbopack —— 从缓存革命到生产级性能优化的完全指南(2026)
2026-06-09 21:48:40
view 732
Next.js 15 深度实战指南,详解 Turbopack、Partial Prerendering、use() Hook 等核心特性,从架构原理到生产级优化的完整教程。
Next.js 15
Turbopack
React
App Router
性能优化
GitHub 8K+ Star的AI PPT工具:生成的不是图片,是真正可以编辑的PowerPoint
编程
GitHub 8K+ Star的AI PPT工具:生成的不是图片,是真正可以编辑的PowerPoint
2026-04-28 03:24:21
view 1275
PPT Master是一个8K+ Star的开源AI PPT工具,通过SVG→DrawingML转换生成真正可编辑的PowerPoint原生对象,不是图片。支持PDF、Word、网页等多种输入,本地处理数据不出本机,最低$0.08/份。
PPT
AI工具
开源项目
GitHub
PowerPoint
Node.js 26 深度实战:当 TypeScript 第一次"裸奔"进 V8——Type Stripping 如何用"只擦除不转译"重写 Node 跑 TS 的心智模型
编程
Node.js 26 深度实战:当 TypeScript 第一次"裸奔"进 V8——Type Stripping 如何用"只擦除不转译"重写 Node 跑 TS 的心智模型
2026-07-15 06:42:33
view 309
TypeScript 第一次无需编译直接跑进 V8:拆解 Node.js 26 Type Stripping 的"只擦除不转译"原理、能力边界(enum/namespace/装饰器为何报错)、与 tsx/ts-node/tsc 的取舍,附可运行代码与工程迁移实战。
Node.js 26
TypeScript
Type Stripping
原生 TS
类型擦除
Redis之父antirez亲自下场!为DeepSeek V4 Flash打造专属推理引擎,Mac上跑出468 token/s
案例
Redis之父antirez亲自下场!为DeepSeek V4 Flash打造专属推理引擎,Mac上跑出468 token/s
2026-05-10 08:40:22
view 892
Redis之父antirez亲自下场!为DeepSeek V4 Flash打造专属推理引擎ds4.c,C+Metal从头编写,Mac Studio M3 Ultra上预填充468 token/s。关键优化:非对称量化(MoE专家层2-bit)、KV缓存搬硬盘、内置OpenAI/Anthropic双API。128GB Mac可跑,专为coding agent优化。
DeepSeek
AI推理
Mac
Redis
antirez
Metal
本地推理
MoE
GGUF
C语言
Apple Silicon
Claude Code
OpenAI API
Anthropic API
Shimmy 深度解析:纯 Rust WebGPU 推理引擎如何用一行命令颠覆浏览器端 AI 推理
编程
Shimmy 深度解析:纯 Rust WebGPU 推理引擎如何用一行命令颠覆浏览器端 AI 推理
2026-07-25 15:14:38
view 189
深度解析 Shimmy v2.3.0:纯 Rust WebGPU 推理引擎如何实现浏览器端原生运行 GGUF 量化模型,OpenAI API 兼容,零依赖部署。
WebGPU
Rust
GGUF
AI推理
浏览器
llama.cpp
OpenAI API
前端工程
Svelte 5 深度解析:Runes 革命与响应式编程的范式跃迁
编程
Svelte 5 深度解析:Runes 革命与响应式编程的范式跃迁
2026-05-12 14:11:40
view 778
深度解析Svelte 5的重大革新:Runes响应式系统、//新语法、Snippets代码片段、TypeScript原生支持、性能提升33%。包含Runes系统深度解析、Svelte 4迁移指南、性能优化实战。
Svelte5
Runes系统
响应式编程
SvelteKit
Snippets
RLX 深度拆解:MIT 如何用纯 Rust 写出一个「编译器+运行时合一」的 ML 框架——从 JAX 形状的张量 IR 到 15 种硬件后端的全栈工程哲学
编程
RLX 深度拆解:MIT 如何用纯 Rust 写出一个「编译器+运行时合一」的 ML 框架——从 JAX 形状的张量 IR 到 15 种硬件后端的全栈工程哲学
2026-08-04 01:43:34
view 205
深度拆解MIT RLX纯Rust ML编译器架构:统一IR贯穿图优化到内核调度、15种硬件后端支持、JAX形自动微分、INT8量化感知训练、FPGA综合、Iroh NAT穿透分布式训练,附完整代码示例与性能优化实战指南
RLX
Rust
ML编译器
张量IR
自动微分
边缘计算
WebGPU
CUDA
Apple Silicon
量化部署
开源
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
编程
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
2026-07-28 11:48:24
view 175
深度拆解Google ICLR 2026论文TurboQuant及其工程增强TurboQuant+:极坐标量化+QJL残差编码实现2bit KV Cache压缩,配合llama.cpp跨后端(CUDA/ROCm/Metal/Vulkan)生产级落地,附完整代码实战与选型建议
TurboQuant
KV Cache
LLM推理
llama.cpp
量化
显存优化
Walsh-Hadamard
Vulkan
CUDA
ROCm
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
编程
TurboQuant+ 深度拆解:用 2bit KV Cache 压缩重构 LLM 推理经济学——从 Walsh-Hadamard 旋转到 llama.cpp 生产级落地
2026-07-28 11:50:04
view 234
深度拆解Google ICLR 2026论文TurboQuant及其工程增强TurboQuant+:极坐标量化+QJL残差编码实现2bit KV Cache压缩,配合llama.cpp跨后端(CUDA/ROCm/Metal/Vulkan)生产级落地,附完整代码实战与选型建议
TurboQuant
KV Cache
LLM推理
llama.cpp
量化
显存优化
Walsh-Hadamard
Vulkan
CUDA
ROCm
TurboQuant+深度拆解:极坐标量化+QJL残差编码——2bit KV Cache压缩重构 LLM 推理经济学
编程
TurboQuant+深度拆解:极坐标量化+QJL残差编码——2bit KV Cache压缩重构 LLM 推理经济学
2026-07-28 11:52:16
view 289
深度拆解Google ICLR 2026论文TurboQuant及其工程增强TurboQuant+:极坐标量化+QJL残差编码实现2bit KV Cache压缩,配合llama.cpp跨后端(CUDA/ROCm/Metal/Vulkan)生产级落地,附完整代码实战与选型建议
TurboQuant
KV Cache
LLM推理
llama.cpp
量化
显存优化
Walsh-Hadamard
Vulkan
CUDA
ROCm
Xcode 27 三智能体融合:AI编程从「辅助补全」到「代理开发」的范式革命——2026年开发者工作流深度重构完全指南
编程
Xcode 27 三智能体融合:AI编程从「辅助补全」到「代理开发」的范式革命——2026年开发者工作流深度重构完全指南
2026-06-16 10:45:32
view 373
2026年6月苹果Xcode 27 Beta将三大AI编程智能体全部原生集成进IDE。本文从架构原理出发,系统解析三层AI架构,并结合30天真实项目实测,全面评估这场从辅助补全到代理开发的范式革命对开发者的实际影响。
AI编程
Xcode
Apple
Claude
智能体
PyTorch 2.13 深度拆解:从 Metal 原生内核到 4 倍内存优化的工程全貌
编程
PyTorch 2.13 深度拆解:从 Metal 原生内核到 4 倍内存优化的工程全貌
2026-07-17 11:13:32
view 571
深度拆解 PyTorch 2.13:FlexAttention 在 Apple Silicon 上提速 12 倍、CUTeDSL 为 Inductor 引入第二条代码生成路径、nn.LinearCrossEntropyLoss 将大词汇量模型显存降低 4 倍、torchcomms 重塑分布式训练通信层、ExecuTorch 正式并入核心,配完整生产级代码实战。
PyTorch
深度学习
AI框架
Metal
FlexAttention
Apple Silicon
分布式训练
shimmy v2.3.0 深度解析:纯 Rust WebGPU 推理引擎如何让 GGUF 模型跑满你的每一块 GPU
编程
shimmy v2.3.0 深度解析:纯 Rust WebGPU 推理引擎如何让 GGUF 模型跑满你的每一块 GPU
2026-07-23 11:45:35
view 261
深度解析纯 Rust WebGPU 推理引擎 shimmy v2.3.0:GGUF 原生加载、OpenAI API 兼容、KV Cache 量化、Flash Attention 等效实现,配 Tauri 桌面应用集成实战与性能基准测试。
shimmy
WebGPU
Rust
GGUF
LLM
llama.cpp
推理引擎
WebAssembly
LLM推理框架2026选型完全指南:从vLLM到TensorRT-LLM,一次讲透四大引擎的架构哲学与生产级实战
编程
LLM推理框架2026选型完全指南:从vLLM到TensorRT-LLM,一次讲透四大引擎的架构哲学与生产级实战
2026-06-02 09:36:52
view 898
从vLLM到TensorRT-LLM,一次讲透vLLM、SGLang、TensorRT-LLM、llama.cpp四大LLM推理框架的架构哲学、核心原理、生产级部署实战与选型决策树。
LLM
vLLM
TensorRT-LLM
llama.cpp
SGLang
推理优化
GPU
BitNet 深度拆解:当大模型被压到 1.58 bit——从三元权重、BitLinear 到 bitnet.cpp 的端侧推理革命(2026)
编程
BitNet 深度拆解:当大模型被压到 1.58 bit——从三元权重、BitLinear 到 bitnet.cpp 的端侧推理革命(2026)
2026-07-17 14:24:55
view 386
深度拆解微软 BitNet:1.58-bit 三值量化、Absmean/Absmax、BitLinear、bitnet.cpp 子矩阵内核,附 PyTorch 手写实现与 CPU 端侧推理性能实测。
BitNet
1-bit LLM
大模型推理
模型量化
端侧AI
bitnet.cpp
用 PakePlus 把任意网页打包成桌面端和手机 App
编程
用 PakePlus 把任意网页打包成桌面端和手机 App
2026-08-26 15:26:36
view 18
PakePlus 是一款基于 MIT 协议的开源工具,可将任意 HTML/网页可视化地打包成桌面端和手机应用。本文手把手教你安装、GitHub 授权、打包桌面端、安卓 App,以及 iOS 使用「添加到主屏幕」的替代方案,全程无需编写代码。
PakePlus
开源
网页打包
桌面应用
手机App
llama.cpp 深度实战:当端侧 LLM 成为生产级事实标准——从 GGUF 量化到跨平台部署的完全指南(2026)
编程
llama.cpp 深度实战:当端侧 LLM 成为生产级事实标准——从 GGUF 量化到跨平台部署的完全指南(2026)
2026-06-11 00:19:05
view 734
全面解析 llama.cpp 推理引擎,从 GGUF 格式、量化原理、架构设计到跨平台部署,提供生产级代码实战和性能优化指南。
llama.cpp
GGUF
量化
端侧推理
大语言模型
Tabby 深度实战:用一台消费级 GPU 搭好团队私有的"Copilot"
编程
Tabby 深度实战:用一台消费级 GPU 搭好团队私有的"Copilot"
2026-07-24 01:46:45
view 241
深度实战 TabbyML/tabby 自托管 AI 编程助手:三层架构与 llama-server 独立化重构、消费级 GPU 模型选型、Repository Context 语法感知 RAG 索引、FIM Prompt 拼装原理、systemd/nginx 生产部署、压测与 Prometheus 监控全套方案。
Tabby
AI编程
代码补全
自托管
llama.cpp
RAG
Rust
GPU
开源
Copilot
Redis之父的「孤注一掷」:ds4.c如何让284B参数模型在128GB MacBook上跑起来
编程
Redis之父的「孤注一掷」:ds4.c如何让284B参数模型在128GB MacBook上跑起来
2026-07-11 16:17:33
view 443
Redis之父 Salvatore Sanfilippo 2026年5月发布的新项目 ds4.c,专为 DeepSeek V4 Flash + Apple Silicon Metal 打造本地推理引擎,8000行代码实现2.5倍性能提升。本文深度解析其架构设计、Graph Executor、KV Cache页式管理与Metal Shader实现。
推理引擎
Apple Silicon
DeepSeek
Metal
Redis
ds4.c
DwarfStar 4 深度拆解:当 Redis 之父决定「干掉全部通用推理引擎」——一个专用 MoE 推理栈如何用 2-Bit 量化和磁盘 KV 缓存在 MacBook 上跑出 26 tok/s
编程
DwarfStar 4 深度拆解:当 Redis 之父决定「干掉全部通用推理引擎」——一个专用 MoE 推理栈如何用 2-Bit 量化和磁盘 KV 缓存在 MacBook 上跑出 26 tok/s
2026-08-04 22:46:33
view 268
深度拆解Redis创始人antirez打造的DwarfStar 4本地推理引擎:专用MoE推理栈、非对称2-Bit量化、磁盘KV缓存、SSD流式加载、多机流水线并行,在128GB MacBook上跑出26 tok/s的284B模型推理
DwarfStar
Redis
antirez
DeepSeek
MoE
本地推理
LLM
推理引擎
2-Bit量化
KV缓存
Apple Metal
CUDA
开源
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
python
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
上一页
1
2
3
4
5
...
78
下一页