程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
当AI开始自己设计自己的「心脏」:OpenAI首款推理芯片Jalapeño技术内幕(2026完全指南)
编程
当AI开始自己设计自己的「心脏」:OpenAI首款推理芯片Jalapeño技术内幕(2026完全指南)
2026-06-26 08:16:25 +0800 CST
view 574
深度解析OpenAI首款自研推理芯片Jalapeño的技术架构、产业格局影响,以及为什么这是AI权力格局的重新洗牌。
AI芯片
OpenAI
Jalapeño
推理加速
ASIC
博通
英伟达
9个月流片的AI芯片神话:OpenAI Jalapeño如何改写推理芯片竞争格局
编程
9个月流片的AI芯片神话:OpenAI Jalapeño如何改写推理芯片竞争格局
2026-06-26 08:17:00 +0800 CST
view 596
深度解析OpenAI首款自研推理芯片Jalapeño的技术架构、产业格局影响,以及9个月流片的AI辅助设计革命。
AI芯片
OpenAI
Jalapeño
推理加速
ASIC
边缘AI推理首次超越云端训练:从模型压缩到NPU优化的全栈技术实战
编程
边缘AI推理首次超越云端训练:从模型压缩到NPU优化的全栈技术实战
2026-07-31 12:14:22 +0800 CST
view 223
深度解析边缘AI推理市场首次超越云端训练的技术突破:W4A16混合精度量化、NPU架构设计、算子融合与KV Cache优化、端云协同架构实战,以及1-bit模型、端侧MoE等前沿趋势。
边缘计算
AI推理
NPU
模型量化
端云协同
DFlash 深度实战:基于块扩散的极速投机解码模型——2026年完全指南
编程
DFlash 深度实战:基于块扩散的极速投机解码模型——2026年完全指南
2026-05-25 03:31:37 +0800 CST
view 710
本文深入讲解DFlash的核心概念、架构设计、实战安装与集成,以及性能优化方法,帮助开发者全面掌握这一2026年热门的LLM推理速度优化工具。
DFlash
投机解码
LLM推理速度
开源项目
2026
WebAssembly 2.0 深度实战:当 Wasm 撕掉「浏览器插件」标签,从游戏引擎到 AI 推理的全面入侵(2026)
编程
WebAssembly 2.0 深度实战:当 Wasm 撕掉「浏览器插件」标签,从游戏引擎到 AI 推理的全面入侵(2026)
2026-06-13 17:24:12 +0800 CST
view 918
深度拆解 WebAssembly 2.0 核心特性:GC 支持、SIMD 增强、异常处理标准化、Component Model。从浏览器到边缘计算,从 AI 推理到 Serverless 运行时,全方位实战指南。
WebAssembly
Wasm 2.0
WASI
Serverless
AI推理
Component Model
SIMD
Rust
JavaScript
边缘计算
DwarfStar 4 深度实战:当 Redis 之父手写 AI 推理引擎——从 284B MoE 模型塞进 MacBook 到生产级本地 Agent 的完全指南(2026)
编程
DwarfStar 4 深度实战:当 Redis 之父手写 AI 推理引擎——从 284B MoE 模型塞进 MacBook 到生产级本地 Agent 的完全指南(2026)
2026-06-13 20:17:57 +0800 CST
view 795
Redis之父antirez新作DwarfStar 4深度解析:专为DeepSeek V4 Flash打造的本地推理引擎,非对称2-bit量化、磁盘KV缓存、Metal图执行、分布式推理、方向引导,MacBook上284B模型跑出26 tok/s的完全指南
ds4
DwarfStar
DeepSeek
本地推理
Metal
MoE
量化
KV缓存
WebGPU + WGSL:浏览器通用计算时代全解析——从渲染管线到 AI 推理的架构革命
编程
WebGPU + WGSL:浏览器通用计算时代全解析——从渲染管线到 AI 推理的架构革命
2026-07-31 15:51:04 +0800 CST
view 139
深度解析 WebGPU 架构与 WGSL 语言,涵盖粒子物理仿真、神经网络推理等实战案例,探讨浏览器通用计算的技术变革。
WebGPU
WGSL
浏览器图形
GPU计算
前端性能
AI推理
并行计算
VibeThinker-3B:3亿参数小模型如何超越千亿参数大模型的编程推理能力
编程
VibeThinker-3B:3亿参数小模型如何超越千亿参数大模型的编程推理能力
2026-07-07 20:51:32 +0800 CST
view 213
测试
VibeThinker
小模型
编程推理
AI
DiffusionGemma 深度实战:当文本生成进入「扩散纪元」——从离散扩散原理到本地高速推理的完全指南(2026)
编程
DiffusionGemma 深度实战:当文本生成进入「扩散纪元」——从离散扩散原理到本地高速推理的完全指南(2026)
2026-06-14 01:18:58 +0800 CST
view 751
2026年6月Google开源DiffusionGemma——基于离散扩散技术的文本生成模型,打破传统自回归范式,实现4倍生成速度提升。本文深入解析其架构原理、性能实测、代码实战与生产落地。
DiffusionGemma
离散扩散
文本生成
AI大模型
Google
并行推理
MoE架构
Cloudflare Workers AI 模型绑定深度剖析:从架构内幕到生产级部署的完整指南(2026)
编程
Cloudflare Workers AI 模型绑定深度剖析:从架构内幕到生产级部署的完整指南(2026)
2026-05-26 13:10:20 +0800 CST
view 571
深度剖析 Cloudflare Workers AI 的模型绑定机制、边缘推理架构内幕,以及生产级部署中最实用的优化策略与避坑指南。
Cloudflare
Workers AI
边缘计算
AI推理
Serverless
模型部署
低延迟
2026
万卡集群背后的秘密:2026年K8s如何驱动AI基础设施革命
编程
万卡集群背后的秘密:2026年K8s如何驱动AI基础设施革命
2026-06-26 17:19:50 +0800 CST
view 387
2026年Kubernetes在AI领域的三个关键趋势深度解析:GPU调度范式革命、AI工作负载原生支持、多集群管理工业化
Kubernetes
K8s
AI基础设施
GPU调度
云原生
分布式训练
模型推理
Karmada
Volcano
vLLM
Ray
KubeRay
Qwen3.8-27B 深度解析:混合注意力架构如何用270亿参数挑战旗舰线——从Gated DeltaNet到家用电脑可跑的全链路实战
编程
Qwen3.8-27B 深度解析:混合注意力架构如何用270亿参数挑战旗舰线——从Gated DeltaNet到家用电脑可跑的全链路实战
2026-08-16 00:17:01 +0800 CST
view 55
深度解析阿里开源Qwen3.8-27B模型:从Gated DeltaNet线性注意力原理、混合架构设计、reasoning_effort机制,到本地Ollama/llama.cpp部署实战,配完整Python代码与性能评测数据。
Qwen3.8
Qwen3.8-27B
Gated DeltaNet
线性注意力
混合注意力架构
本地大模型推理
BitNet b1.58 深度解析:微软如何用1.58位量化颠覆大模型推理范式
编程
BitNet b1.58 深度解析:微软如何用1.58位量化颠覆大模型推理范式
2026-04-23 19:09:57 +0800 CST
view 751
深度解析微软开源的BitNet b1.58 2B4T模型,从1.58位三值量化原理、架构设计、性能对比到部署实战,全面剖析这个仅需0.4GB内存、在普通CPU上流畅运行的革命性大语言模型。
BitNet
量化
大模型
微软
CPU推理
边缘计算
WebAssembly 服务端 AI 推理实战:WASI 0.2 组件模型与 WasmEdge 边缘部署全链路深度解析
编程
WebAssembly 服务端 AI 推理实战:WASI 0.2 组件模型与 WasmEdge 边缘部署全链路深度解析
2026-08-16 01:47:12 +0800 CST
view 41
深度解析 WebAssembly 在 AI 推理领域的应用:从 WASI 0.2 组件模型的接口契约设计、WASI-NN 神经网络推理接口,到 WasmEdge 的生产级服务部署与性能调优,配完整 Rust/Python 代码示例。
WebAssembly
WASI
WasmEdge
边缘计算
AI推理
ONNX
组件模型
Serverless
云原生
GGUF
微软Build 2026震撼发布:7款MAI自研模型全解析——从"OpenAI金主"到"模型自研商"的战略革命
编程
微软Build 2026震撼发布:7款MAI自研模型全解析——从"OpenAI金主"到"模型自研商"的战略革命
2026-06-26 19:44:06 +0800 CST
view 643
深度解析微软在Build 2026发布的7款MAI自研模型:从MAI-Thinking-1的MoE架构创新到MAI-Orion的性能怪兽,从"不蒸馏"训练哲学到成本直降10倍的商业逻辑,万字长文带你读懂微软AI战略的惊险跳跃。
MAI
微软
Build2026
MoE
自研模型
AI战略
Azure
推理模型
腾讯混元 Hy3 preview 开源:295B 参数、推理提效 40%,姚顺雨首秀交卷
资讯
腾讯混元 Hy3 preview 开源:295B 参数、推理提效 40%,姚顺雨首秀交卷
2026-04-23 21:18:45 +0800 CST
view 974
2026年4月23日,腾讯发布并开源新一代大模型混元Hy3preview,总参数295B、激活参数21B的MoE架构,支持256K超长上下文,推理效率提升40%,API最低1.2元/百万tokens。在复杂推理、代码与Agent能力上表现突出,接近GPT-5.4级别,数学推理创国内最高纪录。已接入腾讯云、元宝等多条产品线,并上架TokenHub。
人工智能
大模型
腾讯
开源
MoE
推理
代码生成
Agent
云计算
Docker AI Toolkit 2026 深度解析:从镜像构建到推理服务,AI 工作流的全链路重构
编程
Docker AI Toolkit 2026 深度解析:从镜像构建到推理服务,AI 工作流的全链路重构
2026-05-14 01:55:02 +0800 CST
view 586
Docker AI Toolkit 2026于2026年3月1日发布,原生支持PyTorch 2.4、TensorFlow 2.17、ONNX Runtime 1.19一键构建,Sigstore签名+OIDC身份绑定防止供应链攻击,docker ai serve --adaptive自适应推理让GPU利用率稳定在80%,LLM微调延迟压至83ms,WASM沙箱让边缘AI应用启动时间<100ms。
Docker,AI Toolkit,PyTorch,TensorFlow,ONNX Runtime,模型签名验证,Sigstore,WASM沙箱,自适应推理
llama.cpp 架构深度拆解:从 GGML 到 GGUF、量化内核到跨平台推理栈,一文吃透本地 LLM 推理工程化
编程
llama.cpp 架构深度拆解:从 GGML 到 GGUF、量化内核到跨平台推理栈,一文吃透本地 LLM 推理工程化
2026-08-01 08:18:35 +0800 CST
view 249
深度拆解 llama.cpp 全栈架构:从 GGML 到 GGUF 格式演进、K-Quant 量化内核原理、ggml 张量计算图层、libllama 推理逻辑层、10+ 硬件后端调度,以及生产调优实战与踩坑清单。
llama.cpp
GGUF
GGML
量化
本地LLM
CPU推理
GPU加速
跨平台
K-Quant
XY-Serve 深度实战:当昇腾 NPU 终于学会「驯服动态负载」——从元原语分解、Token级调度到 Attention/Linear 双内核优化的完整工程指南(2026)
编程
XY-Serve 深度实战:当昇腾 NPU 终于学会「驯服动态负载」——从元原语分解、Token级调度到 Attention/Linear 双内核优化的完整工程指南(2026)
2026-07-21 08:20:26 +0800 CST
view 223
华为联合清华大学开源的 XY-Serve 论文被 ASPLOS 2026 录用,解决了 NPU 上高效运行动态 LLM 负载的核心挑战。吞吐量提升95%,Attention 内核提速21.5%,Linear 内核提速14.6%。
XY-Serve
华为昇腾
NPU
LLM推理
Meta-Attention
虚拟填充
动态负载
ASPLOS
AI基础设施
DwarfStar 4 深度实战:当 Redis 之父用 C 语言重新发明本地推理——从磁盘 KV 一等公民到 284B 模型跑进 MacBook 的工程完全指南(2026)
编程
DwarfStar 4 深度实战:当 Redis 之父用 C 语言重新发明本地推理——从磁盘 KV 一等公民到 284B 模型跑进 MacBook 的工程完全指南(2026)
2026-06-14 09:48:41 +0800 CST
view 1135
Redis之父antirez的ds4项目深度解析:非对称2-bit量化、磁盘KV缓存一等公民、session_sync增量推理、方向引导、分布式推理的工程实战指南
ds4
DwarfStar
本地推理
DeepSeek
MoE
KV缓存
antirez
Metal
量化
DwarfStar 深度解析:antirez 的 DeepSeek V4 Flash 本地推理引擎——Metal 与 CUDA 双轨优化革命(2026 完全指南)
编程
DwarfStar 深度解析:antirez 的 DeepSeek V4 Flash 本地推理引擎——Metal 与 CUDA 双轨优化革命(2026 完全指南)
2026-05-28 19:13:18 +0800 CST
view 662
DwarfStar(ds4)是Redis创始人antirez开发的DeepSeek V4 Flash专用推理引擎,支持Metal与CUDA双轨优化、磁盘KV Cache、imatrix量化和原生Agent集成。本文深入解析其架构设计与性能表现。
DeepSeek
ds4
Metal
CUDA
本地推理
MoE
量化
GGUF
Agent
Python
C
SGLang 深度实战:新一代 LLM 编程与推理框架——从 RadixAttention 原理到 Agent 系统生产部署
编程
SGLang 深度实战:新一代 LLM 编程与推理框架——从 RadixAttention 原理到 Agent 系统生产部署
2026-05-06 17:37:39 +0800 CST
view 841
深度解析 SGLang 推理框架的 RadixAttention 原理、DSL 编程范式、正则约束解码,以及在 Agent 系统和多轮对话场景的生产部署实践。
SGLang
LLM
推理加速
Agent
RadixAttention
结构化生成
Kubernetes v1.36 深度解析:当 Ingress NGINX 退役遇上 Istio 环境模式——云原生网络架构的范式革命
编程
Kubernetes v1.36 深度解析:当 Ingress NGINX 退役遇上 Istio 环境模式——云原生网络架构的范式革命
2026-04-16 04:40:40 +0800 CST
view 942
深入解析 Kubernetes v1.36 重大变革:Ingress NGINX 退役、Gateway API 崛起、Istio 环境模式多集群支持、AI 推理网关等云原生网络架构的范式革命
Kubernetes
Istio
云原生
Gateway API
服务网格
Ambient Mode
AI推理
多集群
Kubernetes v1.36 与 Istio 环境模式深度解析:云原生网络架构的范式革命——从 Ingress NGINX 退役到 AI 推理网关
编程
Kubernetes v1.36 与 Istio 环境模式深度解析:云原生网络架构的范式革命——从 Ingress NGINX 退役到 AI 推理网关
2026-04-16 04:41:31 +0800 CST
view 804
深入解析 Kubernetes v1.36 重大变革:Ingress NGINX 退役、Gateway API 崛起、Istio 环境模式多集群支持、AI 推理网关等云原生网络架构的范式革命
Kubernetes
Istio
云原生
Gateway API
服务网格
Ambient Mode
AI推理
多集群
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
7
8
9
10
11
...
53
下一页