程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
XY-Serve 深度实战:当昇腾 NPU 终于学会「驯服动态负载」——从元原语分解、Token级调度到 Attention/Linear 双内核优化的完整工程指南(2026)
编程
XY-Serve 深度实战:当昇腾 NPU 终于学会「驯服动态负载」——从元原语分解、Token级调度到 Attention/Linear 双内核优化的完整工程指南(2026)
2026-07-21 08:20:26 +0800 CST
view 197
华为联合清华大学开源的 XY-Serve 论文被 ASPLOS 2026 录用,解决了 NPU 上高效运行动态 LLM 负载的核心挑战。吞吐量提升95%,Attention 内核提速21.5%,Linear 内核提速14.6%。
XY-Serve
华为昇腾
NPU
LLM推理
Meta-Attention
虚拟填充
动态负载
ASPLOS
AI基础设施
FlashPrefill 深度解析:当瞬时注意力遇上 GPU 原语——从 O(N²) 困境到 27 倍速的工程革命
编程
FlashPrefill 深度解析:当瞬时注意力遇上 GPU 原语——从 O(N²) 困境到 27 倍速的工程革命
2026-04-15 17:20:25 +0800 CST
view 789
深度解析中科院与腾讯微信联合研发的 FlashPrefill 如何通过即时注意力模式发现和动态阈值筛选,将 25.6 万字符长文本处理速度提升 27.78 倍,同时保持近乎完美的精度。
LLM推理优化
FlashAttention
GPU计算
长文本处理
注意力机制
Transformer
深度学习
WebGPU 深度解析:当 Chrome 正式发布 WebGPU 实现,Web 图形与通用计算的新纪元已至
编程
WebGPU 深度解析:当 Chrome 正式发布 WebGPU 实现,Web 图形与通用计算的新纪元已至
2026-04-15 19:20:07 +0800 CST
view 753
深入解析 Chrome 113 正式发布的 WebGPU 实现:架构设计、WGSL 着色器语言、Compute Shader 机器学习推理实战、性能对比与完整代码示例
WebGPU
WGSL
Chrome
图形API
GPU计算
Compute Shader
机器学习
Web图形
ClickHouse 深度实战:把 PB 级实时分析塞进一台服务器——从 MergeTree 存储引擎、稀疏索引到物化视图流的完整指南(2026)
编程
ClickHouse 深度实战:把 PB 级实时分析塞进一台服务器——从 MergeTree 存储引擎、稀疏索引到物化视图流的完整指南(2026)
2026-07-08 05:41:58 +0800 CST
view 252
从 MergeTree 存储引擎、稀疏索引数学、物化视图流式语义到生产级写入、异步删除与性能调优,系统讲透 ClickHouse 如何把 PB 级实时分析塞进一台服务器。
ClickHouse
OLAP
MergeTree
物化视图
性能优化
Meta 的豪赌:React Compiler 全面迁移 Rust,性能提升 10 倍背后的工程真相
编程
Meta 的豪赌:React Compiler 全面迁移 Rust,性能提升 10 倍背后的工程真相
2026-08-01 12:14:09 +0800 CST
view 122
深入剖析 React Compiler 从 TypeScript 到 Rust 的移植工程:Arena 分配、索引数据结构、Turbopack 集成消除序列化开销、LLM 参与迁移的深层影响,以及前端工具链 Rust 大迁徙的生态全景。
React
Compiler
Rust
Meta
前端工具链
Babel
Turbopack
性能优化
React Compiler 移植 Rust 深度解析:Arena 分配与索引结构如何实现 10 倍提速
编程
React Compiler 移植 Rust 深度解析:Arena 分配与索引结构如何实现 10 倍提速
2026-08-01 12:15:02 +0800 CST
view 118
深入剖析 React Compiler 从 TypeScript 到 Rust 的移植工程:Arena 分配、索引数据结构、Turbopack 集成消除序列化开销、LLM 参与迁移的深层影响,以及前端工具链 Rust 大迁徙的生态全景。
React
Compiler
Rust
Meta
前端工具链
Babel
Turbopack
性能优化
三张图讲清楚 React Compiler 移植 Rust:Arena 分配与索引结构如何实现 10 倍提速
编程
三张图讲清楚 React Compiler 移植 Rust:Arena 分配与索引结构如何实现 10 倍提速
2026-08-01 12:19:03 +0800 CST
view 143
用图解方式深入剖析 React Compiler 从 TypeScript 到 Rust 的移植工程:Arena 分配消除 GC 开销、索引数据结构提升缓存命中率、Turbopack 集成消除序列化层,三层叠加实现 10 倍提速的底层逻辑。
React
Compiler
Rust
Meta
前端工具链
Babel
Turbopack
性能优化
DFlash 深度解析:块扩散模型如何让 LLM 推理加速 6 倍——2026 投机解码完全指南
编程
DFlash 深度解析:块扩散模型如何让 LLM 推理加速 6 倍——2026 投机解码完全指南
2026-05-28 19:39:07 +0800 CST
view 890
深入解析 DFlash 块扩散投机解码方案:如何让 Qwen3-8B 实现 6 倍无损加速,超越 EAGLE-3 与 llama.cpp,附 SGLang/vLLM/MLX 完整部署指南。
LLM推理
投机解码
块扩散
DFlash
推理加速
Transformer优化
GPU
CUDA
SGLang
vLLM
百度 Unlimited OCR 深度解读:R-SWA 如何将 KV Cache 压成常数,5天 GitHub Star 破万的端到端 OCR 新范式
编程
百度 Unlimited OCR 深度解读:R-SWA 如何将 KV Cache 压成常数,5天 GitHub Star 破万的端到端 OCR 新范式
2026-06-27 09:15:20 +0800 CST
view 222
百度开源 Unlimited OCR,5天 GitHub Star 破万。本文深度解析其核心创新 R-SWA(Reference Sliding Window Attention),如何将解码器 KV Cache 从线性增长压成常数,OmniDocBench v1.6 刷榜 SOTA(93.92%),30B 总参/5B 激活,32K 超长上下文,一次前向全稿转录,附完整代码实战。
Unlimited OCR
R-SWA
KV Cache
MoE
端到端 OCR
百度
深度学习
Transformer
文档识别
OCR
深入解析 codebase-memory-mcp:让 AI 编程助手真正「看懂」代码库
编程
深入解析 codebase-memory-mcp:让 AI 编程助手真正「看懂」代码库
2026-07-26 09:44:32 +0800 CST
view 313
深入解析 GitHub 10K+ Stars 的 codebase-memory-mcp 项目:用 tree-sitter + 知识图谱为 AI 编程助手构建持久化代码记忆,让 Claude Code、Cursor 等工具真正「看懂」代码库结构。
AI编程助手
codebase-memory-mcp
MCP
代码知识图谱
AI Agent
tree-sitter
GameLink:Go+React游戏陪玩管理平台,智能订单分发+WebSocket实时通讯+RBAC权限
编程
GameLink:Go+React游戏陪玩管理平台,智能订单分发+WebSocket实时通讯+RBAC权限
2026-07-26 11:45:41 +0800 CST
view 205
GameLink(游戏陪玩管理平台):Go后端+React前端架构、智能订单分发(抢单池+客服指派)、WebSocket实时通讯(聊天室+订单群聊)、JWT+RBAC权限控制、AES-256-CBC加密、完整支付+退款+收益结算、平台抽成15-25%、三端架构(用户端/陪玩师端/管理后台)、Docker一键部署、PostgreSQL+Redis存储、Go 1.25.5+Gin+GORM技术栈。
GameLink
游戏陪玩
Go后端
React前端
订单分发
WebSocket
实时通讯
RBAC
支付系统
Docker部署
MELT架构深度解析:高通如何让AI"深度思考"不再耗尽内存——循环Transformer的内存革命
编程
MELT架构深度解析:高通如何让AI"深度思考"不再耗尽内存——循环Transformer的内存革命
2026-05-19 13:46:15 +0800 CST
view 505
高通AI研究院提出的MELT架构通过门控机制让循环Transformer的内存消耗保持恒定,无论思考多少轮。本文深度解析其架构原理、数学推导、训练策略与性能实测。
AI
Transformer
内存优化
深度推理
高通
腾讯开源Agent Memory:上下文卸载+Mermaid任务画布,Token消耗降低61%
编程
腾讯开源Agent Memory:上下文卸载+Mermaid任务画布,Token消耗降低61%
2026-05-14 15:31:52 +0800 CST
view 868
腾讯云开源TencentDB Agent Memory,通过上下文卸载+Mermaid任务画布为Agent长任务提供记忆压缩,实测Token消耗降低61%同时提升成功率,兼容OpenClaw/Hermes,零依赖SQLite本地存储。
AI Agent
腾讯开源
上下文管理
Token优化
Mermaid
Zig 深度拆解:无 GC、无隐藏分配、comptime 编译期执行——一个「不该存在」的系统语言如何改写底层编程的游戏规则
编程
Zig 深度拆解:无 GC、无隐藏分配、comptime 编译期执行——一个「不该存在」的系统语言如何改写底层编程的游戏规则
2026-08-02 21:43:17 +0800 CST
view 163
从第一性原理深度拆解Zig:显式内存分配器、comptime编译期执行、零隐藏抽象、构建系统与C互操作,附完整HTTP解析器代码与TigerBeetle/Bun实战案例
Zig
系统编程
comptime
内存管理
编译器
性能优化
C语言
Rust
TigerBeetle
Bun
ClickHouse 深度实战:从列式存储、MergeTree 稀疏索引到向量检索与物化投影的工程全解(2026)
编程
ClickHouse 深度实战:从列式存储、MergeTree 稀疏索引到向量检索与物化投影的工程全解(2026)
2026-07-22 05:12:57 +0800 CST
view 278
从工程师视角深度拆解 ClickHouse:列式存储与向量化执行、MergeTree 稀疏索引与物理结构、表引擎家族与分布式架构,配 Go/Python 实战、物化视图、投影、JSON 类型、向量检索与性能优化完全指南。
ClickHouse
OLAP
列式存储
MergeTree
向量检索
物化视图
性能优化
稀疏注意力架构革命:2026年长上下文大模型核心技术解析
编程
稀疏注意力架构革命:2026年长上下文大模型核心技术解析
2026-07-09 08:45:09 +0800 CST
view 384
深入解析2026年稀疏注意力技术革命,涵盖SubCube、CSA/HCA、MSA三大架构的技术原理、代码实现与实战指南,探讨长上下文大模型的最新发展。
AI
大模型
Transformer
稀疏注意力
LongContext
DeepSeek
MiniMax
TriAttention深度解析:MIT韩松团队如何用三角函数让单卡4090跑出百万Token上下文
编程
TriAttention深度解析:MIT韩松团队如何用三角函数让单卡4090跑出百万Token上下文
2026-04-17 10:15:58 +0800 CST
view 695
2026年4月,MIT、英伟达、浙江大学联合发布TriAttention,用三角函数建模注意力距离偏好,实现KV缓存10.7倍压缩,让单卡4090跑出百万Token上下文。
AI
大模型
Transformer
注意力机制
KV缓存
长上下文
模型优化
论文解读
2026
Qwen3.8深度拆解:2.4万亿参数稀疏MoE架构的技术革命,从模型设计到开源落地的全链路复盘
编程
Qwen3.8深度拆解:2.4万亿参数稀疏MoE架构的技术革命,从模型设计到开源落地的全链路复盘
2026-08-11 10:55:36 +0800 CST
view 23
深度拆解阿里Qwen3.8的2.4万亿参数稀疏MoE架构:专家池设计、负载均衡、混合注意力机制、100万Token上下文、编程能力突破、开源生态影响与生产部署指南
Qwen3.8
大模型
MoE架构
稀疏激活
开源AI
千问
AI编程
深度学习
Transformer
MiniMax H3 开源视频模型架构深度拆解:从 Contextual Omni Representation 到 H3-Omni Transformer 的全链路工程解析
编程
MiniMax H3 开源视频模型架构深度拆解:从 Contextual Omni Representation 到 H3-Omni Transformer 的全链路工程解析
2026-08-11 14:32:39 +0800 CST
view 22
深度拆解 MiniMax H3 开源视频模型三层模块架构:Contextual Omni Representation、H3-Omni Transformer、H3-VAE,以及 FL2VA 与 Ref2VA 的技术差异、INT8 量化优化与本地部署实战
MiniMax H3
视频生成
开源AI
扩散模型
多模态
H3-Omni Transformer
WebAssembly 边缘计算革命:从 Cloudflare Workers 到 WasmEdge,打造毫秒级全球分布式计算的完全指南(2026)
编程
WebAssembly 边缘计算革命:从 Cloudflare Workers 到 WasmEdge,打造毫秒级全球分布式计算的完全指南(2026)
2026-05-30 20:12:14 +0800 CST
view 558
深度解析 WebAssembly 在边缘计算中的革命性应用,从 Cloudflare Workers 到 WasmEdge,涵盖架构原理、实战案例、性能优化与未来展望
WebAssembly
边缘计算
Rust
Cloudflare Workers
WasmEdge
TimesFM 2.5 深度解析:当时间序列预测终于学会零样本
编程
TimesFM 2.5 深度解析:当时间序列预测终于学会零样本
2026-04-08 16:35:10 +0800 CST
view 1138
Google TimesFM 2.5 时间序列预测基础模型深度解析:200M参数零样本预测,16k上下文,Decoder-only Transformer架构,Patch分词,Monash基准测试击败监督模型
时间序列
机器学习
Google
Transformer
SpacetimeDB 深度实战:当数据库变成了服务器——从 Reducer 事务模型到实时订阅推送、从 WASM 模块到全栈后端替代的生产级完全指南(2026)
编程
SpacetimeDB 深度实战:当数据库变成了服务器——从 Reducer 事务模型到实时订阅推送、从 WASM 模块到全栈后端替代的生产级完全指南(2026)
2026-06-21 06:28:18 +0800 CST
view 401
深入拆解 SpacetimeDB 的架构原理与生产级实践:五大设计哲学、Table/Reducer/Procedure/View/Subscription 核心概念、Rust+TypeScript 全栈代码实战、WASM 运行时与内存存储引擎深度分析、性能优化与部署指南
SpacetimeDB
数据库
WASM
Rust
实时同步
后端架构
Reducer
Dockge深度解析:自托管Docker Compose管理工具的革命性设计与工程实践
编程
Dockge深度解析:自托管Docker Compose管理工具的革命性设计与工程实践
2026-04-18 07:13:40 +0800 CST
view 831
深度解析Dockge的设计理念、架构实现与工程实践,探讨文件优先架构、交互式Web终端、多Agent支持等核心特性,以及与Portainer等工具的对比分析。
Docker
容器编排
DevOps
Homelab
开源工具
SubCube 深度实战:亚二次稀疏注意力 SSA 如何打破 Transformer 的 O(n²) 铁律——1200万 Token 时代从架构原理到生产级部署的完全指南(2026)
编程
SubCube 深度实战:亚二次稀疏注意力 SSA 如何打破 Transformer 的 O(n²) 铁律——1200万 Token 时代从架构原理到生产级部署的完全指南(2026)
2026-05-31 08:21:47 +0800 CST
view 691
Subquadratic发布的SubQ模型采用SSA亚二次稀疏注意力架构,实现1200万Token上下文窗口,在MRCR v2基准测试中碾压GPT-5.5。本文从架构原理、基准分析、代码实战到生产部署全面解读这场注意力革命。
SSA
Subquadratic
SubQ
Transformer
注意力机制
长上下文
RAG
稀疏注意力
AI架构
大模型
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
34
35
36
37
38
...
93
下一页