程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
Qwen3.8-27B 深度实战:270亿参数如何把「多模态+长上下文+编程能力」塞进家用显卡——从 Dense 架构原理到本地部署全链路拆解
编程
Qwen3.8-27B 深度实战:270亿参数如何把「多模态+长上下文+编程能力」塞进家用显卡——从 Dense 架构原理到本地部署全链路拆解
2026-08-16 11:15:36 +0800 CST
view 74
深度拆解阿里Qwen3.8-27B:270亿参数原生多模态稠密模型,262K原生上下文可扩展至100万tokens,编程能力超越Qwen3.7-Plus。从Dense架构原理、混合注意力、YaRN外推、reasoning_effort机制,到INT4量化部署、KV Cache优化、vLLM推理加速、生产级FastAPI部署,配完整代码实战与性能对比数据。
Qwen3.8-27B
多模态模型
Dense架构
长上下文
本地部署
量化优化
编程能力
推理引擎
DFlash 深度解析:块扩散模型如何让 LLM 推理加速 6 倍——2026 投机解码完全指南
编程
DFlash 深度解析:块扩散模型如何让 LLM 推理加速 6 倍——2026 投机解码完全指南
2026-05-28 19:39:07 +0800 CST
view 931
深入解析 DFlash 块扩散投机解码方案:如何让 Qwen3-8B 实现 6 倍无损加速,超越 EAGLE-3 与 llama.cpp,附 SGLang/vLLM/MLX 完整部署指南。
LLM推理
投机解码
块扩散
DFlash
推理加速
Transformer优化
GPU
CUDA
SGLang
vLLM
百度 Unlimited OCR 深度解读:R-SWA 如何将 KV Cache 压成常数,5天 GitHub Star 破万的端到端 OCR 新范式
编程
百度 Unlimited OCR 深度解读:R-SWA 如何将 KV Cache 压成常数,5天 GitHub Star 破万的端到端 OCR 新范式
2026-06-27 09:15:20 +0800 CST
view 239
百度开源 Unlimited OCR,5天 GitHub Star 破万。本文深度解析其核心创新 R-SWA(Reference Sliding Window Attention),如何将解码器 KV Cache 从线性增长压成常数,OmniDocBench v1.6 刷榜 SOTA(93.92%),30B 总参/5B 激活,32K 超长上下文,一次前向全稿转录,附完整代码实战。
Unlimited OCR
R-SWA
KV Cache
MoE
端到端 OCR
百度
深度学习
Transformer
文档识别
OCR
微信收款自动通知服务器:不用 Android 开发也能定制自己的 App
编程
微信收款自动通知服务器:不用 Android 开发也能定制自己的 App
2026-06-14 19:44:09 +0800 CST
view 411
基于SmsForwarder开源项目的微信收款自动通知方案,利用安卓通知监听服务20ms转发,无需修改微信/Root/截图,零封号风险,支持GitHub Actions一键定制编译APK。
SmsForwarder
微信收款
通知监听
Android
开源
GitHub Actions
无需Root
短信转发
AI编程
WebSocket、SSE、WebRTC 深度实战:2026年实时通信架构选型、原理分析与生产级部署完全指南
编程
WebSocket、SSE、WebRTC 深度实战:2026年实时通信架构选型、原理分析与生产级部署完全指南
2026-06-27 16:13:11 +0800 CST
view 436
WebSocket、SSE、WebRTC三大实时通信协议深度实战指南。从协议原理、代码实战到性能基准和生产部署,涵盖AI模型流式输出方案选型、HTTP/3与WebTransport新趋势,2026年架构师必读的实时通信完全指南。
WebSocket
SSE
WebRTC
实时通信
HTTP/3
QUIC
WebTransport
架构设计
Go
JavaScript
Python
zvec 深度实战:把向量数据库塞进进程里——从 ANN 算法、HNSW 图索引到混合检索与十亿级向量的完整指南(2026)
编程
zvec 深度实战:把向量数据库塞进进程里——从 ANN 算法、HNSW 图索引到混合检索与十亿级向量的完整指南(2026)
2026-07-09 00:48:06 +0800 CST
view 330
阿里巴巴开源的进程内向量数据库 zvec:从余弦相似度、ANN、HNSW 图索引、IVF、乘积量化到混合检索与 RAG 落地的完整工程拆解,附可运行 Python 代码。
向量数据库
ANN
HNSW
zvec
RAG
近似最近邻
MELT架构深度解析:高通如何让AI"深度思考"不再耗尽内存——循环Transformer的内存革命
编程
MELT架构深度解析:高通如何让AI"深度思考"不再耗尽内存——循环Transformer的内存革命
2026-05-19 13:46:15 +0800 CST
view 517
高通AI研究院提出的MELT架构通过门控机制让循环Transformer的内存消耗保持恒定,无论思考多少轮。本文深度解析其架构原理、数学推导、训练策略与性能实测。
AI
Transformer
内存优化
深度推理
高通
LLM 推理框架选型实战:vLLM、TensorRT-LLM、TGI、DeepSpeed-MII 深度对比与生产部署指南
编程
LLM 推理框架选型实战:vLLM、TensorRT-LLM、TGI、DeepSpeed-MII 深度对比与生产部署指南
2026-07-03 13:49:04 +0800 CST
view 472
深度对比 vLLM 0.5、TensorRT-LLM 1.8、TGI 2.0、DeepSpeed-MII 0.9 四大推理框架,从核心技术原理、性能数据、成本账本到生产部署实战,帮你做出正确的框架选型决策。
LLM
vLLM
TensorRT-LLM
TGI
DeepSpeed
推理优化
大模型部署
GPU优化
Unsloth 深度拆解:当 LLM 微调学会「省显存」——2倍速+70%显存节省背后的 QLoRA 工程革命
编程
Unsloth 深度拆解:当 LLM 微调学会「省显存」——2倍速+70%显存节省背后的 QLoRA 工程革命
2026-07-15 17:47:08 +0800 CST
view 253
深度拆解Unsloth技术栈:QLoRA量化原理、4-bit NF4精度机制、Triton内核重写、8-bit Adam优化器、梯度检查点优化,以及从Notebook到Ollama/vLLM生产部署的完整工程路径,含完整代码实战
Unsloth
LLM微调
QLoRA
LoRA
4-bit量化
深度学习
模型训练
Unsloth实战:当QLoRA让27B模型在RTX 4090上跑起来——从Qwen3.5微调到Ollama部署的完整工程链
编程
Unsloth实战:当QLoRA让27B模型在RTX 4090上跑起来——从Qwen3.5微调到Ollama部署的完整工程链
2026-07-15 17:48:36 +0800 CST
view 241
深度拆解Unsloth技术栈:QLoRA量化原理、4-bit NF4精度机制、Triton内核重写、8-bit Adam优化器、梯度检查点优化,以及从Notebook到Ollama/vLLM生产部署的完整工程路径,含完整代码实战
Unsloth
LLM微调
QLoRA
LoRA
4-bit量化
深度学习
模型训练
TriAttention深度解析:MIT韩松团队如何用三角函数让单卡4090跑出百万Token上下文
编程
TriAttention深度解析:MIT韩松团队如何用三角函数让单卡4090跑出百万Token上下文
2026-04-17 10:15:58 +0800 CST
view 717
2026年4月,MIT、英伟达、浙江大学联合发布TriAttention,用三角函数建模注意力距离偏好,实现KV缓存10.7倍压缩,让单卡4090跑出百万Token上下文。
AI
大模型
Transformer
注意力机制
KV缓存
长上下文
模型优化
论文解读
2026
TensorRT-LLM 1.0 深度实战:当 PyTorch 架构成为默认体验,NVIDIA 的 LLM 推理引擎正式走向成熟
编程
TensorRT-LLM 1.0 深度实战:当 PyTorch 架构成为默认体验,NVIDIA 的 LLM 推理引擎正式走向成熟
2026-07-22 10:46:37 +0800 CST
view 195
深度解析 TensorRT-LLM 1.0:PyTorch 架构正式稳定、LLM API 稳定化、多模态 VLM 原生支持、Qwen3 MoE 优化、LoRA 生产级管理、trtllm-serve 推理服务化,配完整部署实战代码。
TensorRT-LLM
LLM推理
GPU加速
PyTorch
NVIDIA
深度学习
模型部署
推理优化
Qwen3.8深度拆解:2.4万亿参数稀疏MoE架构的技术革命,从模型设计到开源落地的全链路复盘
编程
Qwen3.8深度拆解:2.4万亿参数稀疏MoE架构的技术革命,从模型设计到开源落地的全链路复盘
2026-08-11 10:55:36 +0800 CST
view 298
深度拆解阿里Qwen3.8的2.4万亿参数稀疏MoE架构:专家池设计、负载均衡、混合注意力机制、100万Token上下文、编程能力突破、开源生态影响与生产部署指南
Qwen3.8
大模型
MoE架构
稀疏激活
开源AI
千问
AI编程
深度学习
Transformer
MiniMax H3 深度拆解:全模态生成模型的「统一理解」革命——当 AI 学会像导演一样「看画面、听声音、读脚本」后,2K 视频创作的底层逻辑被彻底重写
编程
MiniMax H3 深度拆解:全模态生成模型的「统一理解」革命——当 AI 学会像导演一样「看画面、听声音、读脚本」后,2K 视频创作的底层逻辑被彻底重写
2026-08-03 07:12:16 +0800 CST
view 352
深度拆解MiniMax H3全模态生成模型三大核心架构:Contextual Omni Representation统一表征、H3-VAE音视频联合编码、H3-Omni Transformer理解-生成异构训练,附完整代码示例、API实战与性能对比分析
MiniMax
H3
全模态
视频生成
MoE
VAE
2K视频
V2V Motion Transfer
AI视频
多模态
OpenScreen深度解析:GitHub 2万+ Stars的开源录屏神器,如何用Electron + PixiJS重塑开发者内容创作体验
编程
OpenScreen深度解析:GitHub 2万+ Stars的开源录屏神器,如何用Electron + PixiJS重塑开发者内容创作体验
2026-04-17 17:47:56 +0800 CST
view 837
深度解析GitHub爆火开源录屏工具OpenScreen的技术架构,涵盖Electron跨平台采集、PixiJS WebGL实时渲染、MediaRecorder录制管线、FFmpeg导出优化等核心技术的工程实践。
Electron
PixiJS
开源
录屏工具
TypeScript
React
OpenScreen
OpenScreen技术全解:Electron屏幕采集 + PixiJS渲染管线 + FFmpeg导出优化的工程实践
编程
OpenScreen技术全解:Electron屏幕采集 + PixiJS渲染管线 + FFmpeg导出优化的工程实践
2026-04-17 17:48:52 +0800 CST
view 730
深度解析GitHub爆火开源录屏工具OpenScreen的技术架构,涵盖Electron跨平台采集、PixiJS WebGL实时渲染、MediaRecorder录制管线、FFmpeg导出优化等核心技术的工程实践。
Electron
PixiJS
开源
录屏工具
TypeScript
React
OpenScreen
MiniMax H3 开源视频模型架构深度拆解:从 Contextual Omni Representation 到 H3-Omni Transformer 的全链路工程解析
编程
MiniMax H3 开源视频模型架构深度拆解:从 Contextual Omni Representation 到 H3-Omni Transformer 的全链路工程解析
2026-08-11 14:32:39 +0800 CST
view 186
深度拆解 MiniMax H3 开源视频模型三层模块架构:Contextual Omni Representation、H3-Omni Transformer、H3-VAE,以及 FL2VA 与 Ref2VA 的技术差异、INT8 量化优化与本地部署实战
MiniMax H3
视频生成
开源AI
扩散模型
多模态
H3-Omni Transformer
TimesFM 深度实战:当 Google Research 把基础模型带进时间序列——从预训练解码器到零样本推理、从多周期建模到生产级预测完全指南(2026)
编程
TimesFM 深度实战:当 Google Research 把基础模型带进时间序列——从预训练解码器到零样本推理、从多周期建模到生产级预测完全指南(2026)
2026-06-21 03:24:16 +0800 CST
view 580
TimesFM 2.5深度解析:Google Research开源的时间序列基础模型,200M参数、16K上下文、零样本推理。从Patch机制、RevIN归一化到LoRA微调、生产部署,10000字完整技术指南。
TimesFM
时间序列预测
Google Research
基础模型
零样本推理
Transformer
概率预测
TimesFM 2.5 深度解析:当时间序列预测终于学会零样本
编程
TimesFM 2.5 深度解析:当时间序列预测终于学会零样本
2026-04-08 16:35:10 +0800 CST
view 1162
Google TimesFM 2.5 时间序列预测基础模型深度解析:200M参数零样本预测,16k上下文,Decoder-only Transformer架构,Patch分词,Monash基准测试击败监督模型
时间序列
机器学习
Google
Transformer
SubCube 深度实战:亚二次稀疏注意力 SSA 如何打破 Transformer 的 O(n²) 铁律——1200万 Token 时代从架构原理到生产级部署的完全指南(2026)
编程
SubCube 深度实战:亚二次稀疏注意力 SSA 如何打破 Transformer 的 O(n²) 铁律——1200万 Token 时代从架构原理到生产级部署的完全指南(2026)
2026-05-31 08:21:47 +0800 CST
view 730
Subquadratic发布的SubQ模型采用SSA亚二次稀疏注意力架构,实现1200万Token上下文窗口,在MRCR v2基准测试中碾压GPT-5.5。本文从架构原理、基准分析、代码实战到生产部署全面解读这场注意力革命。
SSA
Subquadratic
SubQ
Transformer
注意力机制
长上下文
RAG
稀疏注意力
AI架构
大模型
LiteRT.js 深度解析:Google 为什么要在 2026 年"革"掉 TensorFlow.js 的命?
编程
LiteRT.js 深度解析:Google 为什么要在 2026 年"革"掉 TensorFlow.js 的命?
2026-07-10 12:18:19 +0800 CST
view 456
2026年7月9日Google发布LiteRT.js取代TensorFlow.js,WebGPU+WebNN+WebAssembly三剑合璧带来3倍性能提升。本文深度剖析底层架构、与TensorFlow.js的全面对比、生产级代码示例及性能调优实战。
LiteRT.js
TensorFlow.js
WebGPU
WebNN
WebAssembly
浏览器AI
前端机器学习
性能优化
MIT黑科技:TriAttention如何用三角函数让大模型「记住」超长上下文
编程
MIT黑科技:TriAttention如何用三角函数让大模型「记住」超长上下文
2026-04-18 12:45:10 +0800 CST
view 1042
深度解析MIT/NVIDIA/浙大联合发布的TriAttention技术,用三角函数预测注意力分布,实现KV Cache智能压缩,让超长上下文推理成为可能
大模型
注意力机制
KV缓存
Transformer
深度学习
AI优化
MCP 协议深度实战:AI Agent 的万能连接器——从架构设计到生产级 Server 开发的全链路解析
编程
MCP 协议深度实战:AI Agent 的万能连接器——从架构设计到生产级 Server 开发的全链路解析
2026-05-08 14:38:40 +0800 CST
view 701
深入剖析 Anthropic 开源的 Model Context Protocol(MCP)协议,从设计哲学到架构细节,从协议握手到生产级 Server 开发实战,配完整 Python 代码示例。
MCP
Model Context Protocol
JSON-RPC 2.0
AI Agent
AI编程
FastMCP
工具协议
Python
Anthropic
Claude
连接器
Moltis 深度拆解:当 Rust 决定「把个人 AI Agent 做成一个二进制文件」——从零依赖部署到容器级沙箱,一个 MIT 开源的持久化 Agent 服务器如何用「单二进制 + Rust 所有权安全」重新定义本地 AI 助手的终极形态
编程
Moltis 深度拆解:当 Rust 决定「把个人 AI Agent 做成一个二进制文件」——从零依赖部署到容器级沙箱,一个 MIT 开源的持久化 Agent 服务器如何用「单二进制 + Rust 所有权安全」重新定义本地 AI 助手的终极形态
2026-08-06 04:17:33 +0800 CST
view 187
深度拆解Moltis:Rust编写的持久化个人AI Agent服务器,单二进制部署、容器级沙箱隔离、零化内存密钥处理、混合搜索记忆系统,重新定义本地AI助手的安全与性能
Moltis
Rust
AI Agent
个人AI助手
沙箱
内存安全
单二进制
Apple Container
WASM
持久化Agent
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
...
15
16
17
18
19
...
130
下一页