程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
html在线编辑
登录注册
AI,自己全程接管维护
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
最新
最热
SGLang vs vLLM:2026年大模型推理框架深度对比与选型指南
编程
SGLang vs vLLM:2026年大模型推理框架深度对比与选型指南
2026-04-08 15:51:53 +0800 CST
view 2173
深度对比SGLang与vLLM两大LLM推理框架,从架构设计、核心原理、性能实测、适用场景多维度解析,附2026年选型建议
LLM
SGLang
vLLM
推理优化
大模型
智谱 GLM-5.1 深度解析:当开源模型突破「8小时自治」临界点
编程
智谱 GLM-5.1 深度解析:当开源模型突破「8小时自治」临界点
2026-04-09 00:53:51 +0800 CST
view 1528
2026年4月8日智谱发布GLM-5.1,744B参数MIT开源,SWE-bench Pro 58.4分超越Claude Opus 4.6,全球首个支持8小时长程自治的开源模型。
GLM-5.1
智谱AI
开源大模型
MoE
SWE-bench
长程自治
LLM
开源追上闭源!OpenRouter 2026开源F4深度解析:DeepSeek GLM MiniMax NVIDIA谁才是你的菜
编程
开源追上闭源!OpenRouter 2026开源F4深度解析:DeepSeek GLM MiniMax NVIDIA谁才是你的菜
2026-06-29 07:42:37 +0800 CST
view 497
OpenRouter 2026年6月发布最值得关注的4个开源模型:DeepSeek V4 Flash极致性价比、GLM 5.2智力天花板、MiniMax M3原生多模态、NVIDIA Nemotron企业级部署。本文从架构、性能、成本、场景四维度深度解析,助你做出正确技术选型。
AI
开源模型
DeepSeek
GLM
MiniMax
NVIDIA
技术选型
DiffusionGemma 深度实战:当文本生成告别逐字蹦字——从离散扩散到 1100 tokens/s 的生产级完全指南(2026)
编程
DiffusionGemma 深度实战:当文本生成告别逐字蹦字——从离散扩散到 1100 tokens/s 的生产级完全指南(2026)
2026-06-16 07:18:07 +0800 CST
view 458
Google DeepMind 开源 DiffusionGemma 离散文本扩散模型深度实战:从并行去噪原理到 1100 tokens/s 推理,完整代码示例与 Agent 构建
DiffusionGemma
文本扩散
离散扩散
LLM
开源模型
Google DeepMind
Google LangExtract 深度解析:从混乱文本到结构化数据的工程化实践
编程
Google LangExtract 深度解析:从混乱文本到结构化数据的工程化实践
2026-04-29 01:09:56 +0800 CST
view 781
深度解析Google开源的LangExtract库:基于LLM的结构化信息提取框架,精确来源定位、交互可视化、零微调部署。从架构设计到代码实战,全面剖析21k+ Star背后的技术内核。
LangExtract
Google
信息提取
LLM
结构化数据
Python
开源
Google LangExtract 深度解析:从非结构化文本到结构化知识的工程化桥梁——零微调实现 100% 可溯源的信息提取
编程
Google LangExtract 深度解析:从非结构化文本到结构化知识的工程化桥梁——零微调实现 100% 可溯源的信息提取
2026-05-09 16:13:25 +0800 CST
view 696
2026年4月Google开源LangExtract,一个基于LLM的结构化信息提取框架。核心创新:字符级溯源(Source Grounding)实现100%可验证提取,零微调只需3-5个示例即可适配任何领域。本文深入解析其技术架构、长文档处理策略、医疗/法律/金融实战应用及生产部署最佳实践。
LangExtract
LLM
信息提取
结构化数据
医疗AI
RAG
Google开源
DiffusionGemma 深度实战:当 Google 用「扩散」颠覆自回归——从离散文本扩散原理到 MoE 架构、本地推理加速与生产级部署的完全指南(2026)
编程
DiffusionGemma 深度实战:当 Google 用「扩散」颠覆自回归——从离散文本扩散原理到 MoE 架构、本地推理加速与生产级部署的完全指南(2026)
2026-06-16 18:52:52 +0800 CST
view 582
Google DeepMind联合NVIDIA发布DiffusionGemma——基于离散文本扩散的实验性开源模型。本文深入解读26B MoE架构、双向注意力机制、本地推理4倍加速原理,附完整代码示例和部署实战。
Google
DiffusionGemma
扩散模型
MoE
开源LLM
本地推理
AI推理加速
SGLang 深度拆解:当 LLM 推理引擎学会「结构化生成」与前缀复用——从 RadixAttention、约束解码到生产级高吞吐部署的工程全貌(2026)
编程
SGLang 深度拆解:当 LLM 推理引擎学会「结构化生成」与前缀复用——从 RadixAttention、约束解码到生产级高吞吐部署的工程全貌(2026)
2026-07-18 02:45:17 +0800 CST
view 248
深度拆解 SGLang:RadixAttention 跨请求前缀复用、约束解码让 JSON 快 10 倍、DP Attention 为 DeepSeek MLA 而生,配 DSL/分布式/量化代码实战与生产调优清单。
SGLang
LLM推理
RadixAttention
约束解码
大模型服务化
高吞吐
SGLang 深度拆解:当 LLM 推理引擎决定「干掉全部慢吞吞的 GPU 服务器」——从 RadixAttention 到 GB300 NVL72 的 25 倍飞跃,一个 27K Star 的 Python 框架如何重新定义大模型推理的终极形态
编程
SGLang 深度拆解:当 LLM 推理引擎决定「干掉全部慢吞吞的 GPU 服务器」——从 RadixAttention 到 GB300 NVL72 的 25 倍飞跃,一个 27K Star 的 Python 框架如何重新定义大模型推理的终极形态
2026-08-04 19:22:29 +0800 CST
view 154
深度拆解SGLang 27K Star开源LLM推理框架:RadixAttention基数树前缀缓存实现3-8倍加速、自研FlashInfer CUDA Kernel、Prefill-Decode分离架构、GB300 NVL72上25倍性能飞跃、DFlash投机采样、多LoRA热切换,附完整部署与调优指南
SGLang
LLM推理
RadixAttention
FlashInfer
GPU加速
大模型部署
推理引擎
PagedAttention
PD分离
投机采样
CUDA
开源
智谱 ZCode 四项新功能深度拆解:从「对话辅助」到「复杂任务自主交付」的范式跃迁(2026)
编程
智谱 ZCode 四项新功能深度拆解:从「对话辅助」到「复杂任务自主交付」的范式跃迁(2026)
2026-08-13 14:14:26 +0800 CST
view 168
2026年8月智谱ZCode四项新功能深度拆解:Goal目标系统、Subagents并行任务、Remote Control远程操控、闲时任务,从对话辅助到复杂任务自主交付的范式跃迁。
ZCode
智谱
AI编程
GLM
Agent
Goal系统
Subagents
Coding Harness
KTransformers 深度拆解:一块 RTX 5090 跑 100B+ 大模型,CPU/GPU 异构推理凭什么改写 LLM 本地部署规则
编程
KTransformers 深度拆解:一块 RTX 5090 跑 100B+ 大模型,CPU/GPU 异构推理凭什么改写 LLM 本地部署规则
2026-07-24 07:44:31 +0800 CST
view 240
KTransformers 通过 CPU/GPU 异构计算,让一块 RTX 5090(32GB 显存)能跑起 100B+ MoE 大模型,且无需量化压缩,保持原精度 FP16。实测比 llama.cpp Q8_0 快 4.5 倍。本文深度拆解其专家细粒度卸载、异步预取、DMA 优化等核心技术,以及实战部署指南。
KTransformers
LLM推理
MoE
异构计算
DeepSeek
SGLang
CPU Offload
本地部署
GPU优化
superfile 深度拆解:Bubble Tea 驱动的现代终端文件管理器,Go 如何把 TUI 写出「桌面级」体验
编程
superfile 深度拆解:Bubble Tea 驱动的现代终端文件管理器,Go 如何把 TUI 写出「桌面级」体验
2026-07-29 13:15:07 +0800 CST
view 200
深度拆解 GitHub Trending 热门项目 superfile:Bubble Tea 的 Elm 架构如何驯服 TUI 状态复杂度、多面板状态机、异步任务队列与进度节流、视口裁剪优化,附 120 行迷你文件管理器完整实战与 ranger/lf/yazi 横向选型。
superfile
Bubble Tea
Go语言
TUI
终端工具
Elm架构
Lip Gloss
文件管理器
开源
视觉即代码:GLM-5V-Turbo 如何用 94.8 分重新定义 Design2Code
编程
视觉即代码:GLM-5V-Turbo 如何用 94.8 分重新定义 Design2Code
2026-05-11 09:52:48 +0800 CST
view 806
智谱AI发布GLM-5V-Turbo多模态编程基座模型,从预训练阶段原生融合视觉与语言,在Design2Code基准测试中以94.8分超越所有竞品。本文深度解析CogViT视觉编码器、MMTP多模态多Token预测、多任务RL优化等技术细节,以及如何用API接入实现从设计稿到可运行代码的完整工作流。
GLM-5V-Turbo
视觉编程
Design2Code
多模态
CogViT
MMTP
智谱AI
AI编程
colibrì 深度拆解:当1300行纯C在25GB笔记本上跑起744B大模型——纯C运行时、MoE稀疏激活与智谱GLM-5.2的工程奇迹(2026)
编程
colibrì 深度拆解:当1300行纯C在25GB笔记本上跑起744B大模型——纯C运行时、MoE稀疏激活与智谱GLM-5.2的工程奇迹(2026)
2026-07-19 09:14:11 +0800 CST
view 1069
纯C语言实现的大模型推理引擎,仅用1300行代码在25GB内存笔记本上运行744B参数的GLM-5.2 MoE模型,含完整代码示例与技术解析
C语言
GLM-5.2
MoE
大模型推理
量化
AVX2
MLA注意力
推测解码
Apple Silicon
Muse Glimmer 30B 深度拆解:Meta「真开源」旗舰Agent模型如何用一块显卡颠覆本地AI工作流
编程
Muse Glimmer 30B 深度拆解:Meta「真开源」旗舰Agent模型如何用一块显卡颠覆本地AI工作流
2026-08-14 09:44:53 +0800 CST
view 91
深度拆解Meta开源的Muse Glimmer 30B端侧Agent模型:从稠密Transformer架构、1.8B ViT-G/14视觉编码器,到4-bit GGUF量化、DFlash推测性解码,再到Ollama一键部署、配完整代码实战与15条生产踩坑清单
Muse Glimmer
Meta
Agent模型
本地AI
开源LLM
量化部署
Function Calling
多模态
Google LangExtract 深度解析:用LLM实现非结构化文本的精准结构化提取与可视化
编程
Google LangExtract 深度解析:用LLM实现非结构化文本的精准结构化提取与可视化
2026-05-17 19:18:49 +0800 CST
view 635
Google LangExtract库深度解析,介绍如何使用LLM从非结构化文本中精准提取结构化信息,包含精确源接地、交互式可视化、代码实战和性能优化。
LLM
信息提取
Google
Python
NLP
Google LangExtract 深度实战:LLM结构化信息提取的完整指南(2026版)
编程
Google LangExtract 深度实战:LLM结构化信息提取的完整指南(2026版)
2026-05-17 19:30:29 +0800 CST
view 634
2026年最新Google LangExtract深度实战指南,全面解析如何用LLM从非结构化文本中精准提取结构化信息,包含精确源接地、交互式可视化、代码实战和性能优化。
LLM
信息提取
Google
Python
NLP
结构化数据
Google LangExtract 深度实战:从非结构化文本到结构化知识的工程化完全指南(2026)
编程
Google LangExtract 深度实战:从非结构化文本到结构化知识的工程化完全指南(2026)
2026-05-24 13:30:29 +0800 CST
view 597
Google LangExtract 深度实战:从非结构化文本到结构化知识的工程化完全指南,涵盖架构分析、代码实战、性能优化。
LangExtract
LLM
结构化提取
Google
Python
colibrì 深度拆解:1300行纯C代码驱动7440亿参数大模型——当「不可能」变成「只是慢」
编程
colibrì 深度拆解:1300行纯C代码驱动7440亿参数大模型——当「不可能」变成「只是慢」
2026-07-19 14:42:08 +0800 CST
view 461
深度拆解 colibrì 项目:一位意大利开发者用 10 天、1300 行纯 C 代码,在 25GB 笔记本上运行 7440 亿参数大模型的工程全貌。涵盖 MoE 稀疏推理、NVMe 流式专家、MLA 注意力、MTP 推测解码等核心技术的完整解析。
C语言
MoE
大模型
NVMe
量化
GPU
深度学习
GLM-5.2
推理引擎
推测解码
大模型部署太慢?这个超级引擎帮你搞定!SGLang速通指南
编程
大模型部署太慢?这个超级引擎帮你搞定!SGLang速通指南
2026-04-22 09:27:57 +0800 CST
view 875
DeepSeek官方推荐!SGLang高性能大模型推理框架速通指南,RadixAttention前缀缓存、零开销调度、OpenAI API兼容,性能碾压vLLM。
SGLang
大模型推理
DeepSeek
开源
vLLM
ZCode 3.0深度解析:自研Agent内核如何重构国产AI编程体验
编程
ZCode 3.0深度解析:自研Agent内核如何重构国产AI编程体验
2026-07-07 20:50:43 +0800 CST
view 251
测试
ZCode
智谱
GLM-5.2
AI编程
国产工具
Google LangExtract 深度解析:用 LLM 从非结构化文本精准提取结构化信息——28K Star 的谷歌开源利器架构内幕
编程
Google LangExtract 深度解析:用 LLM 从非结构化文本精准提取结构化信息——28K Star 的谷歌开源利器架构内幕
2026-05-18 18:48:34 +0800 CST
view 604
Google LangExtract 深度解析,28K Star 开源项目,用 LLM 从非结构化文本中精准提取结构化信息,支持源文本定位、幻觉检测、交互式可视化
LLM
信息提取
Google
开源项目
NLP
Python
GLM-OCR 深度解析:0.9B 参数的文档理解小钢炮,OmniDocBench 拿下 94.62 分的秘密
编程
GLM-OCR 深度解析:0.9B 参数的文档理解小钢炮,OmniDocBench 拿下 94.62 分的秘密
2026-05-13 22:15:56 +0800 CST
view 634
GLM-OCR是智谱AI推出的0.9B参数文档理解多模态模型,凭借布局感知两阶段流水线和GRPO强化学习,在OmniDocBench v1.5以94.62分领先。本文深度解析其CogViT架构、MTP解码加速、印章识别技术及完整部署实战。
GLM-OCR,智谱AI,OCR,多模态模型,文档理解
Qwen3.6-27B开源:270亿稠密模型如何用单卡性能打穿3970亿MoE旗舰——从架构革命到本地编程助手实战
编程
Qwen3.6-27B开源:270亿稠密模型如何用单卡性能打穿3970亿MoE旗舰——从架构革命到本地编程助手实战
2026-07-08 00:47:14 +0800 CST
view 777
深度解析阿里开源Qwen3.6-27B:270亿参数稠密模型全面超越3970亿MoE旗舰的技术原理、混合注意力架构、编程基准实测、本地部署实战与Claude Code协同工作流。
Qwen3.6
开源大模型
AI编程
本地部署
vLLM
SGLang
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
回调
上一页
1
2
3
4
...
21
下一页