程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
MoE 相关技术文章(第3页)
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
Claude Fable 5深度解析:Anthropic"神话级"模型的编程能力实测与技术架构
编程
Claude Fable 5深度解析:Anthropic"神话级"模型的编程能力实测与技术架构
2026-07-07 21:13:57
Claude Fable 5是Anthropic史上第一个面向公众的Mythos级模型,在SWE-bench Verified上创下95%的最高分记录。本文深度解析其自适应思考机制、百万Token上下文、128K输出等技术架构,以及与Opus 4.8的选型对比和开发者选型指南。
Claude Fable 5
Anthropic
AI编程
模型评测
SWE-bench
MoE
美团 LongCat-2.0 深度解析:1.6 万亿参数 MoE 大模型如何在五万卡国产算力上跑通全流程——从 LSA 稀疏注意力到 MOPD 多类型专家架构的完整技术剖析
编程
美团 LongCat-2.0 深度解析:1.6 万亿参数 MoE 大模型如何在五万卡国产算力上跑通全流程——从 LSA 稀疏注意力到 MOPD 多类型专家架构的完整技术剖析
2026-07-07 10:14:22
深度解析美团LongCat-2.0万亿参数MoE大模型:1.6T总参数/48B激活、LSA稀疏注意力实现1M原生上下文、N-gram Embedding 135B参数强化代码理解、MOPD三类专家动态调度、五万卡国产算力全流程训练。SWE-bench Pro 59.5超GPT-5.5,从架构原理到生产级实战的完整技术剖析。
LongCat-2.0
美团
MoE
大模型
国产算力
LSA
稀疏注意力
N-gram Embedding
MOPD
开源
LongCat-2.0 深度解析:美团万亿参数 MoE 大模型如何用国产算力 + LSA 稀疏注意力 + 零计算专家打造 Agentic Coding 王者——从架构原理到生产级实战的完整指南
编程
LongCat-2.0 深度解析:美团万亿参数 MoE 大模型如何用国产算力 + LSA 稀疏注意力 + 零计算专家打造 Agentic Coding 王者——从架构原理到生产级实战的完整指南
2026-07-07 00:13:46
深度解析美团开源的LongCat-2.0万亿参数MoE大模型:50K国产卡全流程训练、LSA稀疏注意力实现1M超长上下文、零计算专家动态激活33B-56B、MOPD多专家融合、SWE-bench Pro 59.5超越GPT-5.5。从架构原理到生产级实战的完整指南。
LongCat-2.0
美团
MoE
万亿参数
国产算力
LSA稀疏注意力
Agentic Coding
开源大模型
Kimi K2.7 Code 深度解析:万亿参数 MoE 编程模型如何用 MLA 注意力和反过度思考机制成为 GitHub Copilot 首个开源模型——从架构设计到生产部署的完整实战指南
编程
Kimi K2.7 Code 深度解析:万亿参数 MoE 编程模型如何用 MLA 注意力和反过度思考机制成为 GitHub Copilot 首个开源模型——从架构设计到生产部署的完整实战指南
2026-07-06 12:13:00
深度解析月之暗面Kimi K2.7 Code:1.1万亿参数MoE架构、MLA多头潜在注意力、384专家动态路由、token消耗降30%、MCP Mark Verified 81.1分反超Opus 4.8。GitHub Copilot首个开源模型,含完整API接入与本地部署实战。
Kimi K2.7 Code
MoE
MLA
GitHub Copilot
开源模型
编程模型
月之暗面
Moonshot AI
LongCat-2.0 深度解析:美团万亿参数大模型如何用「零计算专家」和「稀疏注意力」在国产算力上跑出 SWE-bench Pro 59.5 分——从架构设计到 API 接入的完整实战指南
编程
LongCat-2.0 深度解析:美团万亿参数大模型如何用「零计算专家」和「稀疏注意力」在国产算力上跑出 SWE-bench Pro 59.5 分——从架构设计到 API 接入的完整实战指南
2026-07-06 11:44:38
深度解析美团开源LongCat-2.0万亿参数大模型:MoE架构1.6T参数/48B激活、LongCat稀疏注意力(LSA)实现1M上下文、零计算专家动态激活、MOPD多专家融合、五万卡国产算力全流程训练、SWE-bench Pro 59.5超越GPT-5.5。含完整API接入代码实战。
LongCat
美团
大模型
MoE
稀疏注意力
国产算力
Agentic Coding
开源
Kimi K2.7 Code 接入 GitHub Copilot:开源代码模型的里程碑时刻
编程
Kimi K2.7 Code 接入 GitHub Copilot:开源代码模型的里程碑时刻
2026-07-05 13:12:17
GitHub Copilot首次接入开源模型Kimi K2.7 Code的技术深度解析,从MoE架构、MLA注意力机制、性能基准到实战体验和私有化部署方案,全面拆解这一里程碑事件对开发者的意义。
Kimi K2.7 Code
GitHub Copilot
开源模型
MoE
AI编程
代码模型
月之暗面
DeepSeek V4 深度解析:DSA 稀疏注意力与 mHC 流形约束——百万上下文普惠化的技术革命(2026)
编程
DeepSeek V4 深度解析:DSA 稀疏注意力与 mHC 流形约束——百万上下文普惠化的技术革命(2026)
2026-07-04 06:44:28
2026年4月DeepSeek V4发布,开创百万上下文普惠化时代。深度解析DSA稀疏注意力、mHC流形约束、Muon优化器三大技术创新,含完整代码实战与部署指南。
DeepSeek V4
大模型
MoE
稀疏注意力
长上下文
DSA
mHC
GitHub Copilot 首次接入开源模型 Kimi K2.7 Code:从 MoE 架构到私有化部署的完整技术解析
编程
GitHub Copilot 首次接入开源模型 Kimi K2.7 Code:从 MoE 架构到私有化部署的完整技术解析
2026-07-03 14:13:50
2026年7月3日,GitHub Copilot首次接入开源模型Kimi K2.7 Code。万字深度解析MoE架构、MLA注意力机制、30% Token优化技术原理、Copilot集成方案、私有化部署实战与成本分析。
Kimi K2.7 Code
GitHub Copilot
MoE
开源模型
AI编程
MoonshotAI
vLLM
模型部署
万字深度解析百度 Unlimited OCR:当长文档解析遇见 R-SWA 革命——从常数级 KV Cache 到 40 页一次性识别的完整技术指南(2026)
编程
万字深度解析百度 Unlimited OCR:当长文档解析遇见 R-SWA 革命——从常数级 KV Cache 到 40 页一次性识别的完整技术指南(2026)
2026-07-02 18:16:20
深度解析百度 Unlimited OCR 的 R-SWA 参考滑动窗口注意力机制,将 KV Cache 从线性增长压至常数级;3B MoE 解码器架构、DeepEncoder 视觉编码器;完整本地部署代码、KV Cache 监控脚本与 SGLang 生产推理优化指南。OmniDocBench v1.6 综合得分 93.92%,端到端 OCR 新 SOTA。
OCR
R-SWA
KV Cache
MoE
百度
长文档解析
Transformer
深度学习
Python
性能优化
R-SWA如何让OCR「过目不忘」:百度Unlimited-OCR的KV缓存革命与40页长文档解析实战(2026)
编程
R-SWA如何让OCR「过目不忘」:百度Unlimited-OCR的KV缓存革命与40页长文档解析实战(2026)
2026-07-02 10:47:12
深度解析百度2026年开源的Unlimited-OCR模型:3B参数的端到端OCR系统,R-SWA机制实现常数级KV缓存,OmniDocBench 93.92% SOTA评分,可一口气解析40页文档
Unlimited-OCR
百度
OCR
R-SWA
MoE
CLIP
端到端
长文档处理
深度学习
多模态
万字深度解析百度 Unlimited-OCR:当端到端OCR遇见R-SWA革命,从逐页失忆到40页文档一口气解析(2026)
编程
万字深度解析百度 Unlimited-OCR:当端到端OCR遇见R-SWA革命,从逐页失忆到40页文档一口气解析(2026)
2026-07-02 10:46:07
深度解析百度2026年开源的Unlimited-OCR模型:3B参数的端到端OCR系统,R-SWA机制实现常数级KV缓存,OmniDocBench 93.92% SOTA评分,可一口气解析40页文档
Unlimited-OCR
百度
OCR
R-SWA
MoE
CLIP
端到端
长文档处理
深度学习
多模态
万字深度解析 DeepSeek V4:当 1.6T 开源模型遇见「架构效率革命」——从 mHC 稳压机制到 CSA/HCA 稀疏注意力、从 FP4 量化到 Muon 优化器的完整技术指南(2026)
编程
万字深度解析 DeepSeek V4:当 1.6T 开源模型遇见「架构效率革命」——从 mHC 稳压机制到 CSA/HCA 稀疏注意力、从 FP4 量化到 Muon 优化器的完整技术指南(2026)
2026-07-02 06:43:56
DeepSeek V4 技术架构深度解析:从 mHC 流形约束超连接、CSA/HCA 混合稀疏注意力、FP4 量化感知训练到 Muon 优化器,完整拆解 1.6T 开源模型如何用架构创新把 1M token 推理效率提升到 V3.2 的 10%。
DeepSeek V4
大模型架构
MoE
CSA/HCA 注意力
FP4 量化
mHC
AI 开源
长上下文
万字深度解析百度 Unlimited OCR:当 R-SWA 注意力机制让端到端 OCR 一次性解析数十页文档——从架构设计到生产级部署完整指南(2026)
编程
万字深度解析百度 Unlimited OCR:当 R-SWA 注意力机制让端到端 OCR 一次性解析数十页文档——从架构设计到生产级部署完整指南(2026)
2026-07-01 15:43:34
2026年6月百度开源Unlimited OCR深度解析:R-SWA参考滑动窗口注意力机制将KV Cache压为常数,3B参数(500M激活)在OmniDocBench以93.92%刷新SOTA,单次解析40+页文档。从架构设计到生产级部署完整技术指南。
Unlimited-OCR
R-SWA
百度
端到端OCR
大模型
MoE
DeepEncoder
性能优化
开源项目
Python
万字深度解析百度 Unlimited OCR:当 R-SWA 遇见 MoE——3B 参数如何碾压端到端 OCR 全场(2026)
编程
万字深度解析百度 Unlimited OCR:当 R-SWA 遇见 MoE——3B 参数如何碾压端到端 OCR 全场(2026)
2026-07-01 03:42:17
2026年6月百度开源Unlimited OCR,5天GitHub Star破万。深度解析R-SWA注意力机制、MoE架构、16倍视觉Token压缩,以及为何能将KV Cache从线性增长压成常数。
Unlimited OCR
OCR
R-SWA
MoE
百度
深度学习
计算机视觉
文档识别
KV Cache
百度 Unlimited-OCR 深度解析:R-SWA 注意力机制如何用 3B 参数打爆百亿模型
编程
百度 Unlimited-OCR 深度解析:R-SWA 注意力机制如何用 3B 参数打爆百亿模型
2026-06-30 16:16:03
2026年6月百度开源Unlimited-OCR深度解析:R-SWA参考滑动窗口注意力机制将KV Cache从线性增长压成常数,3B MoE模型用500M激活参数在OmniDocBench上以93.92%总分刷新SOTA,打爆Qwen3-VL 72B和Gemini 2.5 Pro。万字长文从架构原理到代码实战全覆盖。
Unlimited-OCR
端到端OCR
R-SWA
百度
注意力机制
大模型
MoE
深度学习
AI开源
文档解析
DeepSeek V4 Flash 深度解析:开源大模型的 Agent 时代新范式
编程
DeepSeek V4 Flash 深度解析:开源大模型的 Agent 时代新范式
2026-06-30 09:16:27
深度解析 DeepSeek V4 Flash 的 Ultra-MoE、CSA+HCA 混合注意力、mHC 流形约束、Engram 条件记忆四大架构创新,以及 DSpark 投机解码带来的 60-85% 推理加速。涵盖 SWE-bench 79% 性能分析、API 调用实战与部署方案。
DeepSeek
V4 Flash
MoE
开源大模型
AI Agent
DeepSeek V4 Flash 深度解析:284B总参、13B激活的MoE开源模型,凭什么成为2026年度「性价比之王」?
编程
DeepSeek V4 Flash 深度解析:284B总参、13B激活的MoE开源模型,凭什么成为2026年度「性价比之王」?
2026-06-29 22:12:39
深度解析DeepSeek V4 Flash架构:CSA/HCA混合注意力、MoE细粒度路由、DSpark推测解码技术,附完整部署代码与Benchmark对比
DeepSeek
V4
MoE
开源模型
AI推理
DSpark
CSA
大模型
百度 Unlimited OCR 深度解析:R-SWA 把 KV Cache 压成常数,长文档 OCR 终于迎来「一次看完」时代
编程
百度 Unlimited OCR 深度解析:R-SWA 把 KV Cache 压成常数,长文档 OCR 终于迎来「一次看完」时代
2026-06-29 15:13:32
百度 Unlimited OCR 用 R-SWA 机制把 KV Cache 压成常数,首次实现 40+ 页文档单次前向解析。深度解析 R-SWA 原理、模型架构、性能基准与实战部署。
百度
Unlimited OCR
OCR
R-SWA
KV Cache
长文档
端到端OCR
DeepEncoder
MoE
参考滑动窗口注意力
百度 Unlimited OCR 深度解析:R-SWA 如何让长文档 OCR 从"逐页煎熬"走向"一次搞定"
编程
百度 Unlimited OCR 深度解析:R-SWA 如何让长文档 OCR 从"逐页煎熬"走向"一次搞定"
2026-06-28 14:13:06
深度解析百度 Unlimited OCR 的 R-SWA 参考滑动窗口注意力机制,如何将 KV Cache 从线性增长压到常数,使长文档 OCR 性能恒定不衰减。含完整架构分析、训练配方、性能基准和实战代码。
Unlimited OCR
R-SWA
OCR
端到端
百度
文档识别
KV Cache
MoE
DeepEncoder
长文档处理
百度 Unlimited OCR 深度实战:30亿参数仅激活5亿、R-SWA注意力革命——长文档OCR端到端SOTA完全指南(2026)
编程
百度 Unlimited OCR 深度实战:30亿参数仅激活5亿、R-SWA注意力革命——长文档OCR端到端SOTA完全指南(2026)
2026-06-28 06:43:54
百度2026年6月开源Unlimited OCR:30亿参数仅激活5亿,R-SWA注意力把KV Cache压成常数,一次前向推理处理几十页文档,OmniDocBench v1.6得分93.92%刷新SOTA。
百度 Unlimited OCR
OCR
R-SWA
长文档
端到端
MoE
SGLang
GLM-5.2 深度解析:百万上下文 + 异步Agent RL + MIT开源,国产大模型里程碑级突破
编程
GLM-5.2 深度解析:百万上下文 + 异步Agent RL + MIT开源,国产大模型里程碑级突破
2026-06-27 18:46:30
智谱AI发布GLM-5.2旗舰开源大模型:744B MoE架构+40B激活参数、1M百万Token稳定上下文、异步Agent RL训练、IndexShare稀疏注意力将计算量降低2.9倍。SWE-bench Pro编程能力超越GPT-5.5,MIT协议完全开源。本文深度解析其技术架构、训练方法、性能评测与生产实践。
GLM-5.2
Z.ai
开源大模型
MoE
异步Agent RL
百万上下文
MIT协议
百度 Unlimited OCR 深度解读:R-SWA 如何将 KV Cache 压成常数,5天 GitHub Star 破万的端到端 OCR 新范式
编程
百度 Unlimited OCR 深度解读:R-SWA 如何将 KV Cache 压成常数,5天 GitHub Star 破万的端到端 OCR 新范式
2026-06-27 09:15:20
百度开源 Unlimited OCR,5天 GitHub Star 破万。本文深度解析其核心创新 R-SWA(Reference Sliding Window Attention),如何将解码器 KV Cache 从线性增长压成常数,OmniDocBench v1.6 刷榜 SOTA(93.92%),30B 总参/5B 激活,32K 超长上下文,一次前向全稿转录,附完整代码实战。
Unlimited OCR
R-SWA
KV Cache
MoE
端到端 OCR
百度
深度学习
Transformer
文档识别
OCR
百度 Unlimited OCR 深度实战:告别「越生成越慢」,一次性解析整本书的 OCR 革命
编程
百度 Unlimited OCR 深度实战:告别「越生成越慢」,一次性解析整本书的 OCR 革命
2026-06-27 02:13:37
深度解析百度2026年6月开源的Unlimited OCR模型,介绍其R-SWA机制如何解决长文档OCR的KV cache线性增长问题,包含完整实战代码和性能优化技巧。
Unlimited OCR
百度
OCR
深度学习
MoE
R-SWA
长文档解析
微软Build 2026震撼发布:7款MAI自研模型全解析——从"OpenAI金主"到"模型自研商"的战略革命
编程
微软Build 2026震撼发布:7款MAI自研模型全解析——从"OpenAI金主"到"模型自研商"的战略革命
2026-06-26 19:44:06
深度解析微软在Build 2026发布的7款MAI自研模型:从MAI-Thinking-1的MoE架构创新到MAI-Orion的性能怪兽,从"不蒸馏"训练哲学到成本直降10倍的商业逻辑,万字长文带你读懂微软AI战略的惊险跳跃。
MAI
微软
Build2026
MoE
自研模型
AI战略
Azure
推理模型
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
python
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
上一页
1
2
3
4
下一页
共 4 页
到第
页
确定