程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
推理 相关技术文章
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
走进 vLLM:一个请求从 API 到 GPU 执行的完整路径
编程
走进 vLLM:一个请求从 API 到 GPU 执行的完整路径
2026-09-07 21:11:16
基于 vLLM 0.22.0 的源码走查:LLM.generate 到 EngineCore 的进程边界、预算型调度、输入展平、paged KV-cache 访问与持续批处理循环,附延迟排查实践要点。
AI
vLLM
推理
性能
Claude Fable 5 与 Opus 4.8:2026 年完整指南
编程
Claude Fable 5 与 Opus 4.8:2026 年完整指南
2026-09-06 02:13:04
Claude Fable 5自2026年6月发布以来成为软件工程团队讨论焦点,被认为是Anthropic最强大的推理引擎。文章详细介绍了Fable 5的核心能力(深度推理/长上下文/工具使用和Agent/代码生成)、技术特点和适用场景,Opus 4.8的核心能力和适用场景,两者的关键差异对比和选择建议,以及使用最佳实践(提示词优化/长上下文使用/工具使用/成本优化)。
Claude
Anthropic
Fable 5
Opus 4.8
大模型
AI
推理
LLM
Tree of Thoughts 与 MCTS 在 LLM 中的应用:当模型不再只猜一次时会发生什么
编程
Tree of Thoughts 与 MCTS 在 LLM 中的应用:当模型不再只猜一次时会发生什么
2026-09-06 02:13:03
传统LLM推理是让模型一次性猜答案,而Tree of Thoughts和MCTS让模型能探索多条推理路径、评估中间结果、选择最优路径。文章详细介绍了ToT的核心思想(思维分解/生成/评估/搜索)、MCTS的四个步骤(选择/扩展/模拟/回溯)、两者的区别和结合方式、实际应用场景(数学推理/代码生成/规划决策/科学发现),以及实现挑战和注意事项。
Tree of Thoughts
MCTS
LLM
推理
蒙特卡洛树搜索
AI
大模型
提示工程
编程
airllm:4GB 显存跑 70B 模型的分层加载方案
2026-08-30 19:53:38
介绍 airllm 的分层加载方案:不靠量化蒸馏,把权重按层在 CPU/GPU 间倒腾,4GB 显存即可推理 70B 模型。讲清原理、适用场景与取舍。
airllm
大模型
推理
显存优化
腾讯混元 Hy3 preview 开源:295B 参数、推理提效 40%,姚顺雨首秀交卷
资讯
腾讯混元 Hy3 preview 开源:295B 参数、推理提效 40%,姚顺雨首秀交卷
2026-04-23 21:18:45
2026年4月23日,腾讯发布并开源新一代大模型混元Hy3preview,总参数295B、激活参数21B的MoE架构,支持256K超长上下文,推理效率提升40%,API最低1.2元/百万tokens。在复杂推理、代码与Agent能力上表现突出,接近GPT-5.4级别,数学推理创国内最高纪录。已接入腾讯云、元宝等多条产品线,并上架TokenHub。
人工智能
大模型
腾讯
开源
MoE
推理
代码生成
Agent
云计算
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
python
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调