程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
评测 相关技术文章
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
当裁判无法裁决:LLM 评测里被跳过的无法判定桶
编程
当裁判无法裁决:LLM 评测里被跳过的无法判定桶
2026-09-08 04:10:35
Cauterule 现场测试 1538 个候选里 52.9% 无法判定:评测报告跳过 inconclusive 桶就是忽略一半以上数据,付费云模型反而最难打分。
AI
评测
开源
agent
推理强度参数实测:更高档位不等于更好答案,只等于更贵
编程
推理强度参数实测:更高档位不等于更好答案,只等于更贵
2026-09-08 01:11:24
GPT-6 Astra reasoning_effort 实测:max 比 low 贵 2.3 倍且 11 个任务答案相同;none 清零思考 tokens 但失败过半;基准按最高档报告,读发布数据要看清档位。
AI
LLM
定价
评测
Agent 会用测试与验证技术吗?26 种指令条件的 Zstd 实现评测
编程
Agent 会用测试与验证技术吗?26 种指令条件的 Zstd 实现评测
2026-09-08 01:11:19
Dan Luu 用 26 种测试/验证技术指令让 agent 实现 Zstd 的实测:Default 无指令反而高于平均、模糊与属性测试略好于形式化方法、TDD 不佳,agent 普遍不会真正用技术。
AI
测试
评测
工程实践
很适合放进工具箱:三个让我眼前一亮的开源项目
代码
很适合放进工具箱:三个让我眼前一亮的开源项目
2026-09-02 07:48:15
一篇 GitHub Trending 开源工具评测:OpenCut(CapCut 开源替代)、Meetily(纯本地会议纪要)、Caveman(给 Claude Code 省 token 的插件)。逐个给出适用场景、不适合场景、版本状态与实测边界,含速查清单,帮你按实际需求挑而不是全装。
开源工具
评测
从 Terminal Bench 88.3 分看 AI Agent 的真实能力边界:Kimi K3 vs DeepSeek V4-Pro 选型实战
编程
从 Terminal Bench 88.3 分看 AI Agent 的真实能力边界:Kimi K3 vs DeepSeek V4-Pro 选型实战
2026-08-15 17:20:44
基于Terminal Bench 2.1最新88.3分评测数据,深入对比Kimi K3与DeepSeek V4-Pro在五大评测维度的真实差距,配选型决策树与成本效益分析
Terminal Bench
AI Agent
评测
Kimi K3
DeepSeek V4-Pro
Agent能力
模型选型
Claude Opus 5 深度解析:Anthropic 的「性价比革命」与 AI 编程新范式
编程
Claude Opus 5 深度解析:Anthropic 的「性价比革命」与 AI 编程新范式
2026-07-26 16:13:27
2026年7月25日Anthropic发布Claude Opus 5,性能逼近旗舰Fable 5但价格减半。本文深度解析其基准测试数据、AI编程实战能力、安全性争议、Multi-Agent协作潜力及开发者接入指南。
AI
Claude
Anthropic
AI编程
大模型
评测
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
python
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调