程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
SIMD 相关技术文章
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
Go 1.27 的 simd 包:一份向量代码同时跑 AVX、NEON 和 wasm
编程
Go 1.27 的 simd 包:一份向量代码同时跑 AVX、NEON 和 wasm
2026-10-10 21:02:48
Go 1.27 引入平台无关的实验性 simd 包,用 GOEXPERIMENT=simd 就能写一份向量代码跑在 amd64(AVX/AVX2/AVX512)、arm64(NEON)和 wasm 上。本文梳理它如何隐藏宽度与掩码差异、支持哪些操作、怎样与 archsimd 互转,以及 GODEBUG=simd 各档位的含义。
Go
SIMD
性能
Debian Code Search 用纯 Go SIMD 重写 TurboPFor:删掉最后一行 cgo,性能反超 C 库
编程
Debian Code Search 用纯 Go SIMD 重写 TurboPFor:删掉最后一行 cgo,性能反超 C 库
2026-09-19 20:03:33
Debian Code Search 作者用 Go 1.26/1.27 实验性 simd/archsimd 包重写服役 7 年的 C 版 TurboPFor 整数压缩库,删掉最后一行 cgo:先靠减少分配、泛型位宽特化把纯标量性能拉到 C 的 76% 以上,再用 AVX2 垂直布局取得 3 倍加速,最后靠位置汇编计数再翻一倍,反超原 cgo 版本。
Go
SIMD
性能优化
cgo
AVX512
Debian Code Search 用 Go SIMD 实现高性能 TurboPFor 整数压缩:告别 cgo 依赖
编程
Debian Code Search 用 Go SIMD 实现高性能 TurboPFor 整数压缩:告别 cgo 依赖
2026-09-07 01:12:53
Michael Stapelberg 在 Debian Code Search 中用 Go SIMD 重新实现 TurboPFor 整数压缩,成功删除项目最后一个 cgo 依赖。通过 PGO 优化、减少内存分配、泛型特化位宽等标量优化,以及 SIMD 构建标签、256 uint32 垂直布局、位置 popcount、更大步长等 SIMD 优化,Go 实现达到甚至超过 C 语言参考实现,AVX-512 带来显著性能提升。
Go
SIMD
TurboPFor
Debian Code Search
性能优化
AVX-512
cgo
Rust SIMD 进军 GPU:VectorWare 实现 core::simd 在 GPU 上运行
编程
Rust SIMD 进军 GPU:VectorWare 实现 core::simd 在 GPU 上运行
2026-09-06 06:18:24
VectorWare宣布成功实现Rust可移植SIMD(core::simd)在GPU上运行。之前已实现Rust线程到GPU Warp的映射,但未利用Warp内的并行通道。核心技术是将SIMD向量映射为Warp内的Lane,SIMD操作映射为Warp内并行执行。文章介绍了CPU SIMD原理、Rust可移植SIMD对比架构特定内部函数的优势、技术实现中的关键挑战(向量长度不匹配、内存访问模式、控制流差异),以及对开发者、GPU编程、高性能计算的意义和应用场景。
Rust
SIMD
GPU
core::simd
VectorWare
高性能计算
并行计算
CUDA
Go 的 simd/archsimd 实验:用纯 Go SIMD 加速 ChaCha20
编程
Go 的 simd/archsimd 实验:用纯 Go SIMD 加速 ChaCha20
2026-09-03 08:21:50
用 Go 实验性 simd/archsimd 包为 ChaCha20 写纯 Go SIMD 实现:AMD EPYC 上 AVX-512 较标准库提速约 7.5 倍,arm64 达约 97%。记录 archsimd 直接映射指令、simd 宽度无关却难做可移植的取舍,以及必须启用 GOEXPERIMENT=simd、寄存器溢出等坑。
Go
SIMD
性能优化
加密
ChaCha20
WebGPU + WebAssembly 协同革命:从浏览器性能边界到 GPU 算力完全释放的 2026 实战指南
编程
WebGPU + WebAssembly 协同革命:从浏览器性能边界到 GPU 算力完全释放的 2026 实战指南
2026-08-14 13:47:23
深度拆解 WebGPU 与 WebAssembly 协同优化:从 CPU/GPU 任务分工到共享内存模型,从代码实战到 15 条生产级最佳实践,解锁浏览器高性能计算新边界。
WebGPU
WebAssembly
GPU计算
浏览器性能
SIMD
多线程
Rust
前端优化
Go SIMD 深度拆解:当 Gopher 终于不用手写汇编——从 archsimd 两层模型到可移植 simd 包的「性能下半场」
编程
Go SIMD 深度拆解:当 Gopher 终于不用手写汇编——从 archsimd 两层模型到可移植 simd 包的「性能下半场」
2026-08-12 07:18:45
Go SIMD 全链路深度拆解:为什么 Go 十年没有 SIMD(Plan9 汇编五宗罪、自动向量化被语义堵死)、两层模型(archsimd 对标 syscall、simd 对标 os)、Mask 不透明设计与命名哲学之争、点积/字节扫描/图像灰度化/可移植层四个代码实战、四累加器打破依赖链、AVX-512 降频陷阱、算术强度与分块优化、差分测试与 benchmark 四坑,附 15 条落地清单。
Go
SIMD
archsimd
向量化
性能优化
编译器
Go 1.27
AVX2
AVX-512
并行计算
Green Tea GC 深度拆解:当 Go 决定把标记算法从「追着对象跑」改成「按页扫描」——从微架构灾难到 AVX-512 向量内核的运行时手术
编程
Green Tea GC 深度拆解:当 Go 决定把标记算法从「追着对象跑」改成「按页扫描」——从微架构灾难到 AVX-512 向量内核的运行时手术
2026-08-09 04:49:16
深度拆解 Go 1.26 默认启用的 Green Tea GC:为什么指针追逐是微架构灾难、以 8KiB 页为工作单元的 seen/scanned 双 bit 设计、FIFO 攒批的原理、VGF2P8AFFINEQB 向量扫描内核,含 runtime/metrics 量化代码、A/B 脚本、稀疏图反例复现、七条数据布局优化规律与十条踩坑清单。
Green Tea GC
Go1.26
垃圾回收
Go
运行时
性能优化
AVX-512
内存布局
GC调优
SIMD
Green Tea GC 深度拆解:Go 1.26 把跑了十年的三色标记换掉了——从「对象为中心」到「内存为中心」,一次为 CPU 缓存重写的垃圾回收器
编程
Green Tea GC 深度拆解:Go 1.26 把跑了十年的三色标记换掉了——从「对象为中心」到「内存为中心」,一次为 CPU 缓存重写的垃圾回收器
2026-08-08 12:46:53
Go 1.26 默认启用 Green Tea GC:深度拆解 span 批量扫描、marks/scans 双位图、SPMC 工作窃取队列、FIFO 为何胜过 LIFO、AVX512 扫描内核,含实测方法、受益/不受益负载判断与七条调优经验。
Go
Go1.26
Green Tea GC
垃圾回收
三色标记
runtime
性能优化
SIMD
缓存局部性
goroutine泄漏
工作窃取
内存管理
PostgreSQL 19 深度拆解:当数据库之王决定「干掉全部性能瓶颈」——从 ANTI JOIN 智能转换到 SIMD 加速 COPY,一个 40 年历史的开源数据库如何用 289 倍查询提速重新定义关系型数据库的终极形态
编程
PostgreSQL 19 深度拆解:当数据库之王决定「干掉全部性能瓶颈」——从 ANTI JOIN 智能转换到 SIMD 加速 COPY,一个 40 年历史的开源数据库如何用 289 倍查询提速重新定义关系型数据库的终极形态
2026-08-05 03:17:21
深度拆解PostgreSQL 19 Beta 2:ANTI JOIN智能转换实现289倍查询提速、SIMD加速COPY 3.5倍、并行Autovacuum清理提速4倍、lz4默认压缩、新监控体系,附完整迁移指南与代码实战
PostgreSQL
数据库
PostgreSQL 19
查询优化
ANTI JOIN
SIMD
异步I/O
Autovacuum
性能优化
开源数据库
Go 十年 SIMD 之痛终结:archsimd 与可移植 simd 包全拆解,手写自动适配 AVX2/AVX-512 的向量计算库
编程
Go 十年 SIMD 之痛终结:archsimd 与可移植 simd 包全拆解,手写自动适配 AVX2/AVX-512 的向量计算库
2026-08-02 06:44:17
从 Issue #73787/#78902/#78979 拆解 Go 1.26/1.27 原生 SIMD 两层 API 设计,附完整代码与性能优化方法论。
Go
SIMD
archsimd
性能优化
AVX-512
编译器
向量化
Go 1.27
Go 1.27 原生 SIMD 深度拆解:两层 API 如何终结 Go 十年性能之痛,手写一个自适应 CPU 的向量计算库
编程
Go 1.27 原生 SIMD 深度拆解:两层 API 如何终结 Go 十年性能之痛,手写一个自适应 CPU 的向量计算库
2026-08-02 06:43:17
从 Issue #73787/#78902/#78979 拆解 Go 1.26/1.27 原生 SIMD 两层 API 设计,附完整代码与性能优化方法论。
Go
SIMD
archsimd
性能优化
AVX-512
编译器
向量化
Go 1.27
Go 1.26 Green Tea GC 深度拆解:从 runtime 源码看「延迟扫描 + span 批处理」如何砍掉 40% GC 开销
编程
Go 1.26 Green Tea GC 深度拆解:从 runtime 源码看「延迟扫描 + span 批处理」如何砍掉 40% GC 开销
2026-07-31 04:18:59
Go 1.26 默认启用 Green Tea GC,官方称 GC 开销降低 10-40%。本文从 runtime 源码拆解其双位图设计、span 内联 mark bits、FIFO 队列与三态所有权协议、spanSPMC 工作窃取与 SIMD 扫描,并给出可复现的压测方案、GOGC 重校准脚本、runtime/metrics 监控代码,以及 goroutine 泄漏 profile 的 CI 集成与能力边界冷思考。
Go
Green Tea GC
垃圾回收
runtime
性能优化
goroutine泄漏
Go1.26
SIMD
内存管理
并发编程
PostgreSQL 19 Beta 2 深度解析:查询优化器革命与存储引擎升级
编程
PostgreSQL 19 Beta 2 深度解析:查询优化器革命与存储引擎升级
2026-07-28 12:20:10
深度解析PostgreSQL 19 Beta 2核心改进:NOT IN到ANTI JOIN全面优化、COPY FROM SIMD加速6倍、TOAST lz4压缩默认启用、并行Autovacuum Workers、pg_stat_lock锁统计视图等,从架构原理到生产迁移完整覆盖。
PostgreSQL
数据库
查询优化
存储引擎
性能优化
SIMD
并发
运维
PostgreSQL 19 Beta 2 深度解析:JIT 默认关闭、并行 Autovacuum、SIMD 加速 COPY——你的生产库该怎么接招
编程
PostgreSQL 19 Beta 2 深度解析:JIT 默认关闭、并行 Autovacuum、SIMD 加速 COPY——你的生产库该怎么接招
2026-07-26 15:13:23
PostgreSQL 19 Beta 2 深度解析:JIT默认关闭、standard_conforming_strings强制开启、并行Autovacuum、SIMD加速COPY、NOT IN转ANTI JOIN、预聚合下推、新系统视图与生产升级Checklist全覆盖。
PostgreSQL 19
数据库
JIT
Autovacuum
性能优化
SIMD
优化器
升级指南
PostgreSQL 19 Beta 2 深度解析:史上最大规模优化引擎升级,Richard Guo 主导的查询重写革命
编程
PostgreSQL 19 Beta 2 深度解析:史上最大规模优化引擎升级,Richard Guo 主导的查询重写革命
2026-07-24 16:15:36
2026年7月16日PostgreSQL 19 Beta 2发布,包含史上最大规模查询优化器重构、SIMD COPY FROM、并行Autovacuum等重磅升级。本文深度解析核心变更与迁移要点。
PostgreSQL
数据库
性能优化
查询优化器
SIMD
TOAST
分布式数据库
PostgreSQL 19
WebAssembly 3.0 深度解剖:当字节码有了 GC、64 位内存和异常,浏览器之外的世界正在被改写
编程
WebAssembly 3.0 深度解剖:当字节码有了 GC、64 位内存和异常,浏览器之外的世界正在被改写
2026-07-23 14:43:31
WebAssembly 3.0 正式化 GC、异常处理、尾调用、Memory64、多内存、Relaxed SIMD 等核心特性。从工程视角深度拆解每个特性解决什么问题、底层实现、WAT/Rust/JS 代码实战、性能优化要点,以及组件模型为何仍未完成。
WebAssembly
WasmGC
Memory64
异常处理
尾调用
Component Model
SIMD
turbovec 深度拆解:当 Google TurboQuant 算法遇见 Rust——一个二进制如何把向量索引内存砍到 1/8、速度还比 FAISS 快(2026·完整版)
编程
turbovec 深度拆解:当 Google TurboQuant 算法遇见 Rust——一个二进制如何把向量索引内存砍到 1/8、速度还比 FAISS 快(2026·完整版)
2026-07-20 14:18:39
2026年深度拆解 Google Research 在 ICLR 2026 发表的 TurboQuant 算法,以及 Rust 实现 turbovec:4-bit 量化把向量索引内存压到 1/8、召回率 96.8%、零训练增量、纯 CPU SIMD。包含完整原理、代码实战、Rust/SIMD 优化细节、RAG 集成与性能基准测试。
turbovec
TurboQuant
向量检索
Rust
SIMD
RAG
FAISS
ICLR 2026
Go 语言 2026 深度拆解:当云原生之王迎来 SIMD、分代 GC 与 AI 原生的「三重觉醒」
编程
Go 语言 2026 深度拆解:当云原生之王迎来 SIMD、分代 GC 与 AI 原生的「三重觉醒」
2026-07-18 07:42:42
深度拆解 Go 语言 2026 年核心演进:分代 GC(Green Tea)P99 停顿降 75%、SIMD 原生 API 让 Go 向量化计算从无到有、微软 ms-ai-go SDK 正式入场 AI、字节 Eino 框架重塑 Go Agent 生态。完整代码实战与性能基准。
Go语言
Golang
SIMD
分代GC
Green Tea GC
AI推理
ms-ai-go
Eino
MCP协议
性能优化
NUMA
RISC-V 深度拆解:当开源指令集学会「造芯」——NVIDIA SiFive 联姻、Linux 7.2 默认支持与 NumPy RVV 优化如何重写芯片战争格局
编程
RISC-V 深度拆解:当开源指令集学会「造芯」——NVIDIA SiFive 联姻、Linux 7.2 默认支持与 NumPy RVV 优化如何重写芯片战争格局
2026-07-15 16:17:47
深度拆解 2026 年 RISC-V 生态关键技术突破:NVIDIA SiFive 战略合作、Linux 7.2 默认支持国产芯片、灵睿智芯 P100 v1、RISC-V Vector 扩展优化,配完整代码实战与性能对比。
RISC-V
RV-Vector
RVV
NVIDIA
SiFive
向量计算
SIMD
LLVM向量化
NumPy
国产芯片
Linux内核
AI推理
异构计算
Go 1.27 深度拆解:当 SIMD 终于走进标准库——两层模型如何用架构无关设计重写 Go 性能优化心智模型
编程
Go 1.27 深度拆解:当 SIMD 终于走进标准库——两层模型如何用架构无关设计重写 Go 性能优化心智模型
2026-07-15 11:15:27
从工程师视角深度拆解 Go 1.27 SIMD:两层模型(archsimd + portable simd)、AMD64 AVX2/AVX-512 向量指令、动态位宽抽象、水平求和优化,配完整代码示例与性能调优实战。
Go语言
SIMD
性能优化
archsimd
AVX512
向量计算
Go 1.27
amd64
别再手写汇编了!Go 1.27 原生SIMD,性能直接起飞
编程
别再手写汇编了!Go 1.27 原生SIMD,性能直接起飞
2026-07-04 08:18:54
Go 1.27正式支持原生SIMD,无需手写Plan9汇编即可使用向量指令。底层archsimd包+高层Highway封装,两步走策略。Green Tea GC已用SIMD让GC开销降10%,runtime.freegc让strings.Builder扩容翻2倍。高性能计算牌桌上Go正式入座。
Go
SIMD
AVX
AVX-512
ARM64
NEON
SVE
高性能计算
并行计算
GreenTeaGC
编译器优化
万字深度解析 Box3D:当 Box2D 作者遇见 3D 物理引擎——从 Erin Catto 的传奇生涯到 Soft Step 求解器、从 Continuous Collision 到生产级游戏集成的完整技术指南(2026)
编程
万字深度解析 Box3D:当 Box2D 作者遇见 3D 物理引擎——从 Erin Catto 的传奇生涯到 Soft Step 求解器、从 Continuous Collision 到生产级游戏集成的完整技术指南(2026)
2026-07-02 12:44:18
深度解析 Box3D 开源 3D 物理引擎:从 Erin Catto 的传奇生涯、Soft Step 求解器、连续碰撞检测到 SIMD 优化、多线程并行,含完整代码实战与生产级集成指南。
Box3D
物理引擎
Erin Catto
游戏开发
3D物理
Soft Step
CCD
SIMD
游戏引擎
万字深度解析 turbovec:当向量索引遇见 Rust+TurboQuant——从31GB到4GB、从FAISS到超越的完整技术指南(2026)
编程
万字深度解析 turbovec:当向量索引遇见 Rust+TurboQuant——从31GB到4GB、从FAISS到超越的完整技术指南(2026)
2026-07-02 12:15:32
深度解析turbovec——2026年革命性向量索引库,TurboQuant算法实现16倍内存压缩、搜索速度超越FAISS,含完整代码实战与生产级集成指南。
turbovec
Rust
向量索引
TurboQuant
FAISS
SIMD
RAG
Python
性能优化
ICLR 2026
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
python
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
上一页
1
2
3
下一页
共 3 页
到第
页
确定