1nfinite 技术文章
RISC-V 和 AI 技术文章,探索新算力时代的未来
精选文章

Triton Kernel 全流程揭秘:从编译到运行
本文将详细解析 Triton Kernel 从 Python 代码到目标二进制的完整编译流程,剖析每一步的关键机制与实现细节。同时,系统讲解 host 端与 device 端的 kernel 启动机制,阐释数据如何从 host 传递到 kernel,并揭示二者如何协同实现高效的算 子执行。

AI 模型性能的引擎:算子库编程语言的发展与趋势
本文将系统梳理主流算子 DSL 的发展现状,涵盖CUDA、CuteDSL、TileLang、Triton、Gluon、Mojo等代表性语言,简要介绍各自的特点,并分析它们在性能与编程友好性上的取舍。
所有文章

RISC-V DSA 平台下 Triton 算子性能初探
本文将选取深度学习领域常用算子作为基准测试对象,分别对比传统 C 算子实现、基于 triton-cpu 框架的 Triton 编译器版本, 以及基于兆松 ZTC Triton 编译器版本的性能表现,为 AI 芯片开发者和系统架构师提供有价值的参考。

Triton 编译器在 RISC-V 上的移植与适配实践
本文将系统梳理 Triton 编译器在 RISC-V 上的移植与适配流程,帮助开发者高效完成 Triton 算子的移植与部署。

Triton for RISC-V:AI 算子开发新机遇
本文将首先分析RISC-V在AI领域的发展前景,深入探讨RISC-V向量和Matrix扩展等指令集对AI算子性能的实际影响。随后,系统评估Triton for RISC-V的技术可行性,结合Triton社区、MLIR社区与RISC-V生态的协同创新,展望未来AI开发工具链的演进方向。

Triton Compiler Core:Dialect 与 Pass Pipeline
本文将首先介绍 Triton 方言的设计理念与核心内容。接着,详细讲解Triton编译器的前端、优化和后端 Pass Pipeline,以及 Triton IR 与 MLIR、LLVM 的集成流程。最后,通过实际案例展示如何在 Triton 编译器中灵活扩展和添加自定义优化能力。

Triton 编译器架构全景与多后端适配
本文将通过丰富的应用案例,帮助开发者全面理解 Triton 编译器在不同硬件环境下的适配策略,为 AI 系统的高性能部署提供坚实支撑。

Triton Kernel 全流程揭秘:从编译到运行
本文将详细解析 Triton Kernel 从 Python 代码到目标二进制的完整编译流程,剖析每一步的关键机制与实现细节。同时,系统讲解 host 端与 device 端的 kernel 启动机制,阐释数据如何从 host 传递到 kernel,并揭示二者如何协同实现高效的算子执行。

Triton 算子开发:调试与性能优化实战
本文将系统介绍 Triton 算子开发中的调试方法,包括如何使用 device_print 和 interpret 模式 ( cpu python 解析执行) 进行算子级调试,帮助开发者快速发现和修复问题。

Triton 算子开发 Triton 编程语言和 SPMD 编程模型
本文将系统介绍 Triton 语言的核心语法要点与 SPMD 编程范式,帮助读者快速掌握使用 Python eDSL 算子开发语言开发 AI 算子的基本方法。

AI 模型性能的引擎:算子库编程语言的发展与趋势
本文将系统梳理主流算子 DSL 的发展现状,涵盖CUDA、CuteDSL、TileLang、Triton、Gluon、Mojo等代表性语言,简要介绍各自的特点,并分析它们在性能与编程友好性上的取舍。

鄂公网安备 42018502007513