当前位置：首页 > news >正文

CANN/asc-devkit SIMD寄存器存储对齐接口

news 2026/7/4 21:53:08

asc_storealign_1st

【免费下载链接】asc-devkit本项目是CANN 推出的昇腾AI处理器专用的算子程序开发语言，原生支持C和C++标准规范，主要由类库和语言扩展层构成，提供多层级API，满足多维场景算子开发诉求。项目地址: https://gitcode.com/cann/asc-devkit

产品支持情况

产品	是否支持
Ascend 950PR/Ascend 950DT	√

功能说明

从矢量数据寄存器搬出第一个元素到UB的接口，忽略mask，向dst_align32b中搬运src第一个元素，支持数据类型为b8、b16、b32。

函数原型

偏移固定传入0，由用户自行更新目的操作数的地址

__simd_callee__ inline void asc_storealign_1st(__ubuf__ int8_t* dst_align32b, vector_int8_t src) __simd_callee__ inline void asc_storealign_1st(__ubuf__ uint8_t* dst_align32b, vector_uint8_t src) __simd_callee__ inline void asc_storealign_1st(__ubuf__ int16_t* dst_align32b, vector_int16_t src) __simd_callee__ inline void asc_storealign_1st(__ubuf__ uint16_t* dst_align32b, vector_uint16_t src) __simd_callee__ inline void asc_storealign_1st(__ubuf__ int32_t* dst_align32b, vector_int32_t src) __simd_callee__ inline void asc_storealign_1st(__ubuf__ uint32_t* dst_align32b, vector_uint32_t src) __simd_callee__ inline void asc_storealign_1st(__ubuf__ half* dst_align32b, vector_half src) __simd_callee__ inline void asc_storealign_1st(__ubuf__ float* dst_align32b, vector_float src) __simd_callee__ inline void asc_storealign_1st(__ubuf__ bfloat16_t* dst_align32b, vector_bfloat16_t src) __simd_callee__ inline void asc_storealign_1st(__ubuf__ fp8_e4m3fn_t* dst_align32b, vector_fp8_e4m3fn_t src) __simd_callee__ inline void asc_storealign_1st(__ubuf__ hifloat8_t* dst_align32b, vector_hifloat8_t src) __simd_callee__ inline void asc_storealign_1st(__ubuf__ fp8_e5m2_t* dst_align32b, vector_fp8_e5m2_t src) __simd_callee__ inline void asc_storealign_1st(__ubuf__ fp8_e8m0_t* dst_align32b, vector_fp8_e8m0_t src) __simd_callee__ inline void asc_storealign_1st(__ubuf__ fp4x2_e2m1_t* dst_align32b, vector_fp4x2_e2m1_t src) __simd_callee__ inline void asc_storealign_1st(__ubuf__ fp4x2_e1m2_t* dst_align32b, vector_fp4x2_e1m2_t src) __simd_callee__ inline void asc_storealign_1st(__ubuf__ int4b_t* dst_align32b, vector_int4x2_t src)

通过int32_t传入偏移，用户可以选择更新偏移或者更新目的操作数的地址

__simd_callee__ inline void asc_storealign_1st(__ubuf__ int8_t* dst_align32b, vector_int8_t src, int32_t offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ uint8_t* dst_align32b, vector_uint8_t src, int32_t offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ int16_t* dst_align32b, vector_int16_t src, int32_t offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ uint16_t* dst_align32b, vector_uint16_t src, int32_t offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ int32_t* dst_align32b, vector_int32_t src, int32_t offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ uint32_t* dst_align32b, vector_uint32_t src, int32_t offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ half* dst_align32b, vector_half src, int32_t offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ float* dst_align32b, vector_float src, int32_t offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ bfloat16_t* dst_align32b, vector_bfloat16_t src, int32_t offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ fp8_e4m3fn_t* dst_align32b, vector_fp8_e4m3fn_t src, int32_t offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ hifloat8_t* dst_align32b, vector_hifloat8_t src, int32_t offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ fp8_e5m2_t* dst_align32b, vector_fp8_e5m2_t src, int32_t offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ fp8_e8m0_t* dst_align32b, vector_fp8_e8m0_t src, int32_t offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ fp4x2_e2m1_t* dst_align32b, vector_fp4x2_e2m1_t src, int32_t offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ fp4x2_e1m2_t* dst_align32b, vector_fp4x2_e1m2_t src, int32_t offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ int4b_t* dst_align32b, vector_int4x2_t src, int32_t offset)

通过iter_reg地址寄存器传入偏移

__simd_callee__ inline void asc_storealign_1st(__ubuf__ int8_t* dst_align32b, vector_int8_t src, iter_reg offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ uint8_t* dst_align32b, vector_uint8_t src, iter_reg offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ int16_t* dst_align32b, vector_int16_t src, iter_reg offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ uint16_t* dst_align32b, vector_uint16_t src, iter_reg offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ int32_t* dst_align32b, vector_int32_t src, iter_reg offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ uint32_t* dst_align32b, vector_uint32_t src, iter_reg offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ half* dst_align32b, vector_half src, iter_reg offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ float* dst_align32b, vector_float src, iter_reg offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ bfloat16_t* dst_align32b, vector_bfloat16_t src, iter_reg offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ fp8_e4m3fn_t* dst_align32b, vector_fp8_e4m3fn_t src, iter_reg offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ hifloat8_t* dst_align32b, vector_hifloat8_t src, iter_reg offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ fp8_e5m2_t* dst_align32b, vector_fp8_e5m2_t src, iter_reg offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ fp8_e8m0_t* dst_align32b, vector_fp8_e8m0_t src, iter_reg offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ fp4x2_e2m1_t* dst_align32b, vector_fp4x2_e2m1_t src, iter_reg offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ fp4x2_e1m2_t* dst_align32b, vector_fp4x2_e1m2_t src, iter_reg offset) __simd_callee__ inline void asc_storealign_1st(__ubuf__ int4b_t* dst_align32b, vector_int4x2_t src, iter_reg offset)

参数说明

参数名	输入/输出	描述
dst_align32b	输出	目的操作数（矢量）的起始地址。
src	输入	源操作数（矢量数据寄存器）。
offset	输入	偏移量。

矢量数据寄存器的详细说明请参见reg数据类型定义.md。

返回值说明

无

流水类型

PIPE_V

约束说明

无

调用示例

__ubuf__ half* dst_align32b = (__ubuf__ half*)asc_get_phy_buf_addr(0); vector_half src; asc_storealign_1st(dst_align32b, src);

创作声明：本文部分内容由AI辅助生成（AIGC），仅供参考

查看全文

http://www.jsqmd.com/news/1124271/

jqjq测试套件详解：确保解释器正确性的方法

如何快速部署Gemma-4-31B-it-abliterated：5分钟本地运行完整指南

Saber手写笔记应用：跨平台数字手写的终极指南

从零开始学AWD防御：Watchbird安装与基础功能详解

Spectre在机构级量化交易中的应用：大规模数据处理实战案例

AMD Ryzen深度调试：解锁处理器性能潜力的终极指南

CANN/ge GE Python API GeApi类文档

CANN/ge DataFlow MetaRunContext类

Sublime Text Orgmode插件常见问题解决方案：从安装到高级使用

SVD++ 算法 Python 实现：利用隐式反馈将推荐准确率提升 3%

从推箱子到世界模型：用PyTorch实现AI规划能力与JEPA架构解析

一文读懂GhostDB的持久化机制：AOF日志与快照技术全解析

GoExec任务计划模块实战：demand与create命令实现无文件落地攻击

Touch WX开发常见问题解答：新手必看的避坑指南

终极macOS窗口管理神器：AutoRaise让鼠标悬停自动聚焦，工作效率提升300%

GalaxyBudsClient固件刷写技术深度解析：跨平台固件管理实现方案

BigFunctions快速入门：10分钟学会在BigQuery中调用公共函数

如何快速上手YiShaAdmin：权限管理系统实战指南

MMKV如何解决移动端跨平台数据同步的三大核心挑战：实战指南

如何用GZDoom让经典射击游戏重获新生？

jqjq实战应用：10个高效JSON数据处理技巧

ftpserver多用户管理实战：如何配置不同云存储后端的访问权限

计算机毕业设计之springboot校园食堂评价系统

警惕AI模型标题党：解析Claude真实版本演进与评测逻辑

jinjava快速上手：5分钟学会Java中的Jinja模板渲染

ReactList 移动端优化：使用translate3d提升移动设备滚动性能

Exercises Dataset容器编排：Kubernetes部署与管理的完整指南

深度解析ValveResourceFormat：从VPK文件到3D模型的完整实战指南

Juggl全局图模式与本地图模式对比：选择适合你的可视化策略

如何免费获得10倍GitHub下载速度：Fast-GitHub终极加速指南