VSSE8.V

RISC-V VSSE8.V 指令详解

指令手册V-type

把 vs3 的 8 位向量元素按 x[rs2] 字节跨步存到 x[rs1] 地址序列。

指令语法

vsse8.v vs3, (rs1), rs2, vm
操作数说明
vs3:源向量寄存器组,提供活动元素的存储数据。
rs1:整数基址寄存器;单位步长形式写入连续地址。
vm:若语法包含 vm,vm=0 使用 v0 作为执行掩码,vm=1 为未掩码。
V向量内存向量存储

指令行为说明

VSSE8.V 是 RISC-V V 扩展的 8 位跨步向量存储指令。活动 body 元素使用地址 x[rs1] 加 lane index 乘以 x[rs2];x[rs2] 是字节数 stride,可表示正、负或零跨步。vm=0 时由 v0.t 选择元素,被掩码关闭的元素不访问内存。

VSSE8.V 指令解析与执行动画

从编码字段解析 8 位跨步存储,再逐元素计算 x[rs1] + i * x[rs2] (16 bytes)。

输入的指令
vsse8.v
执行环境:EEW=8,stride=x[rs2]=16 字节,示例 SEW=8,LMUL=m1;这些不属于汇编语法操作数。
编码字段vsse8.v / STORE-FP
31..29
nf
000
28
mew
0
27..26
mop
10
25
vm
0
24..20
rs2
00101
19..15
rs1
01010
14..12
width
000
11..7
vd/vs3
01000
6..0
opcode
0100111
地址与数据路径addr[i] = 0x8000 + i * 16
i=0
i=1
i=2
i=3
i=4
i=5
i=6
i=7
i=8
i=9
i=10
i=11
i=12
i=13
i=14
i=15
addr
0x8000
0x8010
0x8020
0x8030
0x8040
0x8050
0x8060
0x8070
0x8080
0x8090
0x80a0
0x80b0
0x80c0
0x80d0
0x80e0
0x80f0
v8
0x03
0x06
0x09
0x0c
0x0f
0x12
0x15
0x18
0x1b
0x1e
0x21
0x24
0x27
0x2a
0x2d
0x30
active
1
1
0
1
1
1
1
0
1
1
1
1
0
1
1
1
memory write
...
...
-
...
...
...
...
-
...
...
...
...
-
...
...
...
步骤 1 / 22

显示向量内存指令编码

动画从 32 位向量内存指令编码开始,按官方位段显示 nf、mew、mop、vm、rs2/vs2 或 lumop/sumop、width、寄存器字段和 opcode。

快速理解与检索要点

VSSE8.V 是 RVV 8 位跨步向量存储:每个活动元素的内存地址是 x[rs1] 加 lane index 乘以 x[rs2],其中 x[rs2] 是字节 stride。vl 和 v0.t 掩码决定哪些 body 元素参与内存访问。

指令名固定内存元素宽度 EEW=8;stride 来自整数寄存器 x[rs2],单位是字节,不按 EEW 隐式缩放。
跨步访问使用同一个标量 stride 生成地址序列;indexed gather/scatter 使用 vluxei/vloxei 或 vsuxei/vsoxei 等其他指令族。
x[rs2] 可以表示正、负或零 stride;当编码字段 rs2=x0 时,x0 恒为 0,官方允许实现对该 zero-stride 形式执行少于每个 active 元素一次的内存操作。
vm=0 时 v0.t 选择参与的 body 元素,vm=1 时所有 body 元素参与;被掩码关闭的元素不发起内存访问。
存储只对活动元素产生内存写;非活动和尾部元素不产生该元素的存储访问。

向量执行上下文

阅读 VSSE8.V 时,不要只看助记符。官方 V 扩展语义还依赖当前 vl、vtype 和掩码状态。后缀和操作数形式决定源操作数来自向量、标量还是立即数。

先看 vl

当前 vl 决定 body 元素数量。典型代码会先执行 vsetvli、vsetivli 或 vsetvl,再执行本页指令。

再看 vtype

当前 vtype 提供 SEW、LMUL、tail policy 和 mask policy;这些规则影响元素宽度、寄存器组大小以及非活动/尾部目标元素。

最后看 vm/v0

带 vm 的普通向量指令在 vm=0 时用 v0 作为执行掩码,vm=1 表示未掩码。VMERGE 等少数形式会把 v0 当作数据选择输入。

官方来源:RISC-V V Standard Extension for Vector Operations

常见使用场景

结构体字段访问

结合 «li t0, 4 vsetvli t1, a2, e8, m1, ta, ma vsse8.v v8, (a0), t0, v0.t» 等实际代码理解该场景。

矩阵列或行跨距访问

结合 «li t0, 4 vsetvli t1, a2, e8, m1, ta, ma vsse8.v v8, (a0), t0, v0.t» 等实际代码理解该场景。

非连续向量写回

结合 «li t0, 4 vsetvli t1, a2, e8, m1, ta, ma vsse8.v v8, (a0), t0, v0.t» 等实际代码理解该场景。

使用前检查清单

语法检查
  • 确认当前指令格式为 V-type。
  • 确认操作数排列顺序与示例一致。
语义检查
  • 确认目标寄存器用途和调用约定兼容。
  • 确认该指令不是伪指令展开后的底层形式。

容易混淆 / 常见误区

指令名中的 8 是内存元素宽度 EEW;地址增量来自 x[rs2] 字节,不会再按 1 自动缩放。
跨步可以为正、负或零;rs2=x0 是官方 zero-stride 编码形式,x0 恒为 0,且实现可对该形式执行少于每个 active 元素一次的内存操作。
被掩码关闭的元素不发起内存写入,也不会因为该元素产生内存异常。
不要依赖元素访问顺序来表达有副作用内存或重叠地址的程序语义。

常见问题

VSSE8.V 的 stride 单位是什么?

stride 是 x[rs2] 中的字节数。它不是元素个数,也不会按 EEW 再隐式乘一次;若编码为 rs2=x0,则 x0 恒为 0。

VSSE8.V 和单位步长 VSE8.V 有什么区别?

单位步长按连续 1 字节访问;VSSE8.V 使用 x[rs2] 给出的字节 stride,因此可以访问结构体字段、矩阵列或反向序列。

VSSE8.V 的 rs2=x0 和 x[rs2]=0 有区别吗?

有。rs2=x0 是编码字段直接选择 x0 的 zero-stride 形式;官方允许实现对该形式执行少于每个 active 元素一次的内存操作。rs2 不是 x0 但寄存器值为 0 时,仍按普通跨步访问语义处理。

被 v0.t 关闭的元素会访问内存吗?

不会。vm=0 且对应 v0.t 位为 0 的 body 元素不会执行该元素的存储写入内存访问。