VIOTA.M

RISC-V VIOTA.M 指令详解

指令手册R-type

对源 mask 中当前元素之前的 active 置位 bit 做前缀计数,并把计数写入整数向量 vd。

指令语法

viota.m vd, vs2, vm
操作数说明
vd:目标向量寄存器组。
vs2/vs1 或标量源:按指令后缀 .vv/.vx/.vi/.vf 决定来源。
vm:若语法包含 vm,vm=0 使用 v0 作为执行掩码,vm=1 为未掩码。
V向量重排/索引掩码操作

指令行为说明

VIOTA.M 是 RISC-V V 扩展的 mask iota 指令。对每个 active body 元素 i,它统计索引小于 i、且参与执行的 vs2 mask 置位 bit 数量,并把该前缀计数写入 vd[i]。它常用于把 predicate mask 转换成紧凑索引,配合 vcompress、scatter 或 indexed memory 操作构造稀疏数据路径。

VIOTA.M 指令解析与执行动画

从 OP-V 编码字段开始,展示 VIOTA.M 如何把每个 active lane 之前的 active set bit 数写入整数向量。

输入的指令
viota.m
OP-V encodingfunct6 | vm | vs2 | vs1=10000 | funct3 | vd | opcode
funct6
010100
vm
0
vs2
01000
vs1
10000
funct3
010
vd
01100
opcode
1010111
lane
0
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
v8
0
0
1
0
1
0
1
0
0
1
0
0
1
0
0
1
v0.t
1
0
1
1
1
1
0
1
1
1
1
0
1
1
1
1
scan
0
off
0
1
1
2
off
2
2
2
3
off
3
4
4
4
v12
...
...
...
...
...
...
...
...
...
...
...
...
...
...
...
...
当前步骤

显示 OP-V 32 位编码字段

viota.m 使用 OP-V 编码;vs1 字段固定为 10000,语法中没有 vs1 操作数。

动画只展示官方 V 扩展定义的 ISA 可见关系:OP-V 字段解析、vl 内 active mask bit 扫描、目标整数向量写回;不模拟流水线、缓存或执行时延。

快速理解与检索要点

VIOTA.M 把 mask 中“我前面有多少个被选中的 1”变成每个 active lane 的整数索引,当前 lane 自己不计入。

官方语法为 `viota.m vd, vs2, vm`;OP-V VMUNARY0 编码使用 `funct6=010100`、`funct3=010`、`vs1=10000`,vs2 提供源 mask bit。
对 active body 元素 i,结果是索引小于 i 且 active 的 vs2 置位 bit 数量;当前元素自身不加入本 lane 计数。
vm=0 时 v0.t 同时决定哪些元素参与执行;v0.t=0 的元素不增加后续 lane 的前缀计数。
目标 vd 写入 SEW 宽整数结果;若计数超出 SEW 表示范围,只保留低 SEW 位。

向量执行上下文

阅读 VIOTA.M 时,不要只看助记符。官方 V 扩展语义还依赖当前 vl、vtype 和掩码状态。后缀和操作数形式决定源操作数来自向量、标量还是立即数。

先看 vl

当前 vl 决定 body 元素数量。典型代码会先执行 vsetvli、vsetivli 或 vsetvl,再执行本页指令。

再看 vtype

当前 vtype 提供 SEW、LMUL、tail policy 和 mask policy;这些规则影响元素宽度、寄存器组大小以及非活动/尾部目标元素。

最后看 vm/v0

带 vm 的普通向量指令在 vm=0 时用 v0 作为执行掩码,vm=1 表示未掩码。VMERGE 等少数形式会把 v0 当作数据选择输入。

官方来源:RISC-V V Standard Extension for Vector Operations

常见使用场景

稀疏数据索引

结合 «vsetvli t0, a0, e32, m1, ta, ma vmseq.vi v0, v8, 0 viota.m v12, v0, v0.t # active vd[i] = count of earlier active set bits» 等实际代码理解该场景。

压缩辅助

结合 «vsetvli t0, a0, e32, m1, ta, ma vmseq.vi v0, v8, 0 viota.m v12, v0, v0.t # active vd[i] = count of earlier active set bits» 等实际代码理解该场景。

条件收集

结合 «vsetvli t0, a0, e32, m1, ta, ma vmseq.vi v0, v8, 0 viota.m v12, v0, v0.t # active vd[i] = count of earlier active set bits» 等实际代码理解该场景。

使用前检查清单

语法检查
  • 确认当前指令格式为 R-type。
  • 确认操作数排列顺序与示例一致。
语义检查
  • 确认目标寄存器用途和调用约定兼容。
  • 确认该指令不是伪指令展开后的底层形式。

容易混淆 / 常见误区

vs2 是 mask register 的 bit 视图,不是 SEW 宽普通整数向量;输出 vd 才是 SEW 宽整数向量。
计数范围是当前 lane 之前的参与元素,包含索引小于 i 的 active set bits,不包含当前 lane 自己。
vm=0 时 v0.t=0 的 lane 不参与前缀计数,也不写回确定结果;不要把 masked-off lane 当成贡献 0 后仍写回。
如果前缀计数不能用当前 SEW 表示,结果按低 SEW 位写入;通常应选择足以容纳 vl 内计数的 SEW。
当目标 vd 与源 vs2 重叠,或者 masked 执行时 vd 与 v0 重叠,属于规范保留形式;示例和动画避免这些组合。

常见问题

VIOTA.M 会把当前 lane 的 vs2 bit 计入结果吗?

不计入。lane i 的结果只统计索引小于 i 的 active set bits,因此第一个 active lane 的结果可能是 0。

VIOTA.M 的输出还是 mask 吗?

不是。vs2 是 mask bit 输入,但 vd 是整数向量结果,每个 active 元素写入 SEW 宽前缀计数。

v0.t 关闭的 lane 会影响后续前缀计数吗?

不会。vm=0 时只有 v0.t=1 的元素参与 iota 计数和写回;关闭的 lane 不增加后续 lane 的计数。