首页/指令库/VFWMUL-VV
VFWMUL.VV

RISC-V VFWMUL.VV 指令详解

指令手册OPFVV

将 vs2[i] 与同 lane 的 vs1[i] 相乘,并将 2*SEW 宽的结果写入 vd[i]。

指令语法

vfwmul.vv vd, vs2, vs1, vm
操作数说明
vd:目标向量寄存器组。
vs2/vs1 或标量源:按指令后缀 .vv/.vx/.vi/.vf 决定来源。
vm:若语法包含 vm,vm=0 使用 v0 作为执行掩码,vm=1 为未掩码。
V向量乘法/乘加浮点

指令行为说明

VFWMUL.VV 执行逐元素拓宽浮点乘法:每个活动元素计算 vs2[i] × vs1[i],结果以 2*SEW 宽度写入 vd[i]。它不读取旧 vd 作为累加项;掩码、vl 和当前 vtype 决定哪些元素执行。

VFWMUL.VV 指令解析与执行动画

从 OP-V 编码解码到逐元素拓宽浮点乘法:两个 SEW=32 源先扩展,乘积写入 2*SEW=64 的结果。

输入的指令
vfwmul.vv
执行环境
LMULm1本动画固定的寄存器组倍数
VLEN4096固定向量寄存器长度(bits)
VLMAX128m1 下的最大元素数
vstart0本动画不展示 prestart 元素
frmRNE固定 RNE 的有限教学环境;真实指令使用动态 frm
FP stateFS enabledFS=Off 会触发非法指令;本动画固定展示 FS 已启用的架构路径
dest EEW64目标元素宽度
vta/vmata, ma尾部/非活动元素策略
opcode1010111OP-V 主操作码
编码字段
0xe0861257
31..26
25
24..20
19..15
14..12
11..7
6..0
111000
funct6
0
vm
01000
vs2
01100
vs1
001
funct3
00100
vd
1010111
OP-V
执行数据路径

lane 0: 1 * 0.5 -> 0.5

显示的 lane 与当前步骤高亮同步;其余逐元素结果位于下方。

步骤 1 / 15
读取 OP-V 编码字段

V 扩展浮点指令使用 OP-V 主操作码,字段包含 funct6、源寄存器、vm、funct3、vd 和 opcode。

逐元素结果
长向量在模块内部横向滚动,不造成页面溢出。
i=0活动
1 * 0.5
0.5
i=1活动
1.5 * 1
1.5
i=2跳过
v0.t=0,不执行
--
i=3活动
2.5 * 2
5
i=4活动
-3 * 2.5
-7.5
i=5活动
3.5 * 3
10.5
i=6跳过
v0.t=0,不执行
--
i=7活动
4.5 * 4
18
固定 VLEN=4096、LMUL=m1、vstart=0 的教学环境中,源元素先按 SEW=32 / binary32 精确表示并扩展到 binary64;乘法在 binary64 执行,再写入 2*SEW=64 的结果。本动画以 RNE 作为可核验示例;NaN、无穷和异常标志仍以官方 RVV 浮点规则为准。

快速理解与检索要点

VFWMUL.VV 将每个活动的 vs2[i] 与 vs1[i] 相乘,并把拓宽到 2*SEW 的结果写到 vd[i];没有旧 vd 累加项。

官方语法为 vfwmul.vv vd, vs2, vs1, vm:每个活动元素使用同 lane 的 vs2[i] 和 vs1[i]。
本指令是 2*SEW = SEW x SEW 的拓宽乘法;vd 元素宽度为源元素宽度的两倍。
没有旧 vd 累加项;需要拓宽融合累加时应比较 VFWMACC/VFWMSAC 系列的独立语义。
仅 vl 内且未被执行掩码关闭的元素执行;vm=0 时 v0 提供逐元素执行掩码。
OP-V 编码使用 opcode=1010111、funct3=001(OPFVV)与 funct6=111000。

向量执行上下文

阅读 VFWMUL.VV 时,不要只看助记符。官方 V 扩展语义还依赖当前 vl、vtype 和掩码状态。.vv:两个向量源逐元素参与运算。

先看 vl

当前 vl 决定 body 元素数量。典型代码会先执行 vsetvli、vsetivli 或 vsetvl,再执行本页指令。

再看 vtype

当前 vtype 提供 SEW、LMUL、tail policy 和 mask policy;这些规则影响元素宽度、寄存器组大小以及非活动/尾部目标元素。

最后看 vm/v0

带 vm 的普通向量指令在 vm=0 时用 v0 作为执行掩码,vm=1 表示未掩码。VMERGE 等少数形式会把 v0 当作数据选择输入。

官方来源:RISC-V V Standard Extension for Vector Operations

常见使用场景

高精度矩阵运算

结合 «vsetvli t0, a0, e32, m1, ta, ma vfwmul.vv v2, v4, v6 # vd[i] = widen(vs2[i]) * widen(vs1[i])» 等实际代码理解该场景。

混合精度ML

结合 «vsetvli t0, a0, e32, m1, ta, ma vfwmul.vv v2, v4, v6 # vd[i] = widen(vs2[i]) * widen(vs1[i])» 等实际代码理解该场景。

使用前检查清单

语法检查
  • 确认当前指令格式为 OPFVV。
  • 确认操作数排列顺序与示例一致。
语义检查
  • 确认目标寄存器用途和调用约定兼容。
  • 确认该指令不是伪指令展开后的底层形式。

容易混淆 / 常见误区

汇编顺序是 vd、vs2、vs1、vm;两条源向量在同一元素索引处配对相乘。
vd 写入 2*SEW 宽结果,不读取旧 vd 作为累加器;宽目的组的合法性与重叠约束必须符合当前 vtype。

常见问题

VFWMUL.VV 会读取旧 vd 吗?

不会。它只将 vs2[i] 与 vs1[i] 的乘积写入拓宽的 vd[i];旧 vd 累加输入属于拓宽融合乘加指令的语义。