首页/指令库/VFWMACC-VV
VFWMACC.VV

RISC-V VFWMACC.VV 指令详解

指令手册OPFVV

拓宽融合乘加:vs1[i] 与 vs2[i] 为 SEW 宽乘数,宽 vd[i] 为 2*SEW 加数和结果;(vs1[i] * vs2[i]) + vd[i]。

指令语法

vfwmacc.vv vd, vs1, vs2, vm
操作数说明
vd:目标向量寄存器组。
vs2/vs1 或标量源:按指令后缀 .vv/.vx/.vi/.vf 决定来源。
vm:若语法包含 vm,vm=0 使用 v0 作为执行掩码,vm=1 为未掩码。
V向量乘法/乘加浮点

指令行为说明

VFWMACC.VV 按官方 RVV 语义覆盖宽加数:vs1[i] 与 vs2[i] 是 SEW 宽乘数,vd[i] 同时是 2*SEW 宽输入和结果。每个活动元素执行 (vs1[i] * vs2[i]) + vd[i],以一次融合浮点运算舍入到宽结果格式。vm=0 时 v0.t 控制元素是否执行;本页面的可交互示例固定展示 SEW=32 到 binary64 的可核验路径。

VFWMACC.VV 指令解析与执行动画

从 OP-V 编码解码到逐元素拓宽融合乘加:两个 SEW=32 乘数与 2*SEW=64 的宽 vd[i] 在一次 binary64 融合运算中生成结果;第二乘数来自 same-lane vs1。

输入的指令
vfwmacc.vv
执行环境
LMULm1本动画固定的寄存器组倍数
VLEN4096固定向量寄存器长度(bits)
VLMAX128m1 下的最大元素数
vstart0本动画不展示 prestart 元素
frmRNE固定 RNE 的有限教学环境;真实指令使用动态 frm
FP stateFS enabledFS=Off 会触发非法指令;本动画固定展示 FS 已启用的架构路径
acc/dest EEW64vd 是 FP64 宽加数和结果
vta/vmata, ma尾部/非活动元素策略
opcode1010111OP-V 主操作码
编码字段
0xf0861257
31..26
25
24..20
19..15
14..12
11..7
6..0
111100
funct6
0
vm
01000
vs2
01100
vs1
001
funct3
00100
vd
1010111
OP-V
执行数据路径

lane 0: fma(1 * 0.5, +0.5) -> 1

显示的 lane 与当前步骤高亮同步;其余逐元素结果位于下方。

步骤 1 / 15
读取 OP-V 编码字段

V 扩展浮点指令使用 OP-V 主操作码,字段包含 funct6、源寄存器、vm、funct3、vd 和 opcode。

逐元素结果
长向量在模块内部横向滚动,不造成页面溢出。
i=0活动
fma(1 * 0.5, +0.5)
1
i=1活动
fma(1.5 * 1, +-1)
0.5
i=2跳过
v0.t=0,不执行
--
i=3活动
fma(2.5 * 2, +-2.5)
2.5
i=4活动
fma(-3 * 2.5, +4)
-3.5
i=5活动
fma(3.5 * 3, +-4.5)
6
i=6跳过
v0.t=0,不执行
--
i=7活动
fma(4.5 * 4, +-8.5)
9.5
固定 VLEN=4096、LMUL=m1、vstart=0 的教学环境中,vs1[i] 或 f[rs1] 与 vs2[i] 按 SEW=32 / binary32 读取,vd[i] 按 2*SEW=64 / binary64 读取和写回。每个活动 lane 按 (vs1 * vs2) + vd 进行一次精确乘加后再以 RNE 舍入到 binary64;本动画以 BigInt 精确中间值避免错误的两次舍入。真实指令使用动态 frm,保留 frm 编码不能执行;FS=Off 会触发非法指令。有限输入可交互验证;NaN、无穷和异常标志仍以官方 RVV 浮点规则为准。

快速理解与检索要点

先把 vs1[i] 与 vs2[i] 作为 SEW 宽乘数读取,再与宽 vd[i] 按 (vs1[i] * vs2[i]) + vd[i] 融合;vd[i] 被结果覆盖。

官方将所有 widening FMA 定义为覆盖宽加数:乘数输入为 SEW,vd 加数和目的元素为 2*SEW。
本条的每元素公式为 vd[i] = (vs1[i] * vs2[i]) + vd[i]。
编码为 opcode=1010111 (OP-V)、funct3=001 (OPFVV)、funct6=111100。
只执行 vl 中的活动元素;vm=0 时由 v0.t 决定元素是否执行。
浮点算术采用 frm;本交互动画以 RNE 展示有限 binary32 到 binary64 的精确融合计算。

向量执行上下文

阅读 VFWMACC.VV 时,不要只看助记符。官方 V 扩展语义还依赖当前 vl、vtype 和掩码状态。.vv:两个向量源逐元素参与运算。

先看 vl

当前 vl 决定 body 元素数量。典型代码会先执行 vsetvli、vsetivli 或 vsetvl,再执行本页指令。

再看 vtype

当前 vtype 提供 SEW、LMUL、tail policy 和 mask policy;这些规则影响元素宽度、寄存器组大小以及非活动/尾部目标元素。

最后看 vm/v0

带 vm 的普通向量指令在 vm=0 时用 v0 作为执行掩码,vm=1 表示未掩码。VMERGE 等少数形式会把 v0 当作数据选择输入。

官方来源:RISC-V V Standard Extension for Vector Operations

常见使用场景

高精度矩阵运算

结合 «vsetvli t0, a0, e32, m1, ta, ma vfwmacc.vv v4, v8, v12 # vd[i] = (v12[i] * v8[i]) + vd[i]» 等实际代码理解该场景。

混合精度ML

结合 «vsetvli t0, a0, e32, m1, ta, ma vfwmacc.vv v4, v8, v12 # vd[i] = (v12[i] * v8[i]) + vd[i]» 等实际代码理解该场景。

使用前检查清单

语法检查
  • 确认当前指令格式为 OPFVV。
  • 确认操作数排列顺序与示例一致。
语义检查
  • 确认目标寄存器用途和调用约定兼容。
  • 确认该指令不是伪指令展开后的底层形式。

容易混淆 / 常见误区

官方公式是 vd[i] = (vs1[i] * vs2[i]) + vd[i];vd 是宽加数且被结果覆盖。
两个乘数为 SEW 宽,vd 为 2*SEW 宽;不要把本指令当作普通单宽 FMA 或纯 VFWMUL。
融合乘加只在最终宽结果处舍入,不应拆成先舍入乘积再相加的两步模型。

常见问题

vd 是仅输出寄存器吗?

不是。官方定义中 vd 是 2*SEW 宽加数,也会被最终结果覆盖;动画将它作为可编辑的累加器输入显示。