先看 vl
当前 vl 决定 body 元素数量。典型代码会先执行 vsetvli、vsetivli 或 vsetvl,再执行本页指令。
将 vs2[i] 与同 lane 的 vs1[i] 相乘,并将 2*SEW 宽的结果写入 vd[i]。
VFWMUL.VV 执行逐元素拓宽浮点乘法:每个活动元素计算 vs2[i] × vs1[i],结果以 2*SEW 宽度写入 vd[i]。它不读取旧 vd 作为累加项;掩码、vl 和当前 vtype 决定哪些元素执行。
从 OP-V 编码解码到逐元素拓宽浮点乘法:两个 SEW=32 源先扩展,乘积写入 2*SEW=64 的结果。
lane 0: 1 * 0.5 -> 0.5
显示的 lane 与当前步骤高亮同步;其余逐元素结果位于下方。
V 扩展浮点指令使用 OP-V 主操作码,字段包含 funct6、源寄存器、vm、funct3、vd 和 opcode。
VFWMUL.VV 将每个活动的 vs2[i] 与 vs1[i] 相乘,并把拓宽到 2*SEW 的结果写到 vd[i];没有旧 vd 累加项。
阅读 VFWMUL.VV 时,不要只看助记符。官方 V 扩展语义还依赖当前 vl、vtype 和掩码状态。.vv:两个向量源逐元素参与运算。
当前 vl 决定 body 元素数量。典型代码会先执行 vsetvli、vsetivli 或 vsetvl,再执行本页指令。
当前 vtype 提供 SEW、LMUL、tail policy 和 mask policy;这些规则影响元素宽度、寄存器组大小以及非活动/尾部目标元素。
带 vm 的普通向量指令在 vm=0 时用 v0 作为执行掩码,vm=1 表示未掩码。VMERGE 等少数形式会把 v0 当作数据选择输入。
结合 «vsetvli t0, a0, e32, m1, ta, ma vfwmul.vv v2, v4, v6 # vd[i] = widen(vs2[i]) * widen(vs1[i])» 等实际代码理解该场景。
结合 «vsetvli t0, a0, e32, m1, ta, ma vfwmul.vv v2, v4, v6 # vd[i] = widen(vs2[i]) * widen(vs1[i])» 等实际代码理解该场景。
不会。它只将 vs2[i] 与 vs1[i] 的乘积写入拓宽的 vd[i];旧 vd 累加输入属于拓宽融合乘加指令的语义。