David Chernin & Ethan Fetaya, Bar-Ilan University. All clips are unmodified (no attacks applied) — for perceptual quality comparison.
The same clip watermarked at each stage of CRAW's design, so you can hear the fidelity recovery directly against the pristine original: Q-Former pooling and inference-time masking recover most of the perceptual quality given up when the robust distortion layer (DL) is added, at a small further cost from the final error-correcting code (+ECC, full CRAW). Clips are randomly sampled from the held-out test set.
| Clip | Original | DL | +QFormer | +Mask | +ECC Full CRAW |
|---|---|---|---|---|---|
| Clip 1 |
|
|
|
|
|
| Clip 2 |
|
|
|
|
|
| Clip 3 |
|
|
|
|
|
| Clip 4 |
|
|
|
|
|
| Clip 5 |
|
|
|
|
|
| Clip 6 |
|
|
|
|
|
| Clip 7 |
|
|
|
|
|
| Clip 8 |
|
|
|
|
|
| Clip 9 |
|
|
|
|
|
| Clip 10 |
|
|
|
|
|
| Clip 11 |
|
|
|
|
|
| Clip 12 |
|
|
|
|
|
| Clip 13 |
|
|
|
|
|
| Clip 14 |
|
|
|
|
|
| Clip 15 |
|
|
|
|
|
| Clip 16 |
|
|
|
|
|
| Clip 17 |
|
|
|
|
|
| Clip 18 |
|
|
|
|
|
| Clip 19 |
|
|
|
|
|
| Clip 20 |
|
|
|
|
|
CRAW (full model) against the external baselines: WavMark, AudioSeal, TimbreWM, AWARE, and WMCodec, plus the original unwatermarked clip for reference. Clips are randomly sampled from the held-out test set.
| Clip | Original | CRAW Ours | WavMark | AudioSeal | TimbreWM | AWARE | WMCodec |
|---|---|---|---|---|---|---|---|
| Clip 1 |
|
|
|
|
|
|
|
| Clip 2 |
|
|
|
|
|
|
|
| Clip 3 |
|
|
|
|
|
|
|
| Clip 4 |
|
|
|
|
|
|
|
| Clip 5 |
|
|
|
|
|
|
|
| Clip 6 |
|
|
|
|
|
|
|