arXiv cs.SD
Sound daily digest.
51 past editions, oldest first by date. Atom feed → · all categories
01 — Past editions
most recent first- 2026-07-19 RW-Voice-EQ Bench: A Real World Benchmark for Evaluating Voice AI Systems 4 papers · No. 58
- 2026-07-18 RW-Voice-EQ Bench: A Real World Benchmark for Evaluating Voice AI Systems 4 papers · No. 57
- 2026-07-17 RW-Voice-EQ Bench: A Real World Benchmark for Evaluating Voice AI Systems 4 papers · No. 56
- 2026-07-16 From Prediction to Collaboration: Interactive Symbolic Music Analysis 1 papers · No. 55
- 2026-07-15 ChartGenEval: Corruption-Tested Multi-Dimensional Feedback for Rhythm-Game... 3 papers · No. 54
- 2026-07-14 Encoder-Side Neuron Identification and Amplification for Acoustic Perception... 4 papers · No. 53
- 2026-07-13 ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient... 3 papers · No. 52
- 2026-07-12 MulTTiPop: A Multitrack Transcription Dataset for Pop Music 4 papers · No. 51
- 2026-07-11 MulTTiPop: A Multitrack Transcription Dataset for Pop Music 4 papers · No. 50
- 2026-07-10 MulTTiPop: A Multitrack Transcription Dataset for Pop Music 4 papers · No. 49
- 2026-07-09 MADB: A Large-Scale Music Aesthetics Dataset with Professional and... 1 papers · No. 48
- 2026-07-08 Designing Maintainable Hybrid Generative Systems: A Quantum-Inspired... 3 papers · No. 47
- 2026-07-07 SynSFX: Multi-Model Sound Effects Synthesis Dataset for Deepfake Detection... 1 papers · No. 46
- 2026-07-06 SelectTSL: Prompt-Guided Selective Target Sound Localization in Complex Scenarios 2 papers · No. 45
- 2026-07-05 SelectTSL: Prompt-Guided Selective Target Sound Localization in Complex Scenarios 2 papers · No. 44
- 2026-07-04 SelectTSL: Prompt-Guided Selective Target Sound Localization in Complex Scenarios 2 papers · No. 43
- 2026-07-03 SelectTSL: Prompt-Guided Selective Target Sound Localization in Complex Scenarios 2 papers · No. 42
- 2026-07-02 A Geometric Perspective on Composable Emotion Steering in Text-to-Speech Models 3 papers · No. 41
- 2026-07-01 ZEBRA: Zero-Shot Entropy-Regularized Prompt Learning for Base-to-Novel... 3 papers · No. 40
- 2026-06-30 LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation... 2 papers · No. 39
- 2026-06-29 DG^VoiC: Speaker Clustering for Fraud Investigation under Real Call-Centre Conditions 5 papers · No. 38
- 2026-06-28 VoiceTTA: Enhancing Zero-Shot Text-to-Speech via Reinforcement... 1 papers · No. 37
- 2026-06-27 VoiceTTA: Enhancing Zero-Shot Text-to-Speech via Reinforcement... 1 papers · No. 36
- 2026-06-26 VoiceTTA: Enhancing Zero-Shot Text-to-Speech via Reinforcement... 1 papers · No. 35
- 2026-06-25 STEB: A Speech-to-Speech Translation Expressiveness Benchmark for Evaluating... 4 papers · No. 34
- 2026-06-24 Beyond U-Net: A Latent-Representation-Aligned Skip-Free Backbone for... 3 papers · No. 33
- 2026-06-23 The Watermark Shortcut: How Provenance Marking Sabotages Audio Deepfake Detection 3 papers · No. 32
- 2026-06-22 Hybrid Diffusion Transformer for Instruction-Guided Audio Editing via Rectified Flow 1 papers · No. 31
- 2026-06-21 Hybrid Diffusion Transformer for Instruction-Guided Audio Editing via Rectified Flow 1 papers · No. 30
- 2026-06-20 Hybrid Diffusion Transformer for Instruction-Guided Audio Editing via Rectified Flow 1 papers · No. 29
- 2026-06-19 Hybrid Diffusion Transformer for Instruction-Guided Audio Editing via Rectified Flow 1 papers · No. 28
- 2026-06-18 Reference-Driven Multi-Speaker Audio Scene Generation from In-the-Wild Priors 4 papers · No. 27
- 2026-06-17 Descriptor: Certus Caliber Classification Gunshot Dataset (C3GD) 2 papers · No. 26
- 2026-06-16 TuneJury: An Open Metric for Improving Music Generation Preference Alignment 7 papers · No. 25
- 2026-06-15 Listening with Attention: Entropy-Guided Explainability for... 7 papers · No. 24
- 2026-06-14 Generative Modeling of Bach-Style Symbolic Music: A Comparative Study of... 3 papers · No. 23
- 2026-06-13 Generative Modeling of Bach-Style Symbolic Music: A Comparative Study of... 3 papers · No. 22
- 2026-06-12 Generative Modeling of Bach-Style Symbolic Music: A Comparative Study of... 3 papers · No. 21
- 2026-06-11 PianoKontext: Expressive Performance Rendering from Deadpan Context 6 papers · No. 20
- 2026-06-10 What Do Deepfake Speech Detectors Actually Hear? 3 papers · No. 19
- 2026-06-09 Multi-View Speech Representation Learning for Parkinson's Disease Detection... 3 papers · No. 18
- 2026-06-08 Whisper Hallucination Detection and Mitigation via Hidden Representation... 8 papers · No. 17
- 2026-06-07 F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation 2 papers · No. 16
- 2026-06-06 F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation 2 papers · No. 15
- 2026-06-05 F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation 2 papers · No. 14
- 2026-06-02 Parameter-efficient Dual-encoder Architecture with Differentiable Choquet... 2 papers · No. 13
- 2026-05-30 Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense... 2 papers · No. 12
- 2026-05-27 PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis 2 papers · No. 10
- 2026-05-25 Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of... 1 papers · No. 9
- 2026-05-23 Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of... 1 papers · No. 8
- 2026-05-22 Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of... 1 papers · No. 7
Colophon
Set in Georgia, with system sans for interface chrome and a monospaced stack for code and paper identifiers. Sole accent: amber
#D99C5E. Built and served on an always-free VM. The masthead is set 14% letterspaced because newspapers do that and it works.