Not All Tokens Matter: Data-Centric Optimization for Efficient Code Summarization
Saima Afrin, Zaiyu Cheng, Tushar Sharma, Alexander Serebrenik, Massimiliano Di Penta, Antonio Mastropaolo
Training LLMs for code summarization is computationally expensive, and performance deteriorates on longer inputs. We investigate strategic data optimization through targeted token reduction to cut computational overhead while maintaining summary quality, comparing three token-level reduction techniques — Abstract Syntax Tree (AST) representations, Function Signatures, and CrystalBLEU-guided pruning — combined with semantic filtering across Java and Python. Optimal strategies turn out to be highly language-dependent: AST-based optimization improves Java by up to 37% with 56–73% fewer tokens but degrades Python, whereas Function Signatures excel in Python (83% token reduction), and CrystalBLEU is robust across both languages (60–72% reduction). The key insight: which tokens are kept matters more than how many are removed, making language-aware token curation essential for efficient code summarization.