$ cat wiki/papers/2026/2607.20465-dataprep-bench.md
DataPrep-Bench: Benchmarking LLMs as Training Data Preparators
TL;DR
LLM 이 학습 데이터를 준비하는 능력을 처음부터 끝까지 채점하는 최초의 벤치마크다. 원자료에서 지도학습 데이터를 만들어내는 일과, 학습을 돌리기 전에 그 데이터셋이 학습할 가치가 있는지를 예측하는 일 두 가지를 모두 본다. 대표 결과는 부정적이다. Dolly-15k 위에 합성한 도메인 데이터를 얹으면 시험한 모든 생성기 계열에서 다운스트림 성능이 오히려 나빠지는 경우가 많다 (source).
저자와 소속
Peking University, Institute for Advanced Algorithms Research (Shanghai), OriginHub Technology, Zhongguancun Academy. 교신저자는 Wentao Zhang. 전체 저자 목록은 확보하지 못했다 — 이번 실행에서 arxiv.org 가 HTTP 403 을 반환해 검색 결과 요약을 통해 기록했다 (source).
arXiv: 2607.20465. 2026-07-28 Hugging Face Daily Papers 트렌딩 1위.
방법
데이터 준비를 두 능력으로 나누고, 하나의 프로토콜 안에서 둘 다 측정한다.
- 데이터 구성(data construction) — 원자료를 지도학습 데이터로 바꾸는 일.
- 데이터 품질 평가(data quality evaluation) — 학습을 돌리기 전에 후보 데이터셋의 학습 가치를 예측하는 일.
핵심이 되는 정의는 "품질"을 표면적인 텍스트 속성이 아니라 다운스트림 학습 효용으로 본다는 점이다. 구성 방법들은 동일한 원자료를 입력받고, 그 결과물로 Dolly-15k 와 함께 base model 을 fine-tuning 해서 채점된다. 평가는 여섯 개 도메인과 여러 base model 에 걸친다.
함께 공개된 기준 평가자는 Distributional Alignment Score (DAS) 로, 후보 데이터셋과 도메인 프록시 사이의 Maximum Mean Discrepancy (MMD) 를 측정한다 (source).
결과
보고된 결론은 Dolly-15k 위에 얹은 합성 도메인 데이터가 다운스트림 성능을 떨어뜨리는 경우가 많다는 것이며, 이것이 DataFlow 기반·직접 LLM·에이전트 기반 생성기 전반에서 똑같이 나타난다 — 특정 생성기 계열의 특이현상이 아니다.
도메인별·모델별 수치는 이번 실행에서 확보하지 못했다.
의의
이 결과가 유지된다면 두 가지가 따라 나온다.
첫째, 지난 2년의 반사적 관행 — 능력 있는 모델을 도메인에 겨누고 학습셋을 스스로 만들게 하면 된다는 — 에 대한 반론이다. 주장을 검증 가능하게 만드는 것은 이 벤치마크의 프로토콜이다. 모든 점수를 텍스트 품질 프록시가 아니라 실제 fine-tune 에 근거시킴으로써, 계산하기 쉬운 것이 아니라 실무자가 신경 쓰는 것을 측정한다.
둘째, agentic RL 연구가 없는 셈 치고 넘어가던 간극에 수치를 붙인다. 자기개선 파이프라인 — AREX: Towards a Recursively Self-Improving Agent for Deep Research, Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills — 은 생성된 데이터가 학습할 가치가 있다는 데 기대고 있다. 생성 데이터가 자주 그렇지 않다고 말하는 벤치마크는 그 루프에, 그리고 그 위에 쌓아 올린 재귀적 자기개선 논의(Frontier Pacing)에 직접적인 제약이 된다.
열린 질문
- 이 부정적 결과가 프론티어 규모에서도 유지되는가, 아니면 Dolly-15k 와 작은 base model 이라는 조건이 대표성이 없는 것인가?
- DAS 는 분포 기반 프록시다. 도메인 프록시에 대한 MMD 가 fine-tuning 결과를 실제로 얼마나 잘 예측하는가 — 그냥 fine-tune 을 돌려보는 것과 비교하면?
- 여섯 개 도메인이 무엇인지는 확보한 기록에 없다. 합성 데이터가 가장 공격적으로 쓰이는 코드와 agentic 도메인이 포함되었는지 알 수 없다.
- 제출일을 확인하지 못했다. 한 집계처는 2026-05-19 로 적고 있는데, 이는 2607 식별자와 맞지 않는다.
인용
DataPrep-Bench: Benchmarking LLMs as Training Data Preparators.
arXiv:2607.20465. https://arxiv.org/abs/2607.20465
관련: Agentic Reinforcement Learning · Agents (LLM Agents) · Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills