jev-curate - High-Throughput Dataset Sifter in Rust
这是 Akash Priyadarshi 公开的项目资料。本站按原始来源展示项目信息,用中文说明适用场景和阅读边界;项目名、源帖与代码保持原样,便于逐项核对。
这条案例记录了什么
场景
工具选择、Agent 评估
选择工具标识;参数校验、权限和执行仍由程序负责。
证据
社区公开项目或作者演示
原始来源:Akash Priyadarshi via GitHub。尚未独立核实。
时间与作者
Akash Priyadarshi
记录日期:2026-09-18。日期与身份应以原始资料为准。
怎样核对这个项目
- 先打开原始来源,确认作者、日期与 Jev 在项目中的具体用途。
- 如果提供仓库,再检查代码、运行要求和许可证;仓库存在不代表本站已经运行成功。
- 对速度、成本、准确率和规模数字,查看原文的任务、环境和计算口径。
- 工具列表和版本。
- 参数与权限检查。
- 不执行或人工复核分支。
- 是否有可观察的正确答案。
原始文字与技术细节
以下内容保留原语言,供核对事实。中文页的场景说明是阅读提示,不是逐句翻译或实测结论。
展开英文项目摘要与原帖
项目摘要
jev-curate is a high-throughput dataset curation engine written in Rust by Akash Priyadarshi. It streams gigabyte-scale Parquet and JSONL datasets through Jev decision pipelines, scoring quality, topic relevance, and safety risks with typed Choice, Score, and Noul judgments at measured speeds up to 24 rows per second.
来源原文
High-throughput synthetic and pretraining dataset sifter for TypeSafe Jev. Rust streaming core, Parquet and JSONL I/O, typed Choice/Score/Noul judgments, 24.0 rows/sec measured.
原记录的限制
- Requires Rust toolchain to compile.
- Throughput is bounded by network concurrency to Jev API endpoints.