LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks
Paper • 2608.23200 • Published • 6
Fundamental Al Methods; Perception & World Modeling; Reasoning & Generation; Action & Interaction
WebRISE: Requirement-Induced State Evaluation for MLLM-Generated Web Artifacts
SIN-Bench: Tracing Native Evidence Chains in Long-Context Multimodal Scientific Interleaved Literature