ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation
Paper ⢠2608.04436 ⢠Published ⢠59
None defined yet.
Learning to Retrieve from Agent Trajectories
HomeSafe-Bench: Evaluating Vision-Language Models on Unsafe Action Detection for Embodied Agents in Household Scenarios