
EEmo-Logic: dạy mô hình đa phương thức hiểu cảm xúc mà một bức ảnh gợi lên

DINOde: nối CLIP và DINO bằng một quỹ đạo ODE liên tục cho phân vùng ngữ nghĩa mở

Hand Visibility Detector: khi model ước lượng tư thế bàn tay cần biết nó đang "đoán mò"

DSMCL: Học nhất quán hai không gian cho bài toán Re-Identification xuyên phương thức

5 cấp độ tự chủ của AI Agent: một khung tư duy để thiết kế mức độ can thiệp của con người

PhyEdit: chỉnh sửa ảnh hiểu đúng vật lý 3D, không còn "dán" vật thể sai tỉ lệ

PROVE: Khung đánh giá độ mạch lạc khi xoá vật thể khỏi ảnh và video

TurboVLA: mô hình Vision-Language-Action thời gian thực 32 Hz trên RTX 4090, dưới 1 GB VRAM

Vì sao CLAUDE.md cứ phình to mãi? Hiện tượng "catastrophic remembering" trong agentic coding
CLIP Domain Adapter cho phân loại xe máy: từ ý tưởng đến 97.46% accuracy
Edge-MoR: router spiking cho model biên