-
LeCun和谢赛宁合作发布了名为Cambrian-1的视觉多模态模型,这是首个以视觉为中心设计的SOTA MLLM(大规模语言模型)。该模型全面开源,包括权重、代码、数据集和评估方法。
-
Cambrian-1模型通过使用三种不同参数大小的LLM(LLaMA-3-Instruct-8B、Vicuna-1.5-13B、Hermes-2-Yi-34B)进行训练,并结合四种视觉模型(SigLIP、CLIP、DINOv2、OpenCLIP ConvNeXt),在250万条适配器数据和700万条指令微调数据的基础上训练而成。
-
Unique3D是一个开源的3D生成模型,能够快速将平面图像转换为高质量的3D模型。它通过三个主要阶段实现这一功能:多视图生成、高分辨率上采样和3D Mesh重建,强调高保真度、高一致性与高效能。
-
Unique3D相较于传统方法(如Score Distillation Sampling等),解决了长期优化时间长、几何质量差、不一致性和生成分辨率低等问题。它特别解决了多视图扩散模型在细节处理上的局限性。