继今年4月推出业界首个原生统一多模态大模型SenseNova U1后,商汤科技正式开源其系统性升级版本——SenseNova U1.5-Lite-Preview。该模型并非参数堆叠式迭代,而是在NEO-Unify原生架构下完成的深度能力重构:以仅80亿参数(8B-MoT)的轻量规模,首次在单一模型中贯通视觉理解、推理、生成与交互式编辑四大核心能力,并全面支持4K超清输出、复杂版式排布、中英双语文字生成及可持续迭代式图像修改。
U1.5-Lite-Preview的核心突破体现在三方面:其一,生成质量跃升——支持10:3超宽幅4K长卷生成,细节经得起逐像素放大,材质质感、光影层次与空间一致性显著增强;其二,指令遵循能力质变——可稳定解析长达3880词的结构化视觉指令,无需依赖特定Prompt模板,即能准确执行复古博物图鉴风格、双语对照、拉丁学名标注等多重约束;其三,编辑范式革新——摒弃传统拼接式方案,采用encoder-free建模,在统一模型内完成内容识别、区域定位、约束推理与像素重绘全流程,支持框选编辑、文字保真替换、多参考图融合、单图条件再设计等专业工作流。
为降低创作门槛,团队同步推出实验性Prompt Enhance Skill工具,可将用户简短构思自动转化为含主体、构图、风格、文字与约束的完整提示方案。实测显示,U1.5-Lite-Preview在Qwen-Image-Bench、ImgEdit-Bench及中英文GEdit-Bench等主流评测中全面超越U1,性能比肩商用闭源模型。目前模型已通过GitHub与Hugging Face平台向全球开发者开放。
来源:雷峰网
