KurtDu/hunyuan3D-Agent-G2

2

stars

20

commits

Python

primary language

Sep 11, 2025

updated

README

hunyuan3D-Agent-G2

项目简介

本项目用于将复杂场景的文本描述自动解耦为单个物体及其空间关系,支持多种大模型推理,最终生成 3D 场景。

环境配置

建议使用 Python 3.9+。

依赖安装

pip install -r requirements.txt

依赖说明

  • openai:用于调用 OpenAI GPT-3/4 API
  • transformers、torch、accelerate、huggingface_hub:用于调用 HuggingFace 上的大模型

框架流程图

框架流程图

主要流程

  1. 用户输入场景描述(Prompt)
  2. T2T LLM 解耦场景,输出物体信息和空间特征
  3. T2I LLM 生成多视图
  4. hunyuan3D-2.1 生成 3D 对象
  5. Coder LLM 编写 Blender 脚本
  6. Blender 组合渲染,输出最终 3D 场景

各模块使用说明

Part 1: 场景解耦 (object_layout_extractor.py)

  • 功能: 使用大模型将复杂场景描述解耦为单个物体及其空间关系
  • 输出: object_info.txt (物体信息),layout_info.txt (空间特征)
  • 单独运行: python object_layout_extractor.py

Part 2: 文字转图像 (part2_qwen_image.py)

  • 功能: 使用Qwen-VL模型从物体描述生成多视图图像
  • 输入: Part 1 生成的物体信息文件
  • 输出: 生成的物体图像保存至 generated_images/ 目录
  • 单独运行: python part2_qwen_image.py

Part 3: 图像转3D模型 (img_to_3d.py)

  • 功能: 使用腾讯混元3D模型将图像转换为3D模型
  • 输入: Part 2 生成的图像文件
  • 输出: 3D模型文件保存至 models/ 目录
  • 配置: 需要腾讯云API密钥 (secret_id, secret_key)

Part 4: 生成Blender脚本 (code_llm.py)

  • 功能: 使用代码生成大模型编写Blender场景脚本
  • 输入: 3D模型信息和空间关系描述
  • 输出: blender_scene_script.py Blender脚本文件
  • 配置: 需要API密钥 (支持OpenAI格式API)

Part 5: Blender渲染 (part5.py)

  • 功能: 执行Blender脚本,渲染最终3D场景
  • 输入: Part 4 生成的Blender脚本
  • 输出: 渲染图像
  • 单独运行: python run_part5_only.py

运行方式

完整流水线

python main.py

分步骤运行

# Part 1: 场景解耦
python object_layout_extractor.py

# Part 2: 生成图像
python part2_qwen_image.py

# Part 3 & 4: 在main.py中配置API密钥后运行相应部分

# Part 5: Blender渲染
python run_part5_only.py

注意事项

  • 有些部分需要配置相应的API密钥
  • Part 2需要GPU环境运行Qwen-VL模型
  • Part 5需要安装Blender并配置Python环境

Contributors

yuqiannemo

11 commits

opengsslam

3 commits

KurtDu

2 commits

xieleixielei

2 commits

KurtDu/hunyuan3D-Agent-G2

2

stars

20

commits

Python

primary language

Sep 11, 2025

updated

README

hunyuan3D-Agent-G2

项目简介

本项目用于将复杂场景的文本描述自动解耦为单个物体及其空间关系,支持多种大模型推理,最终生成 3D 场景。

环境配置

建议使用 Python 3.9+。

依赖安装

pip install -r requirements.txt

依赖说明

  • openai:用于调用 OpenAI GPT-3/4 API
  • transformers、torch、accelerate、huggingface_hub:用于调用 HuggingFace 上的大模型

框架流程图

框架流程图

主要流程

  1. 用户输入场景描述(Prompt)
  2. T2T LLM 解耦场景,输出物体信息和空间特征
  3. T2I LLM 生成多视图
  4. hunyuan3D-2.1 生成 3D 对象
  5. Coder LLM 编写 Blender 脚本
  6. Blender 组合渲染,输出最终 3D 场景

各模块使用说明

Part 1: 场景解耦 (object_layout_extractor.py)

  • 功能: 使用大模型将复杂场景描述解耦为单个物体及其空间关系
  • 输出: object_info.txt (物体信息),layout_info.txt (空间特征)
  • 单独运行: python object_layout_extractor.py

Part 2: 文字转图像 (part2_qwen_image.py)

  • 功能: 使用Qwen-VL模型从物体描述生成多视图图像
  • 输入: Part 1 生成的物体信息文件
  • 输出: 生成的物体图像保存至 generated_images/ 目录
  • 单独运行: python part2_qwen_image.py

Part 3: 图像转3D模型 (img_to_3d.py)

  • 功能: 使用腾讯混元3D模型将图像转换为3D模型
  • 输入: Part 2 生成的图像文件
  • 输出: 3D模型文件保存至 models/ 目录
  • 配置: 需要腾讯云API密钥 (secret_id, secret_key)

Part 4: 生成Blender脚本 (code_llm.py)

  • 功能: 使用代码生成大模型编写Blender场景脚本
  • 输入: 3D模型信息和空间关系描述
  • 输出: blender_scene_script.py Blender脚本文件
  • 配置: 需要API密钥 (支持OpenAI格式API)

Part 5: Blender渲染 (part5.py)

  • 功能: 执行Blender脚本,渲染最终3D场景
  • 输入: Part 4 生成的Blender脚本
  • 输出: 渲染图像
  • 单独运行: python run_part5_only.py

运行方式

完整流水线

python main.py

分步骤运行

# Part 1: 场景解耦
python object_layout_extractor.py

# Part 2: 生成图像
python part2_qwen_image.py

# Part 3 & 4: 在main.py中配置API密钥后运行相应部分

# Part 5: Blender渲染
python run_part5_only.py

注意事项

  • 有些部分需要配置相应的API密钥
  • Part 2需要GPU环境运行Qwen-VL模型
  • Part 5需要安装Blender并配置Python环境

Contributors

yuqiannemo

11 commits

opengsslam

3 commits

KurtDu

2 commits

xieleixielei

2 commits

Languages

Python

100.0%