Available for Fall 2027 · Full-time & Internship

Applied Statistics / AI Product

Hi, I'm Jiayi Lu. I turn data into decisions, products, and the occasional aha.

陆嘉熠 头像
L

深圳大学应用统计硕士 · AI 应用 / 数据科学方向
把统计直觉和 LLM / Agent 能力结合,做出能落地的产品。

  • BaseShenzhen, CN
  • MajorApplied Statistics · M.S.
  • FocusAI 应用 · 数据科学
Scroll
01

关于 — About

一个把数据和产品缝起来的人。

我是陆嘉熠,深圳大学应用统计硕士,2027 届秋招。 本科是建筑环境与能源应用工程,硕士转向统计与 AI —— 这条路径不是巧合,我对"用统计直觉判断边界,再交给 LLM / Agent 放大"这条路有持续兴趣。

方向上覆盖 AI 应用 / 数据科学 两条线: SlayQuiz(AI 出题闯关小程序,跑通从 0 到 1 的产品闭环)、 Strategem(面向储能/虚拟电厂的多 Agent 决策情报平台),同时在中金财富证券战略与数字化中心的数据与 AI 敏捷团队实习,处理 60 万 + 潜客数据,做画像、归因与 A/B 实验。

学术方面一篇 ICME 2026 (CCF-B) 一作(SGT-Aug,长尾多标签分类)、 一项 CPCI 国际会议一作(基于集成学习的时序预测),并以队长身份拿到全国大学生统计建模大赛广东赛区研究生组三等奖。

做项目时坚持三个问题:这个数字背后是什么业务问题? 模型的边界在哪里? 上线后谁会受影响? 站点结构按业界作品集惯例排:02 经历 · 03 项目 · 04 技能,可与简历对照阅读。

02

经历 — Experience

最近的实习 · 时间倒序。

  1. 2026.05 – 2026.09 实习

    数据分析实习生 @ · 中国中金财富证券 · 战略与数字化中心 · 数据与人工智能敏捷团队

    数据分析与画像体系:用 Python 处理 60 万 + 潜客数据(含 80 + 业务字段),搭建五维潜客画像分析框架; 建立 7 大维度、1000 + 存量标签的层级标签体系,为精准圈客与客户洞察智能体提供标准化数据底座。

    渠道转化与归因分析:分析 18 个互联网渠道的获客与转化效率,通过漏斗矩阵定位 6 个核心渠道的 3 个关键流失断点(流失率最高约 50%); 采用归因分析定位用户流失关键因素;提出基于"渠道贡献—转化效率"四象限的渠道资源分配策略与触达优化建议。

    统计建模与策略验证:用逻辑回归 + 随机森林分析转化影响因素;通过聚类做潜客画像分层; 用双样本假设检验对比相同断点客群在不同触达策略下的转化差异; 设计分层 A/B 测试框架,为差异化策略提供实验假设依据。

    • Python
    • SQL
    • 归因分析
    • 漏斗分析
    • A/B Testing
    • 随机森林
03

项目 — Selected Work

3 个最能说明"我能做什么"的项目。

  • SGT-Aug 论文图:左为 t-SNE 嵌入,右为类激活热图 Fig. 1 — t-SNE & Class Activation
    P / 01

    SGT-Aug · 长尾多标签分类的语义引导数据增强 · ICME 2026 (CCF-B) 一作

    用预训练 Transformer 帮 ResNet 找"长尾类相关前景区域",给少样本类别定向做数据增强。

    问题:长尾多标签图像分类里,尾类样本少、视觉特征弱,直接训容易把尾类"压"掉。

    做法:基于 ResNet50 骨干 + 预训练 Transformer 做语义-视觉交互,定位尾类相关前景区域; 在定位结果上构建数据增强策略,缓解长尾类别的不平衡(不加剧类别不平衡)。

    训练与验证:在 Linux + PyTorch 上用单机多卡 DataParallel 分布式训练; 在 VOC-LT / COCO-LT 上做系统对比和消融实验,结合常用分类损失函数即可优于多种现有长尾多标签方法。

    • PyTorch
    • ResNet50
    • Transformer
    • DataParallel
    • VOC-LT / COCO-LT
  • P / 02

    SlayQuiz · AI 出题闯关微信小程序

    负责从需求调研、竞品分析、方案设计到前后端实现的完整链路,做出能自己出题、自己改错题的产品。

    前后端 + 核心产品:基于 Taro + TypeScript 构建微信小程序,配合 FastAPI 后端实现岗位创建、题目生成、答题记录、结果分析、知识库管理等核心接口。

    AI 生成链路:用 LangChain + DeepSeek 搭出题与反馈管线,加 JD 校验、联网搜索增强、结构化输出、题目规则校验四道关,提升题目生成与解析反馈的稳定性。

    RAG 私有知识库:支持 PDF / Word / URL 资料解析,文本切分后用 DashScope Embedding 向量化,存到 Qdrant,按用户隔离知识库,用于定制化练习出题。 还搭了学习增强闭环:错题本、间隔复习、变式题、知识库练习、自适应难度 + XP 激励。

    AI 编程工具:用 VSCode / Claude Code / MCP / Agent Skills 辅助需求拆解、方案验证、代码实现和测试修复。

    • Taro · TypeScript
    • FastAPI
    • LangChain
    • RAG · Qdrant
    • DashScope Embedding
    • Claude Code
  • P / 03

    Strategem · 企业决策情报多 Agent 平台

    面向储能 / 虚拟电厂等数字能源场景,把行业研究从"读报告"做成"跑流水线"。

    多 Agent 产业研究工作流:基于 FastAPI + LangGraph + Next.js 构建 Planner → Research → Analysis → Financial → Verification 协同工作流,把用户问题拆成 Research Plan、子问题、检索计划与结构化报告大纲,让产业研究 / 报告生成自动化。

    双源检索与可信证据体系:设计 Source + Router + RAG 双路检索机制,结论与数据源结构化绑定,降低信息幻觉; 把行业术语 / 价值链 / 指标口径做成可配置领域知识,注入到智能体里,覆盖产业链定位、政策市场、竞争格局、技术链等模块的动态深度分析。

    幻觉防控:围绕可信 AI 输出做引用链 + 审计机制,自动处理非法引用、未覆盖模块、低可信来源、重复证据和待验证问题。

    • LangGraph
    • RAG
    • FastAPI
    • Next.js
    • Postgres + pgvector
    • Claude / DeepSeek
  • LSTM + Bagging 集成时序预测方法流程图
    P / 04

    基于集成学习的时序序列预测模型研究 · CPCI 一作

    金融时序非线性强、噪声大,单 LSTM 不够稳。论文用 Bagging + LSTM 把误差打下来。

    特征工程:对股票历史数据做探索性分析,挖掘开盘 / 收盘 / 成交量等关键指标,构建多维时序特征; 用 Fourier 变换和 B-spline 基函数做时序平滑和特征映射。

    核心模型:基于 TensorFlow 搭 LSTM 基预测模型,捕捉长期依赖。

    集成与验证:用 Bagging 集成框架构建差异化训练子集,并行训练多个 LSTM 基学习器; 在多个预测时间段上,预测误差均显著低于单一 LSTM 模型。

    • TensorFlow
    • LSTM
    • Bagging
    • Fourier / B-spline
    • 时间序列
  • 肺部 X 光片智能识别研究方法流程图
    P / 05

    肺部 X 光片智能识别与统计建模 · 全国大学生统计建模大赛 · 队长

    用 CNN 抓局部纹理 + GNN 抓区域关系,给肺炎 X 光片做分类。

    问题:肺部影像里病灶区域分散,单看局部纹理容易漏掉空间关系线索。

    做法:提出 SLICO 超像素分割构建肺部 X 光区域邻接图,用 CNN 提取节点特征,再用 GNN 建模区域间关系,做局部特征和区域关系的联合表征。

    结果:系统性设计对比实验与评估流程,推动模型关键指标提升,分类准确率 92%,敏感性 91.5%,AUC 99.5%; 作为队长负责技术路线规划、对比实验设计与团队协调。

    • PyTorch
    • CNN
    • GNN(图神经网络)
    • SLICO 超像素
    • 医学影像
  • 基于 Stacking 集成框架的糖尿病预测模型流程图
    P / 06

    基于 Stacking 集成框架的糖尿病预测模型 · PIMA · Stacking 集成

    用 Stacking 把 LR / SVM / CART 三个基学习器 + AdaBoost / GBDT 串起来,在 PIMA 上把 AUC 拉到 0.96。

    数据预处理:针对类别不平衡,先用 KNN 填补缺失值,再做随机下采样平衡正负样本; 划分 80% 训练集 / 20% 测试集,并对数值特征做归一化。

    基学习器 + Boosting:构建逻辑回归(LR)/ SVM / CART 决策树三类基分类模型; 以决策树为基学习器进一步搭建 AdaBoost 与 Gradient Boosting 集成模型。

    Stacking + 超参搜索:用 5 折交叉验证 + 贝叶斯优化(Optuna)做超参搜索; 最终 Stacking 融合模型在测试集上 AUC=0.96 / Recall=0.84 / Accuracy=0.89AUC 较逻辑回归基线提升 10.3%

    • 逻辑回归 · SVM
    • CART 决策树
    • AdaBoost · GBDT
    • Stacking
    • Optuna
    • PIMA
04

技能 — Stack

AI 应用 / 机器学习 / 数据分析 / 工程 & 证书 四个维度。

S / 01

AI 应用 & 开发

  • LangChain · LangGraph · Agent / 多 Agent 编排
  • RAG · Embedding · 向量检索(Qdrant / pgvector)
  • FastAPI · Docker · Postgres
  • Claude / DeepSeek · Prompt · 工具调用
  • Claude Code / Codex / MCP / Agent Skills 辅助开发
S / 02

机器学习 & 深度学习

  • PyTorch · TensorFlow(CCF-B / CPCI 一作经验)
  • CNN · GNN · ResNet · Transformer
  • LSTM · 时序建模 · Bagging 集成
  • 随机森林 / 聚类 / 假设检验 / 回归
  • 单机多卡 DataParallel 分布式训练
S / 03

数据分析 & 实验

  • Python · pandas / NumPy / scipy
  • SQL · 复杂查询 / 窗口函数 / 60 万 + 潜客实战
  • 漏斗分析 · 归因分析 · 分层 A/B 实验
  • 五维用户画像 / 1000 + 标签体系搭建
  • R 语言(课程项目)
S / 04

证书 & 其他

  • CDA 数据分析师 · Level I & II
  • CDGA 数据治理工程师
  • CET-6 · 537 分
  • 专业排名 3 / 20 · 一等奖学金
  • 共产党员 · 23 岁