About

我把复杂系统做成可用工具。

我是卫少东,也可以叫我 Ladydd。我的项目看起来横跨很多方向:爬虫、数据工程、多模态、AI Agent、生信、小程序、基础设施。但它们背后是同一种能力:快速理解一个领域,抽出数据结构和工作流,再用工程手段把它做成能持续运行的产品。

04 / Data Collection

数据采集与自动化

我能把复杂网站和业务系统里的非标准数据,稳定采集、清洗、结构化,并接入后续分析链路。在这个方向上,我更强调通用工程能力:会话隔离、浏览器自动化、频率控制、异常恢复和数据入库。

我能解决的问题

当业务依赖外部平台数据,但页面变化、登录态、频率限制和非结构化内容让采集不稳定时,我能设计一套可维护的采集系统,而不是一次性的脚本。

主系统案例

外部平台数据接入系统

这个系统处理的是页面形态复杂、字段不稳定、结果需要长期复用的外部数据。重点不是“抓到一次”,而是把浏览器自动化、任务调度、清洗规则、异常恢复和结构化入库组织成一条稳定的数据入口。

完整链路
任务生成、页面交互、字段抽取、数据清洗、失败回放、入库校验,最后把原始内容变成后续分析系统可以直接使用的数据资产。
体现能力
浏览器自动化、会话隔离、频率控制、异常恢复、结构化入库和质量检查。
  • Browser Automation
  • ETL
  • Data Quality

支撑能力片段

从采集到分析的连接层

采集只是系统的第一步。更重要的是把原始数据、清洗结果和分析表分层保存,让后续的数仓、向量检索、空间计算和报告系统都能追溯来源、复用字段、稳定增量更新。

完整链路
原始数据保留、字段标准化、重复检测、派生表生成、批处理回放,避免数据只停留在脚本输出阶段。
体现能力
把非标准外部数据转成可维护、可分析、可接入产品的数据资产。
  • Data Modeling
  • Batch Replay
  • Traceability

03 / Data Engineering

数据工程与智能分析

我擅长把大量、杂乱、跨来源的数据做成分析系统:能查、能聚合、能聚类、能解释,最后能生成业务能看懂的结论。

我能解决的问题

当数据量大、表关系复杂、内容非结构化时,我能用列式数仓、空间数据库、向量检索和 LLM 摘要,把“数据堆”变成“决策工具”。

主系统案例

商业数据分析与洞察报告系统

这套系统把分散的商业数据、搜索词、用户反馈和派生指标收敛到可查询、可聚合、可解释的分析链路里。它不是单个报表,而是从数仓建模到聚类分析,再到自动报告输出的一整套管道。

完整链路
原始数据进入分析型数仓,经过派生表、交叉表、向量聚类和主题提炼,最终输出能被业务阅读的洞察报告。
体现能力
列式数仓建模、非结构化文本聚类、LLM 摘要、图表与 PDF 报告生成。
  • ClickHouse
  • UMAP / HDBSCAN
  • Data Pipeline

支撑能力片段

空间数据与向量分析

很多业务问题同时包含地理位置、用户文本和结构化指标。我会先把这些信息转成可计算的空间特征或向量特征,再交给数据库、聚类算法或模型做推理,而不是直接把原始数据扔给大模型。

完整链路
坐标纠偏、空间索引、空间实体密度计算、向量降维、密度聚类、样本抽取,最后形成可被报告系统消费的结构化上下文。
体现能力
把“看起来杂乱的数据”转成稳定特征,再进入分析系统或智能报告。
  • PostGIS
  • Vector Clustering
  • Feature Engineering

02 / Multimodal Pipeline

多模态与 AIGC 生产链路

我不把多模态当成“调一次 prompt”。我更关注如何把图片理解、风格配方、组图规划、视频提示词和异步生成服务串成一条可批量运行的生产线。

我能解决的问题

当团队要批量生成商品图、广告视频或内容素材时,我能把不稳定的模型 API 包装成有任务状态、重试、限流和结果回传的服务。

主系统案例

电商多模态素材生产系统

这不是单次 prompt 调试,而是一套从商品图输入到素材交付的生产链路。系统先理解商品与风格要求,再规划组图、关键帧、视频段落和生成任务,把素材生产拆成可批量运行的流程。

完整链路
商品图理解、风格配方解析、组图方案规划、关键帧提示词、生图/生视频任务、台词切分、视频备料导出。
体现能力
把 VLM 理解、Prompt 规划、异步生成服务和内容生产流程整合成一个可交付系统。
  • VLM
  • Prompt Planning
  • AIGC Pipeline

支撑能力片段

生成服务稳定化

生成模型 API 的不确定性很高:排队、限流、失败、返回格式变化都会影响业务。我的做法是把供应商差异封装在策略层,把任务状态、重试、限流和对象存储做成统一服务能力。

完整链路
统一 API 接入、任务排队、供应商策略选择、限流与退避、结果上传、状态回传。
体现能力
把不稳定的模型供应商接口包装成业务可以长期依赖的生产服务。
  • Strategy Pattern
  • Retry / Rate Limit
  • Object Storage

01 / Agent Systems

AI Agent 与工具系统

我关注 Agent 的运行时、状态、工具边界、质量评估和成本控制。模型很重要,但真正稳定的是运行时、协议、测试和恢复机制。

我能解决的问题

当 Agent 从 demo 进入真实业务,会遇到任务中断、工具幻觉、成本失控和错误恢复问题。我能把这些问题放进工程系统里处理。

主系统案例

有状态 Agent 工程体系

我更关注 Agent 从 demo 进入真实任务之后的问题:长任务会中断,工具调用会偏离,模型成本会失控,发布动作还需要安全边界。这个体系把运行时、模型分工、工具评测和人工确认放在同一条工程链路里。

完整链路
模型规划任务,运行时驱动有状态技能执行,中途保存 Checkpoint,必要时等待人工确认,失败后 Resume,发布前再经过评测和草稿流程。
体现能力
把 Agent 做成可中断、可恢复、可测试、可发布的工程系统,而不是一次性的工具调用。
  • Runtime
  • Checkpoint / Resume
  • Human-in-the-loop

支撑能力片段

模型分工与质量边界

Agent 系统不能只靠模型自信。我的做法是让强模型负责高层规划和关键验收,让执行模型处理本地修改和试错,再用真实测试、隐藏检查点和人工确认约束输出质量。

完整链路
任务卡、执行沙箱、本地测试、错误摘要、自动重试、多轮旅程评测、草稿优先发布。
体现能力
用程序反馈和流程边界降低模型不确定性,让 Agent 的结果有证据、有回退、有确认。
  • LLM Orchestration
  • Eval
  • Test Gate

05 / Product Delivery

全栈产品落地

我能把一个想法推进到用户能操作的界面:后端、数据库、前端、小程序、后台、权限、订单和运营闭环都能接起来。

我能解决的问题

很多项目不是算法难,而是缺少从产品逻辑到工程交付的完整推进。我能在早期快速搭出能跑的 MVP,也能继续补上稳定性和管理后台。

主系统案例

跨端业务产品交付系统

我做全栈不是只做一个页面或一个接口,而是把业务对象、用户端、管理端、后端服务、数据库状态和运营流程接起来。学习产品、电商小程序和内部后台,本质上都是把复杂流程做成用户能操作的系统。

完整链路
需求拆解、跨端前端、Go 后端、数据库设计、高频状态缓存、管理后台、订单/物流/推广归因等业务闭环。
体现能力
从早期 MVP 到可运营后台,把产品逻辑和工程稳定性一起推进。
  • Go
  • Uni-App / Vue3
  • PostgreSQL

支撑能力片段

状态流转与业务后台

全栈项目难点往往不在单个 CRUD,而在状态怎么推进、权限怎么约束、数据怎么回写、运营怎么追踪。我会把这些规则放进后端模型、缓存策略和管理后台里。

完整链路
角色权限、列表筛选、详情页、订单状态、学习状态、扫码来源、图片存储、外部接口对接。
体现能力
让业务流程从线下表格和人工沟通,变成可追踪、可操作、可持续迭代的系统。
  • RBAC
  • Redis Cache
  • Admin Console

06 / Scientific Computing

科学计算与生信产品化

我能把科研或命令行世界里的复杂工具链,变成普通用户可以运行、可以等待、可以看结果的产品。

我能解决的问题

复杂科学计算通常难在环境、依赖、数据格式和长任务管理。我能用 Docker、任务队列、Web UI 和报告系统把它封装起来。

主系统案例

古 DNA 计算产品体系

这个体系同时包含离线 Docker 镜像和在线分析平台。离线部分解决环境、依赖和数据格式问题;在线部分解决多人使用、任务排队、结果查询和可视化呈现问题。它体现的是把科研工具链产品化的能力。

完整链路
原始测序数据、比对分析、单倍群预测、格式转换、祖源计算、任务队列、向量检索、PCA/G25/ADMIXTOOLS 展示。
体现能力
把命令行科学计算封装成可交付容器,也能把高内存计算接入在线平台和可视化界面。
  • Docker
  • Bioinfo Pipeline
  • Web Platform

支撑能力片段

格式转换与结果报告

科学计算项目最后要面对普通用户。除了跑通工具链,我还会处理 BAM、芯片格式、祖源坐标、单倍群结论和报告模板之间的转换,让结果能被保存、比较和阅读。

完整链路
格式解析、坐标转换、结果归一、报告渲染、任务状态记录、分析资产打包。
体现能力
把科研输出从“工具跑完了”推进到“用户能理解、能下载、能复用”。
  • Data Format
  • Report
  • Visualization

07 / Infrastructure

基础设施与工程化

我喜欢给上层产品补齐底座:统一网关、队列、限流、监控、GPU 推理、降级和部署。没有这些,AI 和数据应用很难长期稳定。

我能解决的问题

当多个 AI 服务、内部工具和数据接口散落在不同端口和机器上,我能把它们收敛成可治理、可观测、可降级的系统。

主系统案例

AI 服务基础设施底座

AI 应用一旦进入实际使用,问题会变成:服务入口怎么统一、权限怎么收敛、上游密钥怎么管理、GPU 推理怎么分发、检索服务挂了怎么兜底。我做的是把这些底座能力集中起来。

完整链路
统一网关、服务路由、鉴权、调用记录、上游代理、多 GPU 推理分发、向量后处理、检索降级。
体现能力
让上层 AI 产品不直接暴露在分散服务和不稳定算力之上,而是通过可治理的基础设施运行。
  • Gateway
  • vLLM
  • Vector Search

支撑能力片段

高可用与任务治理

基础设施的价值在异常时最明显:某个上游慢、某张卡不可用、某个任务占用资源过久,都不能让整套系统失控。我会用队列、限流、降级和日志把风险留在基础设施层。

完整链路
任务排队、优先级、资源限流、GPU 优先、CPU 兜底、失败记录、可观测日志。
体现能力
在服务压力和硬件波动下,尽量保持系统可用、可恢复、可定位。
  • Rate Limit
  • Fallback
  • Queue
陕公网安备61011302002223号 | 陕ICP备2025083092号