主系统案例
外部平台数据接入系统
这个系统处理的是页面形态复杂、字段不稳定、结果需要长期复用的外部数据。重点不是“抓到一次”,而是把浏览器自动化、任务调度、清洗规则、异常恢复和结构化入库组织成一条稳定的数据入口。
- 完整链路
- 任务生成、页面交互、字段抽取、数据清洗、失败回放、入库校验,最后把原始内容变成后续分析系统可以直接使用的数据资产。
- 体现能力
- 浏览器自动化、会话隔离、频率控制、异常恢复、结构化入库和质量检查。
- Browser Automation
- ETL
- Data Quality
About
我是卫少东,也可以叫我 Ladydd。我的项目看起来横跨很多方向:爬虫、数据工程、多模态、AI Agent、生信、小程序、基础设施。但它们背后是同一种能力:快速理解一个领域,抽出数据结构和工作流,再用工程手段把它做成能持续运行的产品。
04 / Data Collection
我能把复杂网站和业务系统里的非标准数据,稳定采集、清洗、结构化,并接入后续分析链路。在这个方向上,我更强调通用工程能力:会话隔离、浏览器自动化、频率控制、异常恢复和数据入库。
当业务依赖外部平台数据,但页面变化、登录态、频率限制和非结构化内容让采集不稳定时,我能设计一套可维护的采集系统,而不是一次性的脚本。
主系统案例
这个系统处理的是页面形态复杂、字段不稳定、结果需要长期复用的外部数据。重点不是“抓到一次”,而是把浏览器自动化、任务调度、清洗规则、异常恢复和结构化入库组织成一条稳定的数据入口。
支撑能力片段
采集只是系统的第一步。更重要的是把原始数据、清洗结果和分析表分层保存,让后续的数仓、向量检索、空间计算和报告系统都能追溯来源、复用字段、稳定增量更新。
03 / Data Engineering
我擅长把大量、杂乱、跨来源的数据做成分析系统:能查、能聚合、能聚类、能解释,最后能生成业务能看懂的结论。
当数据量大、表关系复杂、内容非结构化时,我能用列式数仓、空间数据库、向量检索和 LLM 摘要,把“数据堆”变成“决策工具”。
主系统案例
这套系统把分散的商业数据、搜索词、用户反馈和派生指标收敛到可查询、可聚合、可解释的分析链路里。它不是单个报表,而是从数仓建模到聚类分析,再到自动报告输出的一整套管道。
支撑能力片段
很多业务问题同时包含地理位置、用户文本和结构化指标。我会先把这些信息转成可计算的空间特征或向量特征,再交给数据库、聚类算法或模型做推理,而不是直接把原始数据扔给大模型。
02 / Multimodal Pipeline
我不把多模态当成“调一次 prompt”。我更关注如何把图片理解、风格配方、组图规划、视频提示词和异步生成服务串成一条可批量运行的生产线。
当团队要批量生成商品图、广告视频或内容素材时,我能把不稳定的模型 API 包装成有任务状态、重试、限流和结果回传的服务。
主系统案例
这不是单次 prompt 调试,而是一套从商品图输入到素材交付的生产链路。系统先理解商品与风格要求,再规划组图、关键帧、视频段落和生成任务,把素材生产拆成可批量运行的流程。
支撑能力片段
生成模型 API 的不确定性很高:排队、限流、失败、返回格式变化都会影响业务。我的做法是把供应商差异封装在策略层,把任务状态、重试、限流和对象存储做成统一服务能力。
01 / Agent Systems
我关注 Agent 的运行时、状态、工具边界、质量评估和成本控制。模型很重要,但真正稳定的是运行时、协议、测试和恢复机制。
当 Agent 从 demo 进入真实业务,会遇到任务中断、工具幻觉、成本失控和错误恢复问题。我能把这些问题放进工程系统里处理。
主系统案例
我更关注 Agent 从 demo 进入真实任务之后的问题:长任务会中断,工具调用会偏离,模型成本会失控,发布动作还需要安全边界。这个体系把运行时、模型分工、工具评测和人工确认放在同一条工程链路里。
支撑能力片段
Agent 系统不能只靠模型自信。我的做法是让强模型负责高层规划和关键验收,让执行模型处理本地修改和试错,再用真实测试、隐藏检查点和人工确认约束输出质量。
05 / Product Delivery
我能把一个想法推进到用户能操作的界面:后端、数据库、前端、小程序、后台、权限、订单和运营闭环都能接起来。
很多项目不是算法难,而是缺少从产品逻辑到工程交付的完整推进。我能在早期快速搭出能跑的 MVP,也能继续补上稳定性和管理后台。
主系统案例
我做全栈不是只做一个页面或一个接口,而是把业务对象、用户端、管理端、后端服务、数据库状态和运营流程接起来。学习产品、电商小程序和内部后台,本质上都是把复杂流程做成用户能操作的系统。
支撑能力片段
全栈项目难点往往不在单个 CRUD,而在状态怎么推进、权限怎么约束、数据怎么回写、运营怎么追踪。我会把这些规则放进后端模型、缓存策略和管理后台里。
06 / Scientific Computing
我能把科研或命令行世界里的复杂工具链,变成普通用户可以运行、可以等待、可以看结果的产品。
复杂科学计算通常难在环境、依赖、数据格式和长任务管理。我能用 Docker、任务队列、Web UI 和报告系统把它封装起来。
主系统案例
这个体系同时包含离线 Docker 镜像和在线分析平台。离线部分解决环境、依赖和数据格式问题;在线部分解决多人使用、任务排队、结果查询和可视化呈现问题。它体现的是把科研工具链产品化的能力。
支撑能力片段
科学计算项目最后要面对普通用户。除了跑通工具链,我还会处理 BAM、芯片格式、祖源坐标、单倍群结论和报告模板之间的转换,让结果能被保存、比较和阅读。
07 / Infrastructure
我喜欢给上层产品补齐底座:统一网关、队列、限流、监控、GPU 推理、降级和部署。没有这些,AI 和数据应用很难长期稳定。
当多个 AI 服务、内部工具和数据接口散落在不同端口和机器上,我能把它们收敛成可治理、可观测、可降级的系统。
主系统案例
AI 应用一旦进入实际使用,问题会变成:服务入口怎么统一、权限怎么收敛、上游密钥怎么管理、GPU 推理怎么分发、检索服务挂了怎么兜底。我做的是把这些底座能力集中起来。
支撑能力片段
基础设施的价值在异常时最明显:某个上游慢、某张卡不可用、某个任务占用资源过久,都不能让整套系统失控。我会用队列、限流、降级和日志把风险留在基础设施层。
陕公网安备61011302002223号