大型AI训练数据集包含数百万条个人数据示例 -- A major AI training data set contains millions of examples of personal data
一项新研究发现,一个大型开源AI训练数据集中可能包含数百万张护照、信用卡、出生证明等包含个人身份信息的文件。研究人员在DataComp CommonPool数据集中发现了数千张可识别的面孔和身份文件,由于仅审计了0.1%的数据,估计实际包含个人信息的图像数量可能高达数亿。卡内基梅隆大学的AI伦理研究员William Agnew指出,任何上传到网络的内容都可能被爬取。
数学被诅咒了 -- The math is haunted
Lean是一种主要用于数学的编程语言,旨在将数学形式化为代码,使数学家能够将数学分解为结构、定理和证明,并在GitHub上共享。通过Lean,人类的大部分数学知识可能最终会以静态检查、可验证和可组合的代码形式存在。使用Lean时,数学定理的声明和证明过程类似于编程中的函数定义,展示了数学与编程的紧密联系。
Ollama现已推出原生前端聊天机器人 -- Ollama has a native front end chatbot now
Ollama推出了适用于macOS和Windows的新应用,支持下载并与模型聊天。新功能包括文件拖放处理、增加上下文长度以处理大文档、多模态支持(如图像处理)以及代码文件理解。用户可通过官网或GitHub下载体验。
Vibe代码已成遗留代码 -- Vibe code is legacy code
Vibe coding是一种由AI辅助的编程方式,开发者几乎忘记代码的存在。然而,这种代码往往难以理解,类似于“遗留代码”,增加了技术债务。虽然vibe coding适用于原型和一次性项目,但若需维护,这些代码将迅速成为负担。编程本质上是理论构建,而非单纯生成代码。
炒作即产品 -- The hype is the product
大型科技公司逐渐将关注点从客户转向股价,真正关心的是股东利益。决策者往往持有股票期权或与公司股价挂钩的奖金,导致产品只需勉强维持用户使用即可。垄断成为硅谷的商业模式,企业通过垄断地位确保用户粘性,而非依赖产品创新或质量。
编写内存高效的C语言结构体 -- Writing memory efficient C structs
在C语言中,结构体是组织数据的高效方式,但其内存布局需注意优化。通过合理排列字段,减少内存对齐带来的空间浪费,可以有效提升内存使用效率。例如,将布尔类型字段集中存放,或调整字段顺序以减少填充字节,从而缩小结构体整体大小。
我启动了17个副业项目。结果?我拥有了大量过期域名。 -- I launched 17 side projects. Result? I'm rich in expired domains
作者尝试了17个副业项目,但最终积累了大量过期域名。他提到自己常陷入购买域名、熬夜编码后失去兴趣的循环,有时甚至只停留在购买域名或创建任务板的阶段。尽管他意识到无需熬夜,但仍难以持续投入,尤其是面对家庭和全职工作的压力。
Rust 操作系统创建系列博客 -- Blog series on creating an OS in Rust
Philipp Oppermann的博客系列详细介绍了如何使用Rust编程语言从头开始构建一个小型操作系统。每篇文章都包含完整的代码教程,读者可以跟随学习。内容涵盖从创建不依赖标准库的Rust可执行文件到实现VGA文本模式等基础功能,所有源代码均可在GitHub仓库中找到。
伊利诺伊州大部分农田并非农民所有 -- Most Illinois farmland is not owned by farmers
汉斯·毕晓普在伊利诺伊州中部经营着一片与众不同的农场,种植羽衣甘蓝、辣椒、茄子和萝卜,直接供应给Whole Foods、当地餐馆和家庭。他受纪录片启发,放弃企业工作,投身可持续农业,十年间将农场扩大到80英亩。然而,由于营销耗时、依赖雇佣劳动且无法享受联邦补贴,他最终在父亲退休后接手了家族的大豆和谷物种植业务,结束了蔬菜农场。
Optician Sans – 基于历史视力表和视标的免费字体 -- Optician Sans – A free font based on historical eye charts and optotypes
Optician Sans是一款基于全球验光师使用的历史视力表和视标设计的免费字体,旨在让每个人都能体验验光师的角色,并补充了视力表字母的完整性。该字体以其独特的设计和与视力测试的关联而受到关注,被描述为“奇怪而美妙”且“优雅”。